开源模型

GPT-OSS 20B 20B

GPT-OSS 20B系列 · OpenAI · 2025-08发布

开源支持本地部署长上下文代码专用

模型介绍

OpenAI GPT-OSS 系列的轻量版本,仅需单张 RTX 4090 即可运行,兼顾性价比与推理能力,适合本地私有化部署与轻量 Agent 场景。

模型基础信息

模型系列GPT-OSS 20B系列
开发机构OpenAI
发布时间2025-08
参数规模20B(MoE,激活 3.6B)
上下文窗口128K
模型类型文本(纯文本推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源权重免费下载

免费规则详情

权重免费开源,自行部署;单张 RTX 4090 即可运行。

收费标准简介

开源权重免费;部署算力自付。

模型能力介绍

✅ 核心优势

  • 20B 小参数,单卡可跑
  • 激活参数仅 3.6B,推理高效
  • pache-2.0 完全开源
  • 适合端侧 / 私有化部署

⚠️ 短板与局限

  • 能力弱于 120B 旗舰版
  • 无官方托管 API
  • 复杂推理能力有限

🎯 适用场景

  • 个人本地大模型
  • 轻量 Agent 应用
  • 数据敏感场景私有化
  • 教学与科研

模型使用教程

本章节整理 GPT-OSS 20B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:[Hugging Face](https://huggingface.co/openai/gpt-oss-20b) 模型卡在线试玩,或本地部署后体验。
  • 能力简介:GPT-OSS 系列轻量版,单张 RTX 4090 可运行,适合本地私有化部署与轻量 Agent 场景。
  • 适用场景:个人本地大模型、轻量 Agent、数据敏感场景私有化、教学与科研。
  • 使用建议:追求能力选 120B;追求单卡部署与成本选 20B。
  • 开发接入:与 120B 相同,vLLM 起服务后用 OpenAI 兼容接口调用。
  1. 访问 [GitHub](https://github.com/openai/gpt-oss) 或 [Hugging Face](https://huggingface.co/openai/gpt-oss-20b)。
  2. 克隆权重仓库:
git lfs install
git clone https://huggingface.co/openai/gpt-oss-20b
  1. 环境要求:PyTorch 2.x + vLLM / SGLang,单卡显存 24GB 以上。

启动服务

pip install vllm
vllm serve openai/gpt-oss-20b --served-model-name gpt-oss-20b

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-oss-20b","messages":[{"role":"user","content":"用 Python 写一个快速排序"}],"reasoning_effort":"low"}'

Python 调用

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="gpt-oss-20b",
    messages=[{"role": "user", "content": "用 Python 写一个快速排序"}],
)
print(resp.choices[0].message.content)

> 提示:单卡部署建议使用 FP8 / AWQ 量化版本,速度与显存更优。

  • 部署方式:开源权重,支持 vLLM / SGLang / llama.cpp。
  • 硬件要求:单卡 RTX 4090(24GB)即可运行,量化后更低。
  • 端侧:可转 GGUF 后配合 llama.cpp / Ollama 使用。
  • 参考:官方 GitHub 提供推理与微调脚本。

💡 使用小技巧

如需更强推理请选 120B;20B 更侧重轻量部署与成本控制。

❓ 常见问题 FAQ

Q1:4090 能跑吗?

A1:可以,单张 RTX 4090 即可。

访问备注与注意事项