开源模型
GPT-OSS 20B 20B
GPT-OSS 20B系列 · OpenAI · 2025-08发布
模型介绍
OpenAI GPT-OSS 系列的轻量版本,仅需单张 RTX 4090 即可运行,兼顾性价比与推理能力,适合本地私有化部署与轻量 Agent 场景。
模型基础信息
模型系列GPT-OSS 20B系列
开发机构OpenAI
发布时间2025-08
参数规模20B(MoE,激活 3.6B)
上下文窗口128K
模型类型文本(纯文本推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源权重免费下载
免费规则详情
权重免费开源,自行部署;单张 RTX 4090 即可运行。
收费标准简介
开源权重免费;部署算力自付。
模型能力介绍
✅ 核心优势
- 20B 小参数,单卡可跑
- 激活参数仅 3.6B,推理高效
- pache-2.0 完全开源
- 适合端侧 / 私有化部署
⚠️ 短板与局限
- 能力弱于 120B 旗舰版
- 无官方托管 API
- 复杂推理能力有限
🎯 适用场景
- 个人本地大模型
- 轻量 Agent 应用
- 数据敏感场景私有化
- 教学与科研
模型使用教程
本章节整理 GPT-OSS 20B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:[Hugging Face](https://huggingface.co/openai/gpt-oss-20b) 模型卡在线试玩,或本地部署后体验。
- 能力简介:GPT-OSS 系列轻量版,单张 RTX 4090 可运行,适合本地私有化部署与轻量 Agent 场景。
- 适用场景:个人本地大模型、轻量 Agent、数据敏感场景私有化、教学与科研。
- 使用建议:追求能力选 120B;追求单卡部署与成本选 20B。
- 开发接入:与 120B 相同,vLLM 起服务后用 OpenAI 兼容接口调用。
- 访问 [GitHub](https://github.com/openai/gpt-oss) 或 [Hugging Face](https://huggingface.co/openai/gpt-oss-20b)。
- 克隆权重仓库:
git lfs install
git clone https://huggingface.co/openai/gpt-oss-20b
- 环境要求:PyTorch 2.x + vLLM / SGLang,单卡显存 24GB 以上。
启动服务
pip install vllm
vllm serve openai/gpt-oss-20b --served-model-name gpt-oss-20b
curl 调用
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"gpt-oss-20b","messages":[{"role":"user","content":"用 Python 写一个快速排序"}],"reasoning_effort":"low"}'
Python 调用
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="gpt-oss-20b",
messages=[{"role": "user", "content": "用 Python 写一个快速排序"}],
)
print(resp.choices[0].message.content)
> 提示:单卡部署建议使用 FP8 / AWQ 量化版本,速度与显存更优。
- 部署方式:开源权重,支持 vLLM / SGLang / llama.cpp。
- 硬件要求:单卡 RTX 4090(24GB)即可运行,量化后更低。
- 端侧:可转 GGUF 后配合 llama.cpp / Ollama 使用。
- 参考:官方 GitHub 提供推理与微调脚本。
💡 使用小技巧
如需更强推理请选 120B;20B 更侧重轻量部署与成本控制。
❓ 常见问题 FAQ
Q1:4090 能跑吗?
A1:可以,单张 RTX 4090 即可。
访问备注与注意事项
- 与 120B 同系列发布,主打单卡部署
Aitishiku.com