开源模型

GPT-OSS 120B 120B

GPT-OSS 120B系列 · OpenAI · 2025-08发布

开源支持本地部署长上下文代码专用

模型介绍

OpenAI 推出的开放权重推理模型,采用 MoE 稀疏架构,100 万级上下文,性能对标 GPT-4o 级别,完全开源可商用,适配 H100 等专业推理硬件。

模型基础信息

模型系列GPT-OSS 120B系列
开发机构OpenAI
发布时间2025-08
参数规模120B(MoE,激活 5.1B)
上下文窗口128K
模型类型文本(纯文本推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源权重免费下载

免费规则详情

权重在 GitHub / Hugging Face 免费下载,自行部署运行,无内置 API 免费额度。

收费标准简介

开源权重免费;云端托管按部署算力计费(以各云厂商为准)。

模型能力介绍

✅ 核心优势

  • 开放权重,Apache-2.0 可商用
  • MoE 稀疏架构,激活参数少
  • 成本低
  • gent 与工具调用能力强
  • 1 万级指令微调数据随附发布

⚠️ 短板与局限

  • 无内置托管 API,需自行部署
  • 完整 120B 需多卡 H1
  • 国内直连 GitHub 下载不便

🎯 适用场景

  • 私有化推理服务
  • gent / 工具调用工作流
  • 企业内部大模型底座
  • 科研与微调实验

模型使用教程

本章节整理 GPT-OSS 120B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:OpenAI 未提供官方在线 Demo,可在 [Hugging Face](https://huggingface.co/openai/gpt-oss-120b) 查看模型卡并在线试玩,或通过 vLLM / SGLang 本地部署后体验。
  • 能力简介:OpenAI 首款开放权重推理模型,MoE 稀疏架构,128K 上下文,Agent 与工具调用能力强,性能对标 GPT-4o 级别。
  • 适用场景:私有化推理、Agent 工作流、企业内部大模型底座、科研与微调。
  • 使用建议:完整 120B 需多卡 H100;个人验证建议用 20B 版本或 FP8 量化版。
  • 开发接入:参考 GitHub 仓库的部署示例,或使用 OpenAI SDK 指向本地 OpenAI 兼容服务。
  1. 访问 [GitHub](https://github.com/openai/gpt-oss) 或 [Hugging Face](https://huggingface.co/openai/gpt-oss-120b) 下载权重。
  2. 权重较大,建议先 git lfs install 再拉取:
git lfs install
git clone https://huggingface.co/openai/gpt-oss-120b
  1. 准备推理环境:建议 PyTorch + vLLM 或 SGLang,多卡 H100 / A100。

启动 vLLM 服务

pip install vllm
vllm serve openai/gpt-oss-120b --served-model-name gpt-oss-120b

curl 调用(OpenAI 兼容)

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-oss-120b","messages":[{"role":"user","content":"你好,请自我介绍"}],"reasoning_effort":"medium"}'

Python 调用

pip install openai
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)

> 提示:GPT-OSS 支持 reasoning_effort 参数(none/low/medium/high)。

  • 部署方式:开源权重,支持 vLLM / SGLang / Transformers 部署。
  • 硬件要求:120B 需多卡 H100(80GB)或 A100(80GB)集群,建议 FP8/INT4 量化降低显存。
  • 单卡验证:预算有限建议部署 gpt-oss-20b(单卡 RTX 4090 可跑)。
  • 参考:官方 GitHub 提供 chat、chat-agentic 等脚本与部署文档。

💡 使用小技巧

单卡跑 120B 有压力,可优先使用 FP8 / 量化版或 20B 版本验证效果。

❓ 常见问题 FAQ

Q1:GPT-OSS 120B 免费吗?

A1:权重免费开源,部署算力自付。

Q2:支持本地部署吗?

A2:支持,需多卡 H100 等高规格 GPU。

访问备注与注意事项