NVIDIA Nemotron 3 Ultra 3 Ultra
Nemotron 3 Ultra系列 · NVIDIA · 2026-06发布
模型介绍
NVIDIA 旗舰开源权重模型,550B 总参 / 55B 激活,Hybrid Mamba-Attention + LatentMoE 架构,原生 1M 上下文,发布即附 NVFP4 量化权重,适合企业私有化部署。
模型基础信息
免费额度与收费政策
免费规则详情
build.nvidia.com 提供 NIM 免费体验;权重开源可自行部署。
收费标准简介
开源免费;NIM 云端按量计费。
模型能力介绍
✅ 核心优势
- 1M 超长上下文
- 混合 Mamba-Attention 高效推理
- NVFP4 量化随附发布
- 企业级私有化友好
⚠️ 短板与局限
- 550B 部署成本高
- 国内直连受限
🎯 适用场景
- 企业私有化推理
- 超长上下文 Agent
- 科研与金融分析
- NVIDIA 生态集成
模型使用教程
本章节整理 NVIDIA Nemotron 3 Ultra 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:<https://build.nvidia.com>(NVIDIA NIM 在线体验)或 [Hugging Face](https://huggingface.co/nvidia) 试玩。
- 能力简介:NVIDIA 旗舰开源权重模型,550B 总参 / 55B 激活,Hybrid Mamba-Attention + LatentMoE,原生 1M 上下文。
- 适用场景:企业私有化推理、超长上下文 Agent、科研与金融分析、NVIDIA 生态集成。
- 使用建议:优先使用 NVFP4 量化版,可在较少的 GPU 上运行。
- 开发接入:build.nvidia.com 提供 NIM 容器与 API。
- 访问 [build.nvidia.com](https://build.nvidia.com) 获取 NIM API Key(免费体验)。
- 或从 [Hugging Face](https://huggingface.co/nvidia/Nemotron-3-Ultra) 下载权重:
git lfs install
git clone https://huggingface.co/nvidia/Nemotron-3-Ultra
- 配置环境变量:
export NVIDIA_API_KEY=nvapi-xxxx
curl 示例
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"nvidia/nemotron-3-ultra","messages":[{"role":"user","content":"你好,请自我介绍"}]}'
Python 示例
pip install openai
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://integrate.api.nvidia.com/v1")
resp = client.chat.completions.create(
model="nvidia/nemotron-3-ultra",
messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)
> 提示:本地部署可用 vLLM / SGLang,NVFP4 量化版显存更低。
- 部署方式:开放权重,支持 vLLM / SGLang / NVIDIA NIM 容器部署。
- 硬件要求:550B 总参,建议多卡 H100 / B200,NVFP4 量化显著降低显存。
- 参考:NVIDIA GitHub 与 build.nvidia.com 提供部署指南。
💡 使用小技巧
优先使用 NVFP4 量化版,可在较少的 GPU 上运行。
❓ 常见问题 FAQ
Q1:和 Nemotron-3.5 系列关系?
A1:Ultra 为旗舰大模型,另有 Lightning 等变体。
访问备注与注意事项
- 2026-06-04 发布,20T token 预训练
Aitishiku.com