开源模型

NVIDIA Nemotron 3 Ultra 3 Ultra

Nemotron 3 Ultra系列 · NVIDIA · 2026-06发布

开源支持本地部署有免费额度长上下文代码专用

模型介绍

NVIDIA 旗舰开源权重模型,550B 总参 / 55B 激活,Hybrid Mamba-Attention + LatentMoE 架构,原生 1M 上下文,发布即附 NVFP4 量化权重,适合企业私有化部署。

模型基础信息

模型系列Nemotron 3 Ultra系列
开发机构NVIDIA
发布时间2026-06
参数规模550B(MoE,激活 55B)
上下文窗口1M
模型类型文本(推理)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

NVIDIA NIM 免费体验 权重开源

免费规则详情

build.nvidia.com 提供 NIM 免费体验;权重开源可自行部署。

收费标准简介

开源免费;NIM 云端按量计费。

模型能力介绍

✅ 核心优势

  • 1M 超长上下文
  • 混合 Mamba-Attention 高效推理
  • NVFP4 量化随附发布
  • 企业级私有化友好

⚠️ 短板与局限

  • 550B 部署成本高
  • 国内直连受限

🎯 适用场景

  • 企业私有化推理
  • 超长上下文 Agent
  • 科研与金融分析
  • NVIDIA 生态集成

模型使用教程

本章节整理 NVIDIA Nemotron 3 Ultra 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:<https://build.nvidia.com>(NVIDIA NIM 在线体验)或 [Hugging Face](https://huggingface.co/nvidia) 试玩。
  • 能力简介:NVIDIA 旗舰开源权重模型,550B 总参 / 55B 激活,Hybrid Mamba-Attention + LatentMoE,原生 1M 上下文。
  • 适用场景:企业私有化推理、超长上下文 Agent、科研与金融分析、NVIDIA 生态集成。
  • 使用建议:优先使用 NVFP4 量化版,可在较少的 GPU 上运行。
  • 开发接入:build.nvidia.com 提供 NIM 容器与 API。
  1. 访问 [build.nvidia.com](https://build.nvidia.com) 获取 NIM API Key(免费体验)。
  2. 或从 [Hugging Face](https://huggingface.co/nvidia/Nemotron-3-Ultra) 下载权重:
git lfs install
git clone https://huggingface.co/nvidia/Nemotron-3-Ultra
  1. 配置环境变量:
export NVIDIA_API_KEY=nvapi-xxxx

curl 示例

curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"nvidia/nemotron-3-ultra","messages":[{"role":"user","content":"你好,请自我介绍"}]}'

Python 示例

pip install openai
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://integrate.api.nvidia.com/v1")
resp = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra",
    messages=[{"role": "user", "content": "你好,请自我介绍"}],
)
print(resp.choices[0].message.content)

> 提示:本地部署可用 vLLM / SGLang,NVFP4 量化版显存更低。

  • 部署方式:开放权重,支持 vLLM / SGLang / NVIDIA NIM 容器部署。
  • 硬件要求:550B 总参,建议多卡 H100 / B200,NVFP4 量化显著降低显存。
  • 参考:NVIDIA GitHub 与 build.nvidia.com 提供部署指南。

💡 使用小技巧

优先使用 NVFP4 量化版,可在较少的 GPU 上运行。

❓ 常见问题 FAQ

Q1:和 Nemotron-3.5 系列关系?

A1:Ultra 为旗舰大模型,另有 Lightning 等变体。

访问备注与注意事项