开源模型

NVIDIA Nemotron 3.5 Lightning 3.5 Lightning

Nemotron 3.5 Lightning系列 · NVIDIA · 2026-08发布

开源支持本地部署有免费额度长上下文代码专用

模型介绍

NVIDIA 开源的 30B MoE(3B 激活)模型,混合 Mamba+Attention 架构,专为长跑 Agent 与高频执行优化,输出速度最高提升 4 倍,权重/数据/配方全部开放。

模型基础信息

模型系列Nemotron 3.5 Lightning系列
开发机构NVIDIA
发布时间2026-08
参数规模30B(MoE,激活 3B)
上下文窗口1M(NVFP4 版)
模型类型文本(MoE Agent)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

NIM 免费体验 Ollama 开源

免费规则详情

build.nvidia.com 提供 NIM 免费体验;Ollama 一键运行;权重开放。

收费标准简介

开源权重免费;NIM 云端按量计费。

模型能力介绍

✅ 核心优势

  • 3B 激活,延迟极低
  • 输出速度提升最高 4 倍
  • NVFP4 版支持 1M 上下文
  • 权重/数据/配方全开放

⚠️ 短板与局限

  • 总参数较小,极限推理有限
  • 生态较新

🎯 适用场景

  • 常驻 Agent
  • 子代理工作负载
  • 本地低延迟推理
  • 智能体编排

模型使用教程

本章节整理 NVIDIA Nemotron 3.5 Lightning 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:通过 [build.nvidia.com](https://build.nvidia.com) 或 [OpenRouter](https://openrouter.ai) 在线体验。
  • 能力简介:NVIDIA 开源的 30B MoE(3B 激活)模型,混合 Mamba+Attention 架构,专为长跑 Agent 与高频执行优化,输出速度提升最高 4 倍。
  • 适用场景:常驻 Agent、子代理工作负载、本地低延迟推理、智能体编排。
  • 使用建议:推荐采样 temperature=1.0、top_p=0.95;配合 DSpark 投机解码提速。
  • 开发接入:API / NIM / Ollama 多入口,权重与训练数据全部开放。
  1. 从 [Hugging Face](https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4) 或 ModelScope 下载。
  2. 本地体验最简单的方式:
ollama run nemotron-3.5-lightning
  1. 许可为 OpenMDW-1.1,权重/数据/配方全部开放。

vLLM 启动

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --served-model-name nemotron-3.5-lightning --port 8000

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"nemotron-3.5-lightning","temperature":1.0,"top_p":0.95,"messages":[{"role":"user","content":"整理这批工单并生成摘要"}]}'

> 提示:NVFP4 版支持 1M 上下文;DSpark 投机解码可显著降低延迟。

  • 部署方式:支持 vLLM、Ollama、llama.cpp、LM Studio、TRT-LLM。
  • 硬件要求:单卡 DGX Spark(GB10)或单张 H100 即可运行;RTX 5090 消费级亦可。
  • 推荐配置:DGX Spark / 低并发交互场景使用 vLLM + DSpark(num_speculative_tokens=3);高吞吐批处理使用默认 humming 后端。
  • 参考:NVIDIA 技术博客与 build.nvidia.com 提供完整教程。

💡 使用小技巧

推荐 temperature=1.0、top_p=0.95;配合 DSpark 投机解码提速(num_speculative_tokens=3)。

❓ 常见问题 FAQ

Q1:单卡能跑吗?

A1:单卡 DGX Spark 或单张 H100 即可,RTX 5090 亦可。

Q2:许可?

A2:OpenMDW-1.1,权重/数据/配方全部开放。

访问备注与注意事项