NVIDIA Nemotron 3.5 Lightning 3.5 Lightning
Nemotron 3.5 Lightning系列 · NVIDIA · 2026-08发布
模型介绍
NVIDIA 开源的 30B MoE(3B 激活)模型,混合 Mamba+Attention 架构,专为长跑 Agent 与高频执行优化,输出速度最高提升 4 倍,权重/数据/配方全部开放。
模型基础信息
免费额度与收费政策
免费规则详情
build.nvidia.com 提供 NIM 免费体验;Ollama 一键运行;权重开放。
收费标准简介
开源权重免费;NIM 云端按量计费。
模型能力介绍
✅ 核心优势
- 3B 激活,延迟极低
- 输出速度提升最高 4 倍
- NVFP4 版支持 1M 上下文
- 权重/数据/配方全开放
⚠️ 短板与局限
- 总参数较小,极限推理有限
- 生态较新
🎯 适用场景
- 常驻 Agent
- 子代理工作负载
- 本地低延迟推理
- 智能体编排
模型使用教程
本章节整理 NVIDIA Nemotron 3.5 Lightning 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:通过 [build.nvidia.com](https://build.nvidia.com) 或 [OpenRouter](https://openrouter.ai) 在线体验。
- 能力简介:NVIDIA 开源的 30B MoE(3B 激活)模型,混合 Mamba+Attention 架构,专为长跑 Agent 与高频执行优化,输出速度提升最高 4 倍。
- 适用场景:常驻 Agent、子代理工作负载、本地低延迟推理、智能体编排。
- 使用建议:推荐采样 temperature=1.0、top_p=0.95;配合 DSpark 投机解码提速。
- 开发接入:API / NIM / Ollama 多入口,权重与训练数据全部开放。
- 从 [Hugging Face](https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4) 或 ModelScope 下载。
- 本地体验最简单的方式:
ollama run nemotron-3.5-lightning
- 许可为 OpenMDW-1.1,权重/数据/配方全部开放。
vLLM 启动
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--served-model-name nemotron-3.5-lightning --port 8000
curl 调用
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"nemotron-3.5-lightning","temperature":1.0,"top_p":0.95,"messages":[{"role":"user","content":"整理这批工单并生成摘要"}]}'
> 提示:NVFP4 版支持 1M 上下文;DSpark 投机解码可显著降低延迟。
- 部署方式:支持 vLLM、Ollama、llama.cpp、LM Studio、TRT-LLM。
- 硬件要求:单卡 DGX Spark(GB10)或单张 H100 即可运行;RTX 5090 消费级亦可。
- 推荐配置:DGX Spark / 低并发交互场景使用 vLLM + DSpark(num_speculative_tokens=3);高吞吐批处理使用默认 humming 后端。
- 参考:NVIDIA 技术博客与 build.nvidia.com 提供完整教程。
💡 使用小技巧
推荐 temperature=1.0、top_p=0.95;配合 DSpark 投机解码提速(num_speculative_tokens=3)。
❓ 常见问题 FAQ
Q1:单卡能跑吗?
A1:单卡 DGX Spark 或单张 H100 即可,RTX 5090 亦可。
Q2:许可?
A2:OpenMDW-1.1,权重/数据/配方全部开放。
访问备注与注意事项
- 2026-08-11 发布,随 NVIDIA NeMo Switchyard 智能路由库一同推出
Aitishiku.com