NVIDIA Cosmos 3 Super 3 Super
Cosmos 3 Super系列 · NVIDIA · 2026-06发布
模型介绍
NVIDIA 全球首款完全开放的全模态世界模型,64B 参数,原生理解与生成文本、图像、视频、环境音与动作,物理精度业界领先,面向 Physical AI。
模型基础信息
免费额度与收费政策
免费规则详情
权重开放免费下载,自行部署(需多卡 H200/H100)。
收费标准简介
开源免费;算力自备。
模型能力介绍
✅ 核心优势
- 全球首款全开放全模态世界模型
- 原生理解+生成多模态
- 物理精度业界领先
- 合成数据可训练策略模型
⚠️ 短板与局限
- 64B 部署门槛高
- 生成较耗时
- 国内直连受限
🎯 适用场景
- 机器人/自动驾驶合成数据
- 世界模拟
- 物理 AI 推理
- 策略模型训练
模型使用教程
本章节整理 NVIDIA Cosmos 3 Super 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:在 [build.nvidia.com](https://build.nvidia.com) 体验,或从 Hugging Face 下载开放权重。
- 能力简介:NVIDIA 全球首款完全开放的全模态世界模型,64B 参数,原生理解与生成文本、图像、视频、环境音与动作,物理精度业界领先。
- 适用场景:机器人 / 自动驾驶合成数据生成、世界模拟、物理 AI 推理与策略模型训练。
- 使用建议:视频默认支持 720p,最长可生成 400 帧;文本输入上限 256K tokens。
- 开发接入:Hugging Face Diffusers / vLLM-Omni 部署,或 NIM 微服务调用。
- 访问 [Hugging Face](https://huggingface.co/nvidia/Cosmos3-Super) 或 GitHub(nvidia/cosmos)下载。
- 可选下载 Image2Video / Text2Image 专用变体:
git lfs install
git clone https://huggingface.co/nvidia/Cosmos3-Super-Image2Video
- 推理环境建议安装
vllm-omni或 Hugging Face Diffusers。
启动 OpenAI 兼容服务
vllm-omni serve nvidia/Cosmos3-Super --served-model-name cosmos-3-super \
--cfg-parallel-size 2 --ulysses-degree 4 --use-hsdp --hsdp-shard-size 8 --port 8000
文生视频
curl http://localhost:8000/v1/videos \
-H "Content-Type: application/json" \
-d '{"model":"cosmos-3-super","prompt":"一辆自动驾驶汽车在雨天十字路口通行","num_frames":189,"fps":24}'
> 提示:8×H200 上 50 步视频生成约 55 秒;文本转图像使用 /v1/images/generations。
- 部署方式:开放权重(NVIDIA 许可),支持 vLLM-Omni、Diffusers、NVIDIA NIM。
- 硬件要求:64B 模型建议 8×H200 / 8×H100;2×H200 也可运行(生成约 3 分钟/段)。
- 参考:GitHub(nvidia/cosmos)提供部署、后训练与合成数据生成脚本。
💡 使用小技巧
视频默认 720p,最长 400 帧;文本输入上限 256K tokens;用 vllm-omni 部署。
❓ 常见问题 FAQ
Q1:支持哪些模态?
A1:文本、图像、视频、环境音与动作。
Q2:硬件要求?
A2:建议 8×H200/H100,2×H200 亦可运行。
访问备注与注意事项
- 2026-06-01 在 GTC Taipei 发布,含 Cosmos3-Nano(16B) 与 Super(64B)
Aitishiku.com