开源模型

NVIDIA Cosmos 3 Super 3 Super

Cosmos 3 Super系列 · NVIDIA · 2026-06发布

开源支持本地部署多模态长上下文

模型介绍

NVIDIA 全球首款完全开放的全模态世界模型,64B 参数,原生理解与生成文本、图像、视频、环境音与动作,物理精度业界领先,面向 Physical AI。

模型基础信息

模型系列Cosmos 3 Super系列
开发机构NVIDIA
发布时间2026-06
参数规模64B
上下文窗口文本 256K / 视频 400 帧
模型类型多模态(全模态世界模型)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源权重免费

免费规则详情

权重开放免费下载,自行部署(需多卡 H200/H100)。

收费标准简介

开源免费;算力自备。

模型能力介绍

✅ 核心优势

  • 全球首款全开放全模态世界模型
  • 原生理解+生成多模态
  • 物理精度业界领先
  • 合成数据可训练策略模型

⚠️ 短板与局限

  • 64B 部署门槛高
  • 生成较耗时
  • 国内直连受限

🎯 适用场景

  • 机器人/自动驾驶合成数据
  • 世界模拟
  • 物理 AI 推理
  • 策略模型训练

模型使用教程

本章节整理 NVIDIA Cosmos 3 Super 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:在 [build.nvidia.com](https://build.nvidia.com) 体验,或从 Hugging Face 下载开放权重。
  • 能力简介:NVIDIA 全球首款完全开放的全模态世界模型,64B 参数,原生理解与生成文本、图像、视频、环境音与动作,物理精度业界领先。
  • 适用场景:机器人 / 自动驾驶合成数据生成、世界模拟、物理 AI 推理与策略模型训练。
  • 使用建议:视频默认支持 720p,最长可生成 400 帧;文本输入上限 256K tokens。
  • 开发接入:Hugging Face Diffusers / vLLM-Omni 部署,或 NIM 微服务调用。
  1. 访问 [Hugging Face](https://huggingface.co/nvidia/Cosmos3-Super) 或 GitHub(nvidia/cosmos)下载。
  2. 可选下载 Image2Video / Text2Image 专用变体:
git lfs install
git clone https://huggingface.co/nvidia/Cosmos3-Super-Image2Video
  1. 推理环境建议安装 vllm-omni 或 Hugging Face Diffusers。

启动 OpenAI 兼容服务

vllm-omni serve nvidia/Cosmos3-Super --served-model-name cosmos-3-super \
  --cfg-parallel-size 2 --ulysses-degree 4 --use-hsdp --hsdp-shard-size 8 --port 8000

文生视频

curl http://localhost:8000/v1/videos \
  -H "Content-Type: application/json" \
  -d '{"model":"cosmos-3-super","prompt":"一辆自动驾驶汽车在雨天十字路口通行","num_frames":189,"fps":24}'

> 提示:8×H200 上 50 步视频生成约 55 秒;文本转图像使用 /v1/images/generations

  • 部署方式:开放权重(NVIDIA 许可),支持 vLLM-Omni、Diffusers、NVIDIA NIM。
  • 硬件要求:64B 模型建议 8×H200 / 8×H100;2×H200 也可运行(生成约 3 分钟/段)。
  • 参考:GitHub(nvidia/cosmos)提供部署、后训练与合成数据生成脚本。

💡 使用小技巧

视频默认 720p,最长 400 帧;文本输入上限 256K tokens;用 vllm-omni 部署。

❓ 常见问题 FAQ

Q1:支持哪些模态?

A1:文本、图像、视频、环境音与动作。

Q2:硬件要求?

A2:建议 8×H200/H100,2×H200 亦可运行。

访问备注与注意事项