# 英伟达 Cosmos 3

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：tosh
- 发布时间：2026-06-02 00:57
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpvgjmbt06ozsl0zco9f2kwl
- 原文链接：https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3

## 精选理由

Cosmos 3 把物理推理、世界生成和行动生成塞进一个开源模型，从机器人到自动驾驶都能用，英伟达这次是真的想定义物理 AI 的训练范式。

## AI 摘要

英伟达发布了 Cosmos 3，这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客，发布日期为 2026 年 6 月 1 日。

## 正文

物理 AI 系统必须先理解真实世界，才能在其中行动。机器人、自动驾驶车辆和智能空间需要理解其环境中正在发生什么，预测接下来可能发生什么，并为特定环境、具身形态和任务生成动作。

NVIDIA Cosmos 3 是面向物理 AI 的前沿基础模型，它将物理推理、世界生成和动作生成整合在单个开放模型中。

NVIDIA 正在开源 Cosmos 3 模型、训练脚本、部署工具和数据集，使物理 AI 开发更加开放和可复现。这篇博文涵盖了 Cosmos 3 的基础知识，重点介绍了技术报告中的关键概念，引导读者了解技术工作流程，并展示了构建机器人操控系统、自动驾驶车辆和仓库监控解决方案的团队如何快速上手。

图 1. Cosmos 3 为自动驾驶领域生成的一段视频片段

图 2. 使用 Cosmos 3 为仓库安全数据生成的视频

本次发布的主要亮点包括：

Hugging Face 上的 NVIDIA Cosmos 3 Nano 和 NVIDIA Cosmos 3 Super 模型检查点，代码托管在 GitHub 上。

面向机器人技术和自动驾驶等物理 AI 应用场景的开放数据集。

用于将 Cosmos 3 适配到您所在领域的开放后训练脚本。

Cosmos NIM 微服务，可在 NVIDIA GPU 上轻松实现优化部署。

Cosmos 3 的新特性

之前的 Cosmos 版本将世界生成、物理理解和受控场景生成分离到不同的模型和工作流程中。本次发布通过基于双塔架构的混合 Transformer（MoT）架构将这些能力统一起来。

推理器塔：一个视觉语言模型（VLM），用于解读图像、视频和文本等多模态观测数据。该塔采用自回归架构来解读输入，并理解运动、物体交互及其他物理上下文。它充当“大脑”的角色，在任何生成发生之前先对世界进行推理。

生成器塔：生成未来观测结果和动作序列。该塔采用基于扩散模型的过程，生成符合物理规律的视频和动作输出，这些输出以推理器塔的理解为条件。推理器可以独立调用，但生成器始终同时激活两个塔以实现引导式生成。

图 3. Cosmos 3 架构

这种架构使单个模型能够同时执行推理和生成任务，通过消除多个模型和推理流程之间的编排工作，简化了开发过程。

选择合适的模型规模

目前提供两种 Cosmos 3 模型：

Cosmos 3 Nano 是紧凑版本，拥有 160 亿参数，针对高效推理进行了优化。它设计用于在工作站级计算设备上运行，例如 NVIDIA RTX PRO 6000 GPU，适用于实时机器人推理和物理 AI 应用。

Cosmos 3 Super 是一个 640 亿参数的模型，专为实现最高质量和能力而设计。它提供了最高的基准测试分数，并针对在 NVIDIA Hopper 和 NVIDIA Blackwell GPU 上的数据中心部署，使其适用于大规模合成数据生成和高级物理推理工作负载。

支持的模态

Cosmos 3 通过其统一架构支持以下输入和输出模态：

媒体内容 · 前往原文查看

输入输出应用

文本图像符合物理规律的图像生成

文本 | 视频视频用于罕见边缘情况视频数据生成的世界模型

文本 | 图像视频用于预测的世界模型

文本 | 图像 | 视频文本用于推理的视觉语言模型（VLM）

动作 | 视频 | 文本视频动作条件世界模型

视频 | 文本视频 | 动作世界动作模型、视频动作模型、视觉语言动作模型、用于机器人学习的策略模型

表 1. Cosmos 3 针对不同应用所支持的输入和输出模态

面向物理 AI 的开放数据集

随着 Cosmos 3 的发布，NVIDIA 正在 Hugging Face 上开源合成数据生成（SDG）数据集。这些数据集涵盖机器人技术、物理仿真、人体运动、驾驶和仓库环境，可用于对 Cosmos 3 及其他模型进行后训练：

物理 AI 世界模型合成数据集包括：

具身机器人场景

物理交互场景

数字人场景

自动驾驶场景

仓库操作场景

图 4. 具身机器人场景数据集中的操作示例

图 5. 物理交互场景数据集中的示例

图 6. 数字人场景数据集中的示例

图 7. 自动驾驶场景数据集中的示例

图 8. 仓库操作场景数据集中的示例

NVIDIA Cosmos 人工评估基准

NVIDIA Cosmos 人工评估（HUE）框架用于评估 Cosmos 3 生成器在代表性领域任务中的质量。

随着 SOTA 视频生成模型在现有自动化排行榜上趋于饱和，不同版本之间的分数差异往往过小，难以进行有意义的比较。HUE 将评估从主观评分转向客观事实验证，从而能够对顶级模型进行细粒度比较。其结果是，在完整人工评估的支持下，无论是快速迭代还是严格的发布决策，都能获得更可靠的质量信号。

HUE 使用原子化二元验证来评估视频生成质量。每个生成的视频被分解为单一事实的“是/否”问题，涵盖四个维度——语义对齐、物理定律、几何推理和视觉完整性——并跨越七个物理 AI 领域，包括机器人、自动驾驶汽车和物理学。这些问题由 VLM 流程生成，经人类专家优化，并在 Hugging Face 上以开源形式发布。

基准测试结果

Cosmos 3 已在多个基准测试套件上进行了评估，涵盖物理 AI 推理、生成质量和特定领域性能。

推理基准

Cosmos 3 Super 和 Cosmos 3 Nano 分别在 32B 级别和 8B 级别上领先 VANTAGE-Bench：

VANTAGE-Bench：首个用于评估视觉语言模型在仓库、交通和智能空间等真实世界固定摄像头画面上的公开基准。

交通异常推理（TAR）：用于检测和推理交通画面中异常事件的新排行榜，也是 AI City Challenge 2026 Track 3 的官方排行榜。

生成器基准

Cosmos 3 是开源 SOTA 模型，目前在公开排行榜上领先 PAI-Bench、R-Bench Physics-IQ 和 RoboLab。

Artificial Analysis：一个对文本、图像和视频生成的 AI 模型进行排名的基准测试平台。Cosmos 3 在文生图排行榜和图生视频（无音频）排行榜上均处于领先地位的开源模型。

R-Bench：一个用于评估机器人视频生成中基于视频的世界模型的基准测试。它通过结构一致性、物理合理性和执行完整性等子指标来评估任务完成度和视觉质量。

PAI-Bench：一个统一的基准测试，用于评估跨视频理解和视频生成的物理 AI，涵盖机器人技术、自动驾驶汽车和物理常识等领域。

Physics-IQ：一个由真实世界视频组成的基准测试，用于检验生成式视频模型是否真正理解物理原理，而不仅仅是实现视觉真实感。

RoboLab：一个用于评估任务通用型机器人策略的模拟基准测试。

训练配方

Cosmos 3 版本发布的一个核心组成部分是一套完全开源的训练配方。除了模型检查点，本次发布还提供了用于将 Cosmos 3 适配到新领域、新具身形态和新数据集的代码、配置和工作流程。

监督微调后训练

监督微调使开发者能够将 Cosmos 3 模型适配到他们自己的数据上。发布的配方包括针对自定义视频数据集的视觉生成后训练，以及面向机器人和物理 AI 工作流程的动作导向型配方。开发者可以在机器人技术、自动驾驶和仓储自动化等目标领域定制 Cosmos 3。

后训练代码和配置已在 GitHub 上提供。

动作后训练

动作后训练将 Cosmos 3 适配到具有动作感知能力的物理 AI 应用中，包括前向动力学、逆向动力学和策略生成。开发者可以在带有动作标签的数据上对 Cosmos 3 进行后训练。对于机器人应用，这包括几个重要的工作流程：根据机器人动作生成未来观测结果、推断观测到的演示背后的动作，以及根据当前观测结果和任务提示预测动作序列。这使得 Cosmos 3 成为世界动作建模和策略学习的坚实基础。

媒体内容 · 前往原文查看

视频 1. 教程视频，演示如何对 Cosmos 3 进行后训练

使用 NVIDIA NIM 微服务进行部署

Cosmos 3 模型也可作为 NVIDIA NIM 微服务提供，用于优化且可投入生产的部署。NIM 微服务将模型与优化后的推理运行时打包在一起，无需手动调整服务基础设施即可提供高性能。与更适合后训练工作流的 GitHub 上的 Cosmos 3 仓库相比，NIM 微服务在推理工作流中更易于使用。

Cosmos 3 Reasoner NIM 现已可用，提供 Cosmos 3 模型的推理能力。请持续关注 Cosmos 3 Generator NIM，它将提供 Cosmos 3 模型的完整生成能力。

为加速推理而进行的优化

量化：Cosmos 3 NIM 支持选择 BF16、FP8 或 NVFP4 量化检查点。NVFP4 量化将模型的数值精度从 BF16 降低到 4 位浮点数，推理速度最高可提升 2 倍。

vLLM：这是一个开源推理引擎，采用连续批处理、分页注意力（paged attention）和张量并行等技术来高效服务大语言模型。Cosmos 3 Reasoner NIM 的服务栈基于 vLLM 构建，与传统服务方法相比可实现更高吞吐量。Cosmos 3 Nano 已准备好与 vLLM-omni 和 NVIDIA Dynamo 配合运行，以获得顶级性能。

高效视频采样（EVS）：该技术减少了推理期间输入视觉语言模型（VLM）的视频 token 数量，从而加速 Cosmos Reason NIM。EVS 在块级别工作，保留每帧中最独特的块，并修剪其余部分。较小的 GPU 通常更能从该技术中受益。

如何运行 NIM

需要 NVIDIA NGC API 密钥才能从 NGC 拉取容器并下载 Cosmos 3 模型。

拉取并运行 Cosmos 3 Nano Reasoner NIM。对于 Cosmos 3 Super Reasoner NIM，请指定 NIM_MODEL_SIZE=super。

docker run --gpus=all \ -e NGC_API_KEY=$NGC_API_KEY \ -e NIM_MODEL_SIZE=nano \ -p 8000:8000 \ nvcr.io/nim/nvidia/cosmos3-reasoner:latest

有关 API 用法及更多详细信息，请参阅文档。

媒体内容 · 前往原文查看

视频 2. 教程视频，演示如何使用 Cosmos Reasoner NIM

在 Hugging Face 上下载 Cosmos 3 Nano 和 Super 检查点。

在 Cosmos 3 GitHub 上查找示例和代码。

体验 Cosmos 3 Nano Reasoner 模型以及 Cosmos 3 Nano 模型。

加入社区，在 GitHub 和 Discord 上提交 issue，并为 Cosmos 生态系统做出贡献。

致谢

Cosmos 3 是英伟达内部众多团队与个人通力协作的成果，参与人员包括：Aditi、Niket Agarwal、Arslan Ali、Jon Allen、Martin Antolini、Adeline Aubame、Alisson Azzolini、Junjie Bai、Maciej Bala、Yogesh Balaji、Josh Bapst、Aarti Basant、Mukesh Beladiya、Mohammad Qazim Bhat、Zaid Pervaiz Bhat、Dan Blick、Vanni Brighella、Han Cai、Tiffany Cai、Eric Cameracci、Jiaxin Cao、Yulong Cao、Mark Carlson、Carlos Casanova、Ting-Yun Chang、Yan Chang、Yu-Wei Chao、Prithvijit Chattopadhyay、Roshan Chaudhari、Chieh-Yun Chen、Junyu Chen、Ke Chen、Qizhi Chen、Wenkai Chen、Xiaotong Chen、Yu Chen、An-Chieh Cheng、Click Cheng、Xiu Chia、Jeana Choi、Chaeyeon Chung、Wenyan Cong、Yin Cui、Magdalena Dadela、Nalin Dadhich、Wenliang Dai、Joyjit Daw、Alperen Degirmenci、Rodrigo Vieira Del Monte、Robert Denomme、Sameer Dharur、Marco Di Lucca、Ke Ding、Wenhao Ding、Yifan Ding、Yuzhu Dong、Nicole Drumheller、Yilun Du、Aigul Dzhumamuratova、Aleksandr Efitorov、Hamid Eghbalzadeh、Naomi Eigbe、Imad El Hanafi、Hassan Eslami、Benedikt Falk、Jiaojiao Fan、Jim Fan、Amol Fasale、Sergiy Fefilatyev、Liang Feng、Francesco Ferroni、Sanja Fidler、Xiao Fu、Vikram Fugro、Prashant Gaikwad、TJ Galda、Katelyn Gao、Yihuai Gao、Wenhang Ge、Sreyan Ghosh、Arushi Goel、Vivek Goel、Akash Gokul、Rama Govindaraju、Jinwei Gu、Miguel Guerrero、Elfie Guo、Aryaman Gupta、Siddharth Gururani、Hugo Hadfield、Song Han、Ankur Handa、Zekun Hao、Mohammad Harrim、Ali Hassani、Nathan Hayes-Roth、Yufan He、Chris Helvig、Cyrus Hogg、Madison Huang、Michael Huang、Sophia Huang、Yufan Huang、Jacob Huffman、DeLesley Hutchins、Suneel Indupuru、Boris Ivanovic、Arihant Jain、Joel Jang、Ryan Ji、Yanan Jian、Dongfu Jiang、Jingyi Jin、Atharva Joshi、Nikhilesh Joshi、Pranjali Joshi、Jaehun Jung、Weiwei Kang、Scott Kassekert、Jan Kautz、Ashna Khetan、Julia Kiczka、Slawek Kierat、Gwanghyun Kim、Kuno Kim、Sunny Kim、Kezhi Kong、Xin Kong、Zhifeng Kong、Tomasz Kornuta、Egor Krivov、Hui Kuang、Saurav Kumar、Chia-Wen Kuo、George Kurian、Wojciech Kutak、JF Lafleche、Himangshu Lahkar、Omar Laymoun、Jayjun Lee、Sanggil Lee、Gabriele Leone、Boyi Li、Freya Li、Jiajun Li、Jinfeng Li、Ling Li、Pengcheng Li、Shangru Li、Tingle Li、Xiaolong Li、Xuan Li、Zhaoshuo Li、Zhiqi Li、Hao Liang、Maosheng Liao、Chen-Hsuan Lin、Tsung-Yi Lin、Ming-Yu Liu、Sifei Liu、Zihan Liu、Hai Loc Lu、Xiangyu Lu、Alice Luo、Ruipu Luo、Wenjie Luo、Jiangran Lyu、Martin Ding Ma、Nic Ma、Qianli Ma、Dawid Majchrowski、Louis Marcoux、Miguel Martin、Qing Miao、Ashkan Mirzaei、Shreyas Misra、Kaichun Mo、Durra Mohsin、Hyejin Moon、Pawel Morkisz、Saeid Motiian、Kirill Motkov、Seungjun Nah、Yashraj Narang、Deepak Narayanan、Thabang Ngazimbi、Julian Ouyang、David Page、Yatian Pang、Sehwi Park、Mahesh Patekar、Mostofa Patwary、Marco Pavone、Trung Pham、Wei Ping、Soha Pouya、Shrimai Prabhumoye、Varun Praveen、Delin Qu、Hesam Rabeti、Morteza Ramezanali、Marilyn Reeb、Xuanchi Ren、Kristen Rumley、Wojciech Rymer、Jun Saito、Yeongho Seol、John Shao、Piyush Shekdar、Tianwei Shen、Humphrey Shi、Min Shi、Stella Shi、Kevin Shih、Mohammad Shoeybi、Mateusz Sieniawski、Shuran Song、Alexander Sotelo、Amir Sotoodeh、Sunil Srinivasa、Vignesh Srinivasakumar、Bartosz Stefaniak、Rahul Heinrich Steiger、Shangkun Sun、Jiaxiang Tang、Shitao Tang、Yangyang Tang、Yue Tang、Tolou Tavakkoli、Kayley Ting、Krzysztof Tomala、Wei-Cheng Tseng、Jibin Varghese、Sergei Vasilev、Thomas Volk、Raju Wagwani、Roger Waleffe、Andrew Z. Wang、Boxiang Wang、Haoxiang Wang、Qiao Wang、Shihao Wang、Shijie Wang、Ting-Chun Wang、Yan Wang、Yu Wang、David Wehr、Fangyin Wei、Xinshuo Weng、Jay Zhangjie Wu、Kedi Wu、Hongchi Xia、Summer Xiao、Tianjun Xiao、Kevin Xie、Daguang Xu、Jiashu Xu、Mengyao Xu、Ruqing Xu、Xingqian Xu、Yao Xu、Dinghao Yang、Dong Yang、Hans Yang、Xiaodong Yang、Xuning Yang、Yichu Yang、Yurong You、Zhiding Yu、Hao Yuan、Simon Yuen、Xiaohui Zeng、Pengcuo Zeren、Cindy Zha、Haotian Zhang、Jenny Zhang、Jing Zhang、Liangkai Zhang、Paris Zhang、Shun Zhang、Xuanmeng Zhang、Zhizheng Zhang、Ann Zhao、Yilin Zhao、Yuliya Zhautouskaya、Charles Zhou、Fengzhe Zhou、Shilin Zhu、Yuke Zhu、Dima Zhylko 以及 Artur Zolkowski。
