真实世界广阔无垠,物理 AI 系统要在其中运作,就必须理解场景如何变化、预判接下来可能发生什么,并确定某个动作将如何影响世界。机器在工厂、仓库、医院等边缘环境中运行。要在这些环境中理解并采取行动,它们需要能在内存受限的系统上提供数据中心级性能的模型。
今天,我们在 Hugging Face 的 Cosmos 3 仓库中发布了 NVIDIA Cosmos 3 Edge。这是一个 40 亿参数的开源世界模型,可帮助机器人和视觉 AI 智能体理解周围环境、实时推理,并在边缘设备上生成机器人动作。
下载模型:https://huggingface.co/nvidia/Cosmos3-Edge
该模型在 NVIDIA 边缘计算机上实现了内存高效、高吞吐量的推理,支持的设备包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU,以及包含新发布的 Jetson T2000 和 T3000 模块在内的 NVIDIA Jetson 系列。
该模型被设计为紧凑型开源模型,可作为小型视觉语言模型(VLM)使用,具备同类最佳吞吐量和精度,支持实时推理。
作为经过后训练的世界动作模型(WAM),Cosmos 3 Edge 以机器人控制分辨率(640×360 观测)运行,在 NVIDIA Jetson Thor 上实现实时推理,每次推理生成 32 个动作,并以 15 Hz 频率达成实时控制。
在同类规模(40 亿参数)的模型中,Cosmos 3 Edge 在视觉分析领域的 VANTAGE-Bench 基准测试中排名第一,在机器人策略学习方面达到业界领先水平,为智能基础设施和机器人领域树立了新的标杆。
什么是世界建模?
世界模型学习环境如何随时间变化。它表征物体、运动、空间关系以及动作的效果。
设想一个机器人伸手去抓取物体。识别物体只是第一步。机器人还必须理解物体在哪里、它的夹爪如何移动、接触时可能发生什么,以及哪个动作最有可能成功完成任务。
世界模型帮助机器人推理这些关系。它可以预测某个动作的视觉结果,推断导致某一变化的动作,或生成一个动作以产生期望的结果。
Cosmos 3 Edge 将这些能力整合到一个模型中,并在设备端运行。其共享表示使物理 AI 系统能够理解当前世界状态,模拟可能的未来,并将这些未来与动作联系起来。
两个 Transformer 塔,一个共享表示
Cosmos 3 结合了两个 Transformer 塔:
- 自回归塔:处理视觉和文本 token,用于理解和推理。
- 扩散塔:处理视觉、音频和动作 token,用于预测、生成和神经模拟。
这两个塔各自拥有独立的归一化层和多层感知机。它们共享多模态注意力层,这些层将语言、视频、音频和动作之间的信息对齐。
这种设计使得模型在生成输出之前能够先对场景进行推理。根据任务的不同,Cosmos 3 可以从自回归塔生成推理 token,或从扩散塔生成去噪后的视频和动作 token。
注意力模式也针对每种信息类型进行了调整。语言使用因果注意力,其中每个 token 只关注它之前的 token。扩散 token 则更广泛地关注可用的上下文,以支持连贯的预测和生成。
这些组件共同为模型提供了一个关于“正在发生什么”、“接下来可能发生什么”以及“动作如何影响结果”的通用表示。
用于动作的通用表示
物理系统以不同的方式描述动作。车辆可能通过自身位姿和移动来表示动作。摄像头使用相机运动。机械臂使用其末端执行器的位姿,而手爪或夹爪还需要表示抓取状态。
Cosmos 3 将这些不同的具身形态映射到一个通用的动作表示中。
动作被编码为紧凑的几何向量,这些向量捕捉:
- 平移
- 旋转
- 操作状态
这在控制与世界的视觉结构之间建立了直接联系。模型能够将像素的变化与物理运动、空间关系以及控制输入关联起来。
因此,生成的视频不再仅仅是视觉预测。它可以表征世界如何因某个动作而预期发生变化。这为开发者提供了基于运动、控制与因果关系的训练数据。
策略模式
作为策略,Cosmos 3 会预测一个动作及其预期的视觉结果。
该模型能够生成系统应执行的操作,并模拟接下来可能发生的情况。这直接将世界建模与机器人策略训练和评估联系起来。
输入当前状态,输出动作和视觉结果。
这些模式使单个模型能够学习原因、结果和策略。动作可以在模型中双向流动,使 Cosmos 3 Edge 能够预测某个动作的效果,或从其效果推断出动作。
提示词:拿起香蕉,把它放进盘子里。
我们还发布了 Cosmos 3 Edge 策略(DROID):一个在 DROID 数据集上针对拾取和放置任务进行后训练的机器人操作策略,并附带了后训练脚本。
开发者可以使用小型 H100 集群或 NVIDIA DGX Station,在将 Cosmos 3 Edge 部署到 NVIDIA 边缘及加速计算平台之前,针对其目标工作负载进行高效的微调。
用于提升性能的后训练样本
除了基础模型,我们还发布了参考后训练检查点和训练方案,以帮助开发者针对自身应用对 Cosmos 3 进行适配和优化。
Cosmos 3 是一个开放世界基础模型平台。随着模型使用高质量、特定领域的数据进行后训练,其在专业应用中的准确性持续提升。Cosmos 可作为使用开放框架构建领域自适应世界模型的起点。后训练使开发者能够在保持输出质量的同时提升模型性能。为演示这一工作流程,我们还发布了 Cosmos 3 Super 4 步知识蒸馏检查点及后训练脚本,为 64B 模型提供更快的参考实现,帮助开发者将 Cosmos 适配到自身领域,并实现更优的下游性能。
Cosmos 3 Super 4 步(文生图与图生视频):这些是分布匹配蒸馏检查点及脚本,可将扩散模型的去噪步骤从 35–50 步减少至仅 4 步,在保持图像与视频质量及保真度的同时,实现高达 25 倍的推理加速。
这些示例可作为开发者进一步构建的参考实现。借助开放的训练脚本,您可以对 Cosmos 3 Edge 进行后训练以定制机器人策略,或蒸馏 Cosmos 3 Super 以实现针对自身应用场景的更快速图像与视频生成。
试用 Cosmos 3 Edge
下载模型:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge 通过共享的世界表征连接了理解、预测、模拟与行动。开发者可将其部署在更靠近传感器的设备端。该模型既可作为推理器使用,也可作为动作生成器使用。
使用开放的 Cosmos 框架来定制和专业化这些模型。
查看 Cosmos 3:https://huggingface.co/collections/nvidia/cosmos3
未来展望
我们将持续推进 Cosmos 3 在物理 AI 领域的发展,即将在交互式世界生成、驾驶场景模拟以及机器人策略方面带来改进。
我们还在投资于更广泛的硬件上的更快推理与更高效的后训练,以减少构建下游模型所需的时间和算力。
这包括使用 vLLM 等开放推理与优化框架来优化 Cosmos 3 检查点,更多优化及开发者工具即将推出。