# NVIDIA 发布 Cosmos 3 Edge：4B 参数开源世界模型，为机器人及边缘 AI 提供实时推理与动作生成

- 来源：Hugging Face：Blog（RSS）
- 发布时间：2026-07-20 23:58
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrtgmuyf3366bitl3gnpc8eo
- 原文链接：https://huggingface.co/blog/nvidia/cosmos3edge

## 精选理由

NVIDIA 把世界模型的能力压进 4B 参数，直接在 Jetson 上实时推理并生成机器人动作，对做具身智能的人来说是个标志性信号，边缘部署终于可以摆脱云端依赖了。

## AI 摘要

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge，一个 40 亿参数的世界模型，旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

## 正文

真实世界广阔无垠，物理 AI 系统要在其中运作，就必须理解场景如何变化、预判接下来可能发生什么，并确定某个动作将如何影响世界。机器在工厂、仓库、医院等边缘环境中运行。要在这些环境中理解并采取行动，它们需要能在内存受限的系统上提供数据中心级性能的模型。

今天，我们在 Hugging Face 的 Cosmos 3 仓库中发布了 NVIDIA Cosmos 3 Edge。这是一个 40 亿参数的开源世界模型，可帮助机器人和视觉 AI 智能体理解周围环境、实时推理，并在边缘设备上生成机器人动作。

下载模型：https://huggingface.co/nvidia/Cosmos3-Edge

该模型在 NVIDIA 边缘计算机上实现了内存高效、高吞吐量的推理，支持的设备包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU，以及包含新发布的 Jetson T2000 和 T3000 模块在内的 NVIDIA Jetson 系列。

该模型被设计为紧凑型开源模型，可作为小型视觉语言模型（VLM）使用，具备同类最佳吞吐量和精度，支持实时推理。

作为经过后训练的世界动作模型（WAM），Cosmos 3 Edge 以机器人控制分辨率（640×360 观测）运行，在 NVIDIA Jetson Thor 上实现实时推理，每次推理生成 32 个动作，并以 15 Hz 频率达成实时控制。

在同类规模（40 亿参数）的模型中，Cosmos 3 Edge 在视觉分析领域的 VANTAGE-Bench 基准测试中排名第一，在机器人策略学习方面达到业界领先水平，为智能基础设施和机器人领域树立了新的标杆。

什么是世界建模？

世界模型学习环境如何随时间变化。它表征物体、运动、空间关系以及动作的效果。

设想一个机器人伸手去抓取物体。识别物体只是第一步。机器人还必须理解物体在哪里、它的夹爪如何移动、接触时可能发生什么，以及哪个动作最有可能成功完成任务。

世界模型帮助机器人推理这些关系。它可以预测某个动作的视觉结果，推断导致某一变化的动作，或生成一个动作以产生期望的结果。

Cosmos 3 Edge 将这些能力整合到一个模型中，并在设备端运行。其共享表示使物理 AI 系统能够理解当前世界状态，模拟可能的未来，并将这些未来与动作联系起来。

两个 Transformer 塔，一个共享表示

Cosmos 3 结合了两个 Transformer 塔：

自回归塔：处理视觉和文本 token，用于理解和推理。

扩散塔：处理视觉、音频和动作 token，用于预测、生成和神经模拟。

这两个塔各自拥有独立的归一化层和多层感知机。它们共享多模态注意力层，这些层将语言、视频、音频和动作之间的信息对齐。

这种设计使得模型在生成输出之前能够先对场景进行推理。根据任务的不同，Cosmos 3 可以从自回归塔生成推理 token，或从扩散塔生成去噪后的视频和动作 token。

注意力模式也针对每种信息类型进行了调整。语言使用因果注意力，其中每个 token 只关注它之前的 token。扩散 token 则更广泛地关注可用的上下文，以支持连贯的预测和生成。

这些组件共同为模型提供了一个关于“正在发生什么”、“接下来可能发生什么”以及“动作如何影响结果”的通用表示。

用于动作的通用表示

物理系统以不同的方式描述动作。车辆可能通过自身位姿和移动来表示动作。摄像头使用相机运动。机械臂使用其末端执行器的位姿，而手爪或夹爪还需要表示抓取状态。

Cosmos 3 将这些不同的具身形态映射到一个通用的动作表示中。

动作被编码为紧凑的几何向量，这些向量捕捉：

平移

旋转

操作状态

这在控制与世界的视觉结构之间建立了直接联系。模型能够将像素的变化与物理运动、空间关系以及控制输入关联起来。

因此，生成的视频不再仅仅是视觉预测。它可以表征世界如何因某个动作而预期发生变化。这为开发者提供了基于运动、控制与因果关系的训练数据。

策略模式

作为策略，Cosmos 3 会预测一个动作及其预期的视觉结果。

该模型能够生成系统应执行的操作，并模拟接下来可能发生的情况。这直接将世界建模与机器人策略训练和评估联系起来。

输入当前状态，输出动作和视觉结果。

这些模式使单个模型能够学习原因、结果和策略。动作可以在模型中双向流动，使 Cosmos 3 Edge 能够预测某个动作的效果，或从其效果推断出动作。

提示词：拿起香蕉，把它放进盘子里。

我们还发布了 Cosmos 3 Edge 策略（DROID）：一个在 DROID 数据集上针对拾取和放置任务进行后训练的机器人操作策略，并附带了后训练脚本。

开发者可以使用小型 H100 集群或 NVIDIA DGX Station，在将 Cosmos 3 Edge 部署到 NVIDIA 边缘及加速计算平台之前，针对其目标工作负载进行高效的微调。

用于提升性能的后训练样本

除了基础模型，我们还发布了参考后训练检查点和训练方案，以帮助开发者针对自身应用对 Cosmos 3 进行适配和优化。

Cosmos 3 是一个开放世界基础模型平台。随着模型使用高质量、特定领域的数据进行后训练，其在专业应用中的准确性持续提升。Cosmos 可作为使用开放框架构建领域自适应世界模型的起点。后训练使开发者能够在保持输出质量的同时提升模型性能。为演示这一工作流程，我们还发布了 Cosmos 3 Super 4 步知识蒸馏检查点及后训练脚本，为 64B 模型提供更快的参考实现，帮助开发者将 Cosmos 适配到自身领域，并实现更优的下游性能。

Cosmos 3 Super 4 步（文生图与图生视频）：这些是分布匹配蒸馏检查点及脚本，可将扩散模型的去噪步骤从 35–50 步减少至仅 4 步，在保持图像与视频质量及保真度的同时，实现高达 25 倍的推理加速。

这些示例可作为开发者进一步构建的参考实现。借助开放的训练脚本，您可以对 Cosmos 3 Edge 进行后训练以定制机器人策略，或蒸馏 Cosmos 3 Super 以实现针对自身应用场景的更快速图像与视频生成。

试用 Cosmos 3 Edge

下载模型：https://huggingface.co/nvidia/Cosmos3-Edge

Cosmos 3 Edge 通过共享的世界表征连接了理解、预测、模拟与行动。开发者可将其部署在更靠近传感器的设备端。该模型既可作为推理器使用，也可作为动作生成器使用。

使用开放的 Cosmos 框架来定制和专业化这些模型。

查看 Cosmos 3：https://huggingface.co/collections/nvidia/cosmos3

未来展望

我们将持续推进 Cosmos 3 在物理 AI 领域的发展，即将在交互式世界生成、驾驶场景模拟以及机器人策略方面带来改进。

我们还在投资于更广泛的硬件上的更快推理与更高效的后训练，以减少构建下游模型所需的时间和算力。

这包括使用 vLLM 等开放推理与优化框架来优化 Cosmos 3 检查点，更多优化及开发者工具即将推出。
