NVIDIA 发布了 Alpamayo 2 Super,这是一款面向自动驾驶的 34B 参数视觉-语言-动作(VLA)模型,采用开放商业许可。其明确的设计目标是长尾事件:即传统检测-预测技术栈难以处理的罕见多智能体场景。该模型将基于 NVIDIA Cosmos 3 Super Reasoner 构建、并通过强化学习进行后训练的 32B VLM 主干,与一个 2.3B 的基于扩散模型的动作解码器配对。通过对全景环绕摄像头视频的一次处理,它能够输出规划轨迹、该轨迹的因果解释以及一个元动作。
是否可以部署
可以,并且从第一天起即可用于商业用途。权重以 OpenMDW-1.1 许可发布,这是 Linux 基金会针对开放模型分发制定的宽松许可;源代码采用 Apache 2.0 许可。该许可涵盖微调、衍生模型和商业再分发。NVIDIA 正在将 OpenMDW 应用于整个 Alpamayo 系列,因此此前为研发而发布的早期版本现在无需额外许可即可用于商业部署。
输入、输出与训练数据
输入为多摄像头 RGB 视频、文本以及带时间戳的自我运动历史。经过验证的公开笔记本配置使用六个摄像头,每个摄像头使用四个历史帧。自我运动为三维平移加上一个 3×3 旋转矩阵,跨多个时间步。
轨迹 API 返回 64 个路径点,时间跨度从 0.1 秒到 6.4 秒,间隔为 0.1 秒。每个路径点携带自车坐标系下的 XYZ 坐标和一个 3×3 旋转矩阵。
训练数据约为 115,000 小时的多摄像头驾驶视频,带有自我运动和轨迹标注。其中包含约 3,700,000 条因果链(CoC)轨迹——即对驾驶决策的结构化、因果关联的解释。图像训练数据超过十亿张图像。
基准测试
在 LingoQA 上,Alpamayo 2 Super 的 Lingo-Judge 得分为 79.2,在近 40 个被评估的模型中排名第一。在 NVIDIA 的测试中,它比 Qwen2.5-VL 72B 高出 17.0 分,比 Gemini 2.5 Pro 高出 15.1 分,比 GPT-4o 高出 23.2 分。
还有两个数字对规划工作很重要。基于 PhysicalAI-AV-NuRec 数据集中 910 个场景,使用 AlpaSim 进行闭环评估,得到的 AlpaSim 分数为 1.50 ± 0.13。基于 PhysicalAI-AV 数据集中 937 个具有挑战性的样本进行开环评估,6.4 秒时的 minADE₆ 为 0.911 米。
一个模型,五种输出
针对每个驾驶场景,该模型会生成一条轨迹、一条解释决策的 CoC 链式因果追踪、一个诸如让行或变道的元动作、推理自动标注,以及带 2D 定位的视觉问答。
正是这种组合让此次发布在操作层面颇具看点。开发者可以将模型观察到的内容与其选择的动作关联起来。CoC 追踪可与 NVIDIA Halos 安全验证工作流集成,并支持符合 ISO/PAS 8800 的 AI 安全。
在专有车队数据上用作自动标注器时,NVIDIA 表示该模型可将标注周期从数月压缩至数天。
交互式讲解器
核心要点
- 34B VLA 模型——32B Cosmos 3 Super Reasoner 骨干网络,外加一个 2.3B 扩散动作专家模块。
- OpenMDW-1.1 权重和 Apache 2.0 代码;允许商业使用和再分发,无需额外许可。
- LingoQA Lingo-Judge 得分 79.2,在近 40 个模型中排名第一;AlpaSim 得分 1.50 ± 0.13;6.4 秒时 minADE₆ 为 0.911 米。
- 一次推理即可得到轨迹、链式因果追踪、元动作、自动标注和带定位的 VQA。
- 云规模模型已在 1× H100 80GB 上完成测试,峰值显存占用 72,115 MiB;可对其进行蒸馏以用于车载推理。
请查看 NVIDIA 博客和 Hugging Face 模型卡。另外,欢迎在 Twitter 上关注我们,别忘了加入我们超过 15 万成员的 ML SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们。