# MolmoAct2：面向真实世界部署的动作推理模型

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-05-04 08:00
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmos4a17c04uhslrj2pf1ywi8
- 原文链接：https://arxiv.org/abs/2605.02881

## 精选理由

开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics，还附赠最大的双手操作数据集和全套训练代码，做机器人的同学本周必读。

## AI 摘要

MolmoAct2 是一个为实际部署设计的全开放动作推理模型，在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER，基于 330 万样本语料库训练。团队发布了三个新数据集，包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM（720 小时遥操作轨迹），并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构，嫁接连续动作专家，还引入自适应深度推理变体 MolmoThink，以极低延迟保持几何基础。在广泛实证研究中，MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线，MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。

## 正文

视觉-语言-动作（VLA）模型旨在为机器人提供单一的通用控制器，但当前的系统在实际部署所需的关键指标上仍存在不足。前沿模型是封闭的，开源权重替代方案受限于昂贵的硬件，增强推理的策略因接地而带来高昂的延迟成本，微调后的成功率也低于可靠使用的阈值。我们提出了 MolmoAct2，一个为实际部署而构建的完全开源动作推理模型，沿五个维度对其前代产品进行了改进。我们引入了 MolmoER，一个专为空间和具身推理设计的 VLM 骨干网络，该网络在包含 330 万个样本的语料库上，采用“先专精后演练”的训练方案进行训练。我们发布了三个覆盖低至中成本平台的新数据集，包括 MolmoAct2-BimanualYAM——包含 720 小时遥操作双臂轨迹，是迄今为止最大的开源双臂数据集——以及经过质量筛选的 Franka（DROID）和 SO100/101 子集。我们提供了 OpenFAST，一个在五种具身形态的数百万条轨迹上训练的开源权重、开源数据动作分词器。我们重新设计了架构，通过逐层 KV 缓存条件化，将一个流匹配连续动作专家模块嫁接到一个离散 token 的 VLM 上。最后，我们提出了 MolmoThink，一种自适应深度推理变体，仅对时间步之间发生变化的场景区域重新预测深度 token，以极低的延迟成本保留了几何接地能力。在迄今为止任何开源 VLA 最广泛的实证研究中（涵盖 7 个模拟和真实世界基准），MolmoAct2 超越了包括 Pi-05 在内的强基线模型，而 MolmoER 在 13 个具身推理基准上超越了 GPT-5 和 Gemini Robotics ER-1.5。我们发布了模型权重、训练代码以及完整的训练数据。项目页面：https://allenai.org/blog/molmoact2
