视觉-语言-动作(VLA)模型旨在为机器人提供单一的通用控制器,但当前的系统在实际部署所需的关键指标上仍存在不足。前沿模型是封闭的,开源权重替代方案受限于昂贵的硬件,增强推理的策略因接地而带来高昂的延迟成本,微调后的成功率也低于可靠使用的阈值。我们提出了 MolmoAct2,一个为实际部署而构建的完全开源动作推理模型,沿五个维度对其前代产品进行了改进。我们引入了 MolmoER,一个专为空间和具身推理设计的 VLM 骨干网络,该网络在包含 330 万个样本的语料库上,采用“先专精后演练”的训练方案进行训练。我们发布了三个覆盖低至中成本平台的新数据集,包括 MolmoAct2-BimanualYAM——包含 720 小时遥操作双臂轨迹,是迄今为止最大的开源双臂数据集——以及经过质量筛选的 Franka(DROID)和 SO100/101 子集。我们提供了 OpenFAST,一个在五种具身形态的数百万条轨迹上训练的开源权重、开源数据动作分词器。我们重新设计了架构,通过逐层 KV 缓存条件化,将一个流匹配连续动作专家模块嫁接到一个离散 token 的 VLM 上。最后,我们提出了 MolmoThink,一种自适应深度推理变体,仅对时间步之间发生变化的场景区域重新预测深度 token,以极低的延迟成本保留了几何接地能力。在迄今为止任何开源 VLA 最广泛的实证研究中(涵盖 7 个模拟和真实世界基准),MolmoAct2 超越了包括 Pi-05 在内的强基线模型,而 MolmoER 在 13 个具身推理基准上超越了 GPT-5 和 Gemini Robotics ER-1.5。我们发布了模型权重、训练代码以及完整的训练数据。项目页面:https://allenai.org/blog/molmoact2
MolmoAct2:面向真实世界部署的动作推理模型
MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。
视觉-语言-动作(VLA)模型旨在为机器人提供单一的通用控制器,但当前的系统在实际部署所需的关键指标上仍存在不足。前沿模型是封闭的,开源权重替代方案受限于昂贵的硬件,增强推理的策略因接地而带来高昂的延迟成本,微调后的成功率也低于可靠使用的阈值。我们提出了 MolmoAct2,一个为实际部署而构建的完全开源动作推理模型,沿五个维度对其前代产品进行了改进。我们引入了 MolmoER,一个专为空间和具身推理设计的 VLM 骨干网络,该网络在包含 330 万个样本的语料库上,采用“先专精后演练”的训练方案进行训练。我们发布了三个覆盖低至中成本平台的新数据集,包括 MolmoAct2-BimanualYAM——包含 720 小时遥操作双臂轨迹,是迄今为止最大的开源双臂数据集——以及经过质量筛选的 Franka(DROID)和 SO100/101 子集。我们提供了 OpenFAST,一个在五种具身形态的数百万条轨迹上训练的开源权重、开源数据动作分词器。我们重新设计了架构,通过逐层 KV 缓存条件化,将一个流匹配连续动作专家模块嫁接到一个离散 token 的 VLM 上。最后,我们提出了 MolmoThink,一种自适应深度推理变体,仅对时间步之间发生变化的场景区域重新预测深度 token,以极低的延迟成本保留了几何接地能力。在迄今为止任何开源 VLA 最广泛的实证研究中(涵盖 7 个模拟和真实世界基准),MolmoAct2 超越了包括 Pi-05 在内的强基线模型,而 MolmoER 在 13 个具身推理基准上超越了 GPT-5 和 Gemini Robotics ER-1.5。我们发布了模型权重、训练代码以及完整的训练数据。项目页面:https://allenai.org/blog/molmoact2
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org