Qwen-Omni × Qwen-RobotManip — Qwen-Omni 观察场景,随机通过语音提出操作任务,并实时判断执行情况。每个视频展示 Qwen-RobotManip 在没有预定义任务列表的情况下即时完成任务,展现了开放式指令跟随与泛化能力。
Qwen-RobotManip 在多种真实机器人平台和任务上得到验证,展现出对新颖场景、未见过的语言指令以及跨本体迁移的强大泛化能力。
查看真实世界评估图库
语言和多模态领域的基础模型已实现显著的泛化能力,这是因为异构数据源可以在统一框架下对齐,且丰富的低成本互联网数据使得多样化的训练信号能够在大规模上相互增强。但这一规模化配方能否应用于机器人操作?
这极具挑战性。与文本或图像不同,操作数据本质上具有异构性、采集成本高昂且多样性狭窄。在跨不同机器人本体、传感器和任务领域对齐表征的同时实现数据规模化,一直是一个悬而未决的问题。
Qwen-RobotManip 是一个基于 Qwen-VL 构建的可泛化视觉-语言-动作(VLA)基础模型。它在操作的表征、运动和行为维度上引入了统一的对齐框架,使大规模多源训练变得协调一致而非相互冲突。仅使用开源机器人操作数据集和人类演示视频,无需任何专有数据采集,Qwen-RobotManip 构建了约 38,100 小时的预训练语料库,并已展现出涌现式泛化能力。
没有统一的跨本体对齐,规模化数据会产生冲突;没有数据多样性,仅靠对齐无法实现泛化。对齐与规模化是机器人基础模型紧密耦合的前提条件。
核心亮点#
对齐
表征 · 运动 · 行为
三维对齐
仅使用开源数据
38K 小时操作数据
覆盖 15 种本体
领先
分布外泛化
在所有基准测试中
排名第一
RoboChallenge Table30 v1 通用型赛道
包揽前两名,领先第三名 20%
统一跨本体对齐框架——一种统一的 80 维状态-动作表征可适配多种本体,相机坐标系下的末端执行器增量位姿使视觉上相似的动作在数值上接近,而上下文内策略自适应将执行历史读取为隐式本体标识符——三者共同实现跨本体的一致性信号提取。大规模人机合成——通过动作重定向、手部移除与修复、仿真渲染以及深度引导合成,将 1,933 小时的第一人称人类视频转化为涵盖 15 种本体的 24,808 小时机器人演示数据,并辅以多阶段数据筛选流程确保数据质量。分布外泛化:LIBERO-Plus 达 91.4%(较 π0.5 提升 7.0 个百分点),RoboTwin-C2R Hard 达 69.4%(较 π0.5 提升 21.5 个百分点),RoboCasa365 Composite-Unseen 达 14.9%(为次优结果的 3 倍),EBench 达 45.6%(较次优结果提升 18.5 个百分点);RoboTwin-IF 达 72.0%(较 π0.5 提升 22.4 个百分点),证实了真正的语言条件控制能力;在 RoboTwin-XE 上达到次优结果的 3 倍,展现了零样本跨本体迁移能力。强大的真实世界性能:在 RoboChallenge Table30 v1 通用型赛道中以 45% 的成功率排名第一,包揽前两名并领先第三名 20 个百分点;在真实机器人平台上经过验证,域内与分布外任务均达到此前最优水平的 2 倍,并具备少样本自适应与跨本体技能迁移能力。
扩展操作数据
人机数据合成
机器人操作数据稀缺且采集成本高昂。我们引入了一种人机合成流程,通过人机重定向、手部移除与修复以及深度引导机器人合成,将第一人称人类操作视频转化为涵盖 15 种机器人本体的机器人演示数据。
数据来源
由此产生的预训练语料库总计超过 38,100 小时,来自三个互补来源:
机器人数据(约 11,420 小时):涵盖单臂、双臂及移动操作的开源机器人数据集。
第一人称人类数据(约 1,933 小时):从开放世界环境中采集的人类操作视频,提供了丰富的物体交互与场景先验知识。
人机合成数据(约 24,808 小时):基于上述第一人称视角数据,在 15 个机器人平台上生成,作为主要的规模化扩展引擎。
数据整理#
我们设计了一个多阶段整理流程,以确保 VLA 训练数据的质量和标注的正确性。五个状态-动作过滤阶段用于去除噪声动作、修正时间错位并验证运动学一致性。随后,三个跨模态检查用于验证语言指令与视频内容是否匹配、视觉观测结果与记录的机器人状态是否一致,以及视频帧是否存在损坏。
Qwen-RobotManip 模型设计#
Qwen-RobotManip 将 Qwen3.5-4B 视觉语言骨干网络与流匹配扩散 Transformer(DiT)动作头相结合。三项设计选择实现了连贯的跨本体训练:
规范状态-动作表示。所有机器人状态和动作都被映射到一个统一的 80 维向量中,该向量涵盖单臂、双臂、灵巧手和移动底盘配置。一个逐维度的二值掩码确保梯度仅流经已填充的槽位,从而使不同本体能够共享同一表示而不产生冲突。
相机坐标系增量位姿。末端执行器动作以相机坐标系中的增量形式表示,而非机器人基坐标系,这使得视觉上相似的动作在不同本体之间数值上更为接近。相机外参通过交叉注意力层中的相机位置编码(CaPE)注入,而内参则被编码到视觉 token 中以实现视野感知。DiT 进一步以末端执行器类型嵌入为条件,实现本体感知的动作去噪。
上下文内策略自适应。模型将动作预测建立在一个结构化的本体提示(指定机器人平台、执行速度和 FPS)以及一段历史观测-动作片段的条件之上,从而实现对不同本体和行为模式的即时自适应。训练过程中采用随机上下文采样策略,可防止动作复制捷径,并迫使模型进行真正的策略学习。
训练。预训练阶段采用双流协同训练,包含 VLA 流(机器人操作数据)和 VLM 流(视觉语言理解数据),比例为 9:1。后训练阶段则针对每个基准测试收集的所有演示数据,进行通用型 SFT。我们提出在后训练阶段对 VL 数据和 VLA 数据进行协同训练,这进一步提升了在分布外指令跟随和泛化方面的表现。
评估#
Qwen-RobotManip 在超过 500 个模拟任务和 80 多个真实世界任务中进行了评估,涵盖了多种机器人形态。
为何分布外评估至关重要#
我们实验中的一个关键发现是:标准基准测试系统性地未能捕捉到预训练的质量。在像 LIBERO 和 RoboTwin 这样的分布内基准测试中,从头开始训练且未经过任何大规模机器人预训练的模型,其性能与之前 SOTA 的预训练模型相当。强大的独立同分布分数并不能代表真正的泛化能力;仅通过模式匹配就能达到这样的分数。
这种差异只有在分布外评估中才会显现出来:例如新场景和任务变体、遵循未见过的指令,以及跨形态迁移。这就是为什么 Qwen-RobotManip 将分布外基准测试作为评估机器人基础模型的北极星指标。
分布内结果#
在标准基准测试中,Qwen-RobotManip 达到或超越了之前的 SOTA 水平。
| 模型 | LIBERO | RT-Easy | RT-Hard |
|---|---|---|---|
| $\pi{0}$π 0 | 94.4 | 65.9 | 58.4 |
| $\pi{0.5}$π 0.5 | 97.6 | 82.7 | 76.8 |
| StarVLA | 98.0 | 85.7 | 87.3 |
| Abot-M0 | 98.6 | 86.1 | 85.1 |
| Being-H0.7 | 99.2 | 90.2 | 89.6 |
| Qwen-RobotManip-scratch | 98.2 | 88.7 | 88.4 |
| Qwen-RobotManip | 99.1 | 93.4 | 92.5 |
| Qwen-RobotManip-Context | 99.2 | 93.7 | 94.0 |
分布外泛化#
Qwen-RobotManip 在三个分布外泛化维度上均大幅超越所有先前模型:任务与场景变化、指令跟随,以及跨形态迁移。
各基准测试详细分析 LIBERO-Plus — 在 7 个扰动维度(相机、机器人、语言、光照、背景、噪声、布局)下的分布外鲁棒性评估:
| 模型 | 相机 | 机器人 | 语言 | 光照 | 背景 | 噪声 | 布局 | 总计 |
|---|---|---|---|---|---|---|---|---|
| $\pi{0}$π 0 | 13.8 | 6.0 | 58.8 | 85.0 | 81.4 | 79.0 | 68.9 | 53.6 |
| $\pi{0.5}$π 0.5 | 78.4 | 73.6 | 80.8 | 96.2 | 94.1 | 89.0 | 84.5 | 84.4 |
| StarVLA | 52.5 | 49.8 | 88.5 | 95.7 | 95.7 | 73.0 | 76.9 | 74.1 |
| Abot-M0 | 60.4 | 67.9 | 86.4 | 96.2 | 91.6 | 86.4 | 82.6 | 80.5 |
| Being-H0.7 | 82.0 | 59.0 | 82.8 | 97.8 | 90.0 | 93.5 | 88.5 | 84.8 |
| Qwen-RobotManip | 87.2 | 75.5 | 85.6 | 96.6 | 97.7 | 97.7 | 87.3 | 89.0 |
| Qwen-RobotManip-Context | 89.9 | 83.9 | 86.5 | 98.6 | 99.9 | 97.9 | 87.5 | 91.4 |
Qwen-RobotManip 总体达到 89.0%,Qwen-RobotManip-Context 总体达到 91.4%。各维度细分显示,相机和机器人扰动从大规模机器人数据预训练中获益最多,而语言和光照鲁棒性已由 VLM 骨干网络提供。
RoboTwin-Clean2Rand — 模型在 Clean 数据集上微调,并在渐进式环境随机化条件下进行测试:
| 模型 | 简单 | 背景 | 光照 | 杂乱 | 高度 | 困难 |
|---|---|---|---|---|---|---|
| StarVLA | 58.1 | 27.1 | 50.9 | 24.2 | 48.4 | 10.6 |
| GR00T-N1.7 | 43.6 | 40.4 | 41.9 | 27.1 | 39.0 | 20.7 |
| $\pi{0.5}$π 0.5 | 73.1 | 67.0 | 69.2 | 57.9 | 67.6 | 47.9 |
| Qwen-RobotManip | 73.2 | 74.6 | 68.4 | 61.3 | 71.0 | 62.6 |
| Qwen-RobotManip-Context | 84.7 | 82.4 | 84.2 | 75.4 | 79.5 | 69.4 |
Qwen-RobotManip 取得了最高的困难模式成功率(62.6%),保留了其简单模式性能的约 86%,相比之下 $\pi{0.5}$π 0.5 为 66%,而无预训练的模型则低于 30%。Qwen-RobotManip-Context 在困难模式下进一步达到了 69.4%,证明了上下文策略自适应的有效性。
RoboCasa365 — 在多样化厨房环境中对原子操作和长程操作进行评估:
| 模型 | 原子操作 | 复合-已见过 | 复合-未见过 | 总计 |
|---|---|---|---|---|
| $\pi{0}$π 0 | 36.3 | 5.2 | 0.7 | 15.0 |
| $\pi{0.5}$π 0.5 | 39.6 | 7.1 | 1.2 | 16.9 |
| GR00T-N1.5 | 50.7 | 14.8 | 2.7 | 23.9 |
| RLDX-1 | 63.0 | 27.5 | 5.4 | 33.2 |
| Qwen-RobotManip | 68.6 | 20.1 | 14.9 | 35.9 |
| Qwen-RobotManip-Context | 63.9 | 22.6 | 11.2 | 33.8 |
在复合-未见过场景中,该场景需要在分布外场景中完成长程任务,Qwen-RobotManip 达到了 14.9%,几乎是次优模型(5.4%)的 3 倍。
EBench — 涵盖桌面操作、抓取放置和长程任务的移动操作:
| 模型 | 桌面 | 简单抓取放置 | 长程 | 总体 |
|---|---|---|---|---|
| 成功率 | 分数 | 成功率 | 分数 | 成功率 |
| π₀ | 15.7 | 30 | 35.0 | 39 |
| π₀.₅ | 12.9 | 32 | 45.0 | 50 |
| X-VLA | 8.6 | 24 | 50.0 | 54 |
| InternVLA-A1 | 4.3 | 11 | 43.0 | 47 |
| Qwen-RobotManip | 50.0 | 70 | 56.5 | 60 |
| Qwen-RobotManip-Context | 49.3 | 56 | 55.0 | 66 |
Qwen-RobotManip 总体成功率达到 45.6%,综合得分为 60,在每个分项上均大幅优于 $\pi{0.5}$π 0.5(27.1% / 41)及所有其他基线模型。
RoboTwin-IF — 使用未见过的保留指令模板进行指令跟随:
| 模型 | 抓取-多样化 | 放置-相对 | 打开-微波炉门 | 打开-订书机 | 打开-桌子 | 平均 |
|---|---|---|---|---|---|---|
| StarVLA | 11 | 13 | 0 | 49 | 74 | 29.4 |
| GR00T-N1.7 | 20 | 17 | 0 | 14 | 32 | 16.6 |
| π0.5 | 44 | 20 | 15 | 92 | 66 | 49.6 |
| Qwen-RobotManip | 79 | 57 | 42 | 90 | 93 | 72.2 |
| Qwen-RobotManip-Context | 77 | 71 | 33 | 89 | 90 | 72.0 |
Qwen-RobotManip 平均达到 72.2%,领先 π0.5 达 22.6 个百分点。最大的提升出现在那些需要解析指令以从多个可行方案中选择正确动作的任务上,这证实了真正的语言条件控制能力。
零样本跨本体迁移——仅使用 AgileX ALOHA 数据进行训练,在我们 RoboTwin-XE 基准上对未见过的机器人本体进行评估:
| 模型 | ARX | UR5 | Franka | 总计 |
|---|---|---|---|---|
| π0.5(关节空间) | 24.6 | 2.2 | 0.9 | 9.2 |
| π0.5(末端执行器) | 11.5 | 10.0 | 1.1 | 7.5 |
| Qwen-RobotManip(关节空间) | 37.6 | 4.1 | 1.8 | 14.5 |
| Qwen-RobotManip(末端执行器) | 42.9 | 22.8 | 5.9 | 23.9 |
相机坐标系下的末端执行器表示通过抽象化形态差异,显著提升了零样本迁移能力。Qwen-RobotManip(末端执行器)总体达到 23.9%,是 π0.5(末端执行器)7.5% 的 3.2 倍。
数据扩展:对齐是实现规模化的前提
一个重要发现:只有具备统一跨本体表示的模型才表现出清晰的对数线性数据扩展行为。没有对齐框架(统一空间 + 统一末端执行器),增加更多数据会产生不规律或平坦的扩展曲线。这证实了对齐是规模化的先决条件,而非相反。
真实世界实验
对新场景和新指令的泛化能力
在涵盖基础抓取放置、可变形物体操作和精密装配的 7 个任务上进行域内评估:
| 任务 | π0.5 | StarVLA | 我们的方法 |
|---|---|---|---|
| 清理桌面 | 4/5 | 0/5 | 5/5 |
| 三碗叠放 | 5/5 | 4/5 | 5/5 |
| 甜瓜入碗 | 2/5 | 0/5 | 5/5 |
| 叠毛巾 | 4/5 | 3/5 | 4/5 |
| 积木入抽屉 | 0/5 | 0/5 | 5/5 |
| 黄色圆盘插入 | 0/5 | 0/5 | 2/5 |
| 三块积木叠放 | 0/5 | 0/5 | 5/5 |
| 平均 | 42.9% | 20.0% | 88.6% |
在视觉场景、物体和指令存在分布偏移的情况下的域外评估:
| 任务 | 域外因素 | π0.5 | StarVLA | 我们的方法 |
|---|---|---|---|---|
| 目标物体入篮 | 杂乱背景,未见过的物体 | 8/10 | 0/10 | 10/10 |
| 左右碗叠放 | 杂乱背景,左右参照 | 1/10 | 0/10 | 10/10 |
| 工具放毛巾上 | 未见过的微小物体,干扰物 | 0/10 | 0/10 | 6/10 |
| 香蕉放毛巾上 | 动态光照(迪斯科灯光) | 6/10 | 0/10 | 9/10 |
| 平均 | 37.5% | 0.0% | 87.5% |
Qwen-RobotManip 在域内任务上达到 88.6% 的成功率,在域外任务上达到 87.5%,大幅超越 $\pi{0.5}$π 0.5(42.9% / 37.5%)和 StarVLA(20.0% / 0.0%)。
跨实体数据高效的技能迁移#
少样本适应。所有方法仅在 5 个任务的 130 次遥操作演示上进行联合微调。Qwen-RobotManip 在 5 个任务中的 4 个上优于两个基线模型:
| 任务 | 子步骤 | StarVLA | $\pi{0.5}$π 0.5 | 我们的方法 |
|---|---|---|---|---|
| 放置水果 | 放置 1 / 2 / 3 | 3/1/0 | 9/5/2 | 9/5/3 |
| 平均成功率 | 13.3% | 53.3% | 56.7% | |
| 放置积木 | 打开 / 放置1 / 放置2 / 关闭 | 1/1/0/0 | 4/2/2/2 | 5/4/3/3 |
| 平均成功率 | 5.0% | 25.0% | 37.5% | |
| 折叠毛巾 | 折叠 1 / 折叠 2 | 0/0 | 3/1 | 3/3 |
| 平均成功率 | 0.0% | 20.0% | 30.0% | |
| 插入螺丝 | 交接 / 插入 | 0/0 | 2/0 | 2/0 |
| 平均成功率 | 0.0% | 10.0% | 10.0% | |
| 拧开瓶盖 | 抓取 / 拧开 / 放置 | 4/0/0 | 9/2/1 | 9/4/3 |
| 平均成功率 | 13.3% | 40.0% | 53.3% |
跨实体技能迁移。一个在 6K 个 CobotMagic 演示和 130 个 ARX 演示上联合微调得到的单一策略,在 ARX 上的 4 个新任务上进行评估,而 ARX 在这些任务上拥有零个训练演示:
| 模型 | 堆叠盘子 | 堆叠积木 | 盘子中的水果 | 桶中的垃圾 | 平均 |
|---|---|---|---|---|---|
| 无 UnifiedSpace | 0/10 | 0/10 | 3/10 | 0/10 | 7.5% |
| 无 UnifiedEEF | 0/10 | 0/10 | 5/10 | 0/10 | 12.5% |
| Qwen-RobotManip | 3/10 | 5/10 | 7/10 | 7/10 | 55.0% |
完整的统一框架达到了 55.0% 的成功率,是最佳消融变体的 4 倍以上,这表明统一表示能够在运动学不同的实体之间实现技能级别的迁移。
复杂多步骤任务与应急恢复#
在涵盖 4 个机器人平台、30 个任务的 RoboChallenge Table30 v1 通用型赛道中,Qwen-RobotManip 以 45% 的成功率和 59.83 的过程得分排名第一,领先第二名 20%。在 8 个双臂协调任务上,它实现了 40% 的成功率,而 $\pi{0.5}$π 0.5 的成功率为 21.2%。
双手协调。在30项基准任务中,有8项需要在ALOHA平台上进行紧密的双手协调操作,即两只手臂必须共同稳定、搬运和操控物体。Qwen-RobotManip实现了40%的平均成功率,远超π0.5(21.2%)、DM0(16.2%)、GR00T-MULTI(7.5%)和π0(7.5%)。值得注意的是,Qwen-RobotManip是唯一在“将薯条倒入盘子”任务中成功的模型(成功率为30%,所有基线模型均为0%),该任务要求一系列双手协调步骤——用左臂稳定薯条盒,用右臂打开它,拿起盒子,然后将内容物倒入盘子。我们将这种强大的双手协调能力归因于两个因素:(1)我们的预训练语料库包含了大量双手演示数据,使模型能够学习协调的双臂控制基元;(2)人-机器人合成流程通过从第一人称人类视频中合成机器人双手演示,进一步扩大了有效的双手预训练数据。
跨形态的稳健抓取与放置。我们识别出所有四个平台上共12项以抓取与放置基元为核心的任务,范围从单物体抓取到涉及4-5个物体的多步骤顺序操作。Qwen-RobotManip在这些任务上实现了63.3%的平均成功率,比次优基线模型DM0(48.3%)高出15.0个百分点。我们将这种能力归因于两个因素:(1)大规模跨形态预训练数据编码了丰富的抓取与放置模式;(2)统一的动作空间使得不同机器人形态之间能够共享基础空间技能的知识。
反应式错误恢复。当物体在抓取过程中滑落时,模型会自动重试直至成功。这种行为源于大规模预训练,而非显式编程。
迈向可扩展的机器人基础模型
Qwen-RobotManip 表明,语言和多模态基础模型背后的规模化策略可以扩展到机器人操作领域,但这需要对齐与规模化协同作用。统一的跨本体表征使得大规模多源训练能够产生成效而非相互冲突,而“人转机器人”合成流程则提供了仅靠对齐无法实现的数据多样性。
具身智能仍处于早期阶段。涉及密集接触、长周期真实世界任务、故障恢复、持续学习以及复杂的人机环境交互,依然充满挑战。然而,Qwen-RobotManip 指明了一条清晰的前进道路:
对齐释放规模化,规模化释放泛化能力。
← 返回 Qwen-Robot 套件
@article{qwenrobotmanip, title={Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models}, author={Qwen Team}, year={2026}}