Qwen-VLA:从理解世界到付诸行动

Qwen:Blog Retrieval(API)·2026-05-29 17:00·89天前·QwenTeam
AI 导读

通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合成仿真轨迹。

Qwen:Blog Retrieval(API)
精选
66AI 编辑部评分,满分 100

Qwen-VLA:从理解世界到付诸行动

2026-05-29 17:00· 89天前· QwenTeam
AI 导读

通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合成仿真轨迹。

推荐理由

Qwen-VLA 把机器人操作、导航和跨实体控制统一进一个模型,在多个基准上打平甚至超越专用模型,这是通用具身智能的一个重要信号,但离实际可用还有距离。

正文 · AI 翻译

过去几年间,多模态大语言模型在理解图像、视频和真实世界场景方面能力日益增强。它们能够识别物体、推理空间关系、回答视觉问题,并解决复杂的多模态推理任务。

但对于具身智能而言,理解世界仅仅是第一步。一个真正的具身智能体还需要理解任务目标、在物理世界中采取行动,并在不同的机器人本体、环境和任务之间实现泛化。

这正是 Qwen-VLA 背后的研发动机。

Qwen-VLA 是一个通用型的视觉-语言-动作模型。它基于 Qwen 多模态骨干网络构建,将视觉感知、语言理解和空间推理扩展至连续动作生成与轨迹预测。换言之,该模型不仅能看、能思考,还能开始行动。

一个模型应对多种具身任务

传统的具身智能系统往往高度专用化:一个模型负责桌面操作,另一个负责导航,再一个专门针对特定机器人平台。这种方法在单个任务上可能表现良好,但难以扩展到更广泛的任务、多样化的环境或不同的机器人本体。

Qwen-VLA 探索了一条更统一的路径:

能否用一个通用策略模型同时支持机器人操作、视觉-语言导航以及跨本体控制?

在 Qwen-VLA 中,机器人操作和视觉-语言导航被统一到同一框架下:给定视觉观测、语言指令和本体特定条件,模型预测下一步动作或轨迹。Qwen 多模态骨干网络负责理解视觉和语言输入,而动作解码器则生成连续动作。

训练:从语言先验到闭环控制

Qwen-VLA 的核心并非简单地在多模态模型上附加一个动作头。更重要的是,它构建了一个覆盖多样化任务、环境和机器人本体的联合训练系统。完整的训练流程分为四个阶段,从语言先验逐步过渡到闭环控制。

数据

预训练数据涵盖五大来源:

机器人操作轨迹构成基础,覆盖桌面、移动、双臂及灵巧操作。公开数据总计超过10,000小时,辅以1,000多小时的内部真实机器人轨迹和超过800万条合成仿真轨迹。

人类第一人称视角数据从开放世界环境中提供了更丰富的物体、场景和手部动作先验知识。我们整合了Ego4D、EPIC-KITCHENS、EgoDex(829小时)、EgoVerse(1,300多小时、1,965个任务、240个场景)以及Xperience。

合成仿真数据填补了长尾场景的空白。视觉条件数据涵盖20个桌面场景、200种配置、450个任务和359,848条成功轨迹。文本到动作数据覆盖6种模板×6种单臂机器人,产生约720万条轨迹和超过14,000小时的数据。

视觉语言导航数据提供了长程轨迹规划和指令跟随能力。

通用视觉语言数据保留了多模态理解、空间定位和指令跟随能力。我们还构建了约48,000条精细动作描述,涵盖13个维度的标注,将自然语言与具体的执行细节对齐。

四阶段训练#

核心思路:先学习从语言生成动作结构,再学习让这些动作适应视觉环境。

第一阶段:T2A(文本到动作预训练)。像“拿起红色杯子”这样的指令只有几个词,但对应的机器人动作却是一条高维连续轨迹。Qwen-VLA将此视为从语言到动作的一种解压缩过程。在T2A阶段,我们冻结VLM,仅使用语言和具身提示词(不含任何图像)来训练动作解码器。

第二阶段:CPT(持续预训练)。我们同时解冻VLM和动作解码器,并在完整的混合多模态数据上进行联合训练。此阶段将T2A阶段的语言-动作先验知识锚定到具体的视觉场景中,同时让主干网络适应具身感知,从而得到Qwen-VLA-Base。

第三阶段:SFT(监督微调)。从 CPT 检查点出发,我们分叉为两条路线:多任务 SFT 联合微调操作、导航、VQA 和空间定位;真实机器人 SFT 则基于内部遥操作数据进行微调,用于物理部署。

第四阶段:RL(强化学习)。从 SFT 检查点出发,我们使用 PPO 直接在模拟环境中优化闭环任务成功率,最终得到 Qwen-VLA-Instruct 模型。RL 仅在 SimplerEnv 中进行,但实验表明其收益可迁移至未见过的环境和机器人形态。

单一通用模型可媲美甚至超越专用模型#

实验结果表明了 Qwen-VLA 作为通用策略模型的潜力。单一模型可覆盖多个操作基准,包括 LIBERO、Simpler、RoboCasa 和 RoboTwin,并在多项任务上接近或超越专用策略模型。

基准 最佳专用模型 Qwen-VLA
LIBERO ABot-M0 98.6% 97.9%
RoboCasa-GR1 ABot-M0 58.3% 56.7%
Simpler-WidowX StarVLA-OFT 64.6% 73.7%
RoboTwin-简单 / 困难 ABot-M0 86.0% / 85.0% 86.1% / 87.2%

在机器人操作基准上,Qwen-VLA-Instruct 在 LIBERO 上达到 97.9%,在 Simpler-WidowX 上达到 73.7%,在 RoboTwin-简单 / 困难上分别达到 86.1% / 87.2%。许多对比方法是为单个基准微调的专用模型,而 Qwen-VLA 是在单一框架下训练的统一通用模型。

在视觉语言导航(VLN-CE)任务上,Qwen-VLA-Instruct 在 R2R Val-Unseen 上达到 69.0% 的 Oracle 成功率和 57.5% 的成功率,在更具挑战性的 RxR Val-Unseen 上达到 59.6% 的成功率和 47.8% 的 SPL,超越了所有开源基线模型。

在真实世界的 ALOHA 双臂实验中,Qwen-VLA 预训练模型在域内任务上平均成功率达到 83.6%,在域外任务上平均成功率达到 76.9%,大幅超越从零开始训练(48.5% / 36.2%)和 $\pi{0.5}$π 0.5​(71.6% / 41.5%)的结果。

真实世界域外泛化能力#

我们同样关注 Qwen-VLA 在真实机器人上的泛化表现。

在真实世界的 ALOHA 双臂机器人实验中,Qwen-VLA 展现了对未见过的颜色、物体、背景、位置和语言指令的泛化能力。与从头训练的模型相比,使用 Qwen-VLA 预训练的模型在真实世界的分布外场景下表现出明显的性能提升。

这部分最好通过视频来展示。以下演示均使用 Qwen-VLA-Base 模型进行测试。当要求“拿起绿色球”或“拿起蓝色球”时,模型能够根据颜色特定的指令正确执行动作。当出现玩具、蔬菜或太阳镜等未见过的物体时,模型仍能遵循语言指令抓取或移动它们。当背景、光照和桌面布局发生变化时,模型保持相对稳定。对于“整理桌面”这类组合型任务,模型能够识别多个目标并执行多步骤操作。

与单纯的表格相比,这些视频更能体现 Qwen-VLA 的核心价值:

该模型并非仅仅在固定环境中记忆动作模板,而是在学习理解目标,并在真实世界的各种变化条件下执行动作。

动态场景中的零样本泛化

除了静态桌面操作之外,Qwen-VLA 在动态操作任务中也展现出了零样本泛化能力。

在 DOMINO 动态操作基准测试中,Qwen-VLA-Instruct 并未针对该基准进行专门微调,但仍取得了 26.6% 的成功率和 39.5 的操作得分,超越了多种标准 VLA 基线模型,甚至优于一些专门用于动态操作任务的专家模型。

这表明该模型不仅在静态场景中学习抓取模板,还从空间理解到运动控制层面,习得了更具迁移性的动作先验知识。基于视觉观察、语言目标及其动作生成能力,模型能够直接生成连贯的动作序列,并在动态交互窗口内完成任务。

从多模态理解到具身智能

Qwen-VLA 是通义千问(Qwen)多模态能力向具身智能领域的自然延伸。

过去,多模态模型主要侧重于理解世界。通过 Qwen-VLA,我们进一步探索模型如何基于视觉和语言在物理世界中生成动作。

Qwen-VLA 统一了机器人操控、视觉语言导航以及跨本体控制。它将 Qwen 的视觉理解与空间推理能力连接到连续动作生成。通过在真实机器人数据、人类第一人称数据、合成仿真数据以及通用视觉语言数据上进行联合预训练,它学习到了更通用的具身经验。同时,它也展示了通用策略模型在操控基准测试、真实世界分布外泛化以及零样本动态操控方面的潜力。

具身智能仍处于早期阶段。长程真实世界任务、故障恢复、持续学习以及更复杂的人-机-环境交互仍然充满挑战。但 Qwen-VLA 指明了清晰的下一步:

模型不仅应理解世界——它们还应学会在其中行动。

@article{qwenvla, title={Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments}, author={Qwen Team}, year={2026}, eprint={2605.30280}, archivePrefix={arXiv}, primaryClass={cs.RO}, url={https://arxiv.org/abs/2605.30280},}