# Qwen-VLA：统一跨任务、环境与机器人形态的视觉-语言-动作建模

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-05-28 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpqd5x5l03y8slno6er85jod
- 原文链接：https://arxiv.org/abs/2605.30280

## 精选理由

Qwen-VLA 让一个模型同时搞定操作、导航和轨迹，在具身智能统一化上迈出了关键一步。虽然还停在实验室阶段，但 97.9% LIBERO 和真实世界泛化结果证明这条路走得通，做机器人的值得认真读。

## AI 摘要

Qwen-VLA是一个统一的具身基础模型，将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现，使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台，引入了感知载体感知的提示条件机制，并将操作、导航与轨迹预测统一到一个框架中。实验显示，Qwen-VLA-Instruct在多个基准上表现优异，例如在LIBERO达到97.9%，在真实世界ALOHA实验中平均分布外成功率为76.9%。

## 正文

具身智能通常通过针对操作或导航等单个任务的专用模型进行研究，导致能力碎片化，且在任务、环境和机器人本体之间的泛化能力有限。在本工作中，我们研究了异构的具身决策问题能否统一到一个单一的视觉-语言-动作模型中。我们提出了Qwen-VLA，一个统一的具身基础模型，它将Qwen的视觉-语言建模栈从感知、理解和推理扩展到了通过基于DiT的动作解码器进行连续动作和轨迹生成。Qwen-VLA通过一个大规模联合预训练方案进行训练，数据来源多样，包括机器人操作轨迹、人类第一人称演示、合成仿真数据、视觉与语言导航数据、轨迹中心监督数据以及辅助的视觉-语言数据。为了支持多种机器人平台，我们引入了具身感知提示词条件化，其中特定于机器人的文本描述指明了当前的本体和控制约定。我们进一步将操作、导航和轨迹预测整合到一个统一的动作与轨迹预测框架中，从而实现了跨机器人形态、任务族和环境的可迁移视觉定位、空间推理和连续动作生成。在操作、导航和轨迹中心基准上的实验表明，在场景布局、背景、光照、物体配置和机器人本体变化的情况下，模型具有一致的多任务性能和分布外泛化能力。Qwen-VLA-Instruct在LIBERO上达到97.9%，在Simpler-WidowX上达到73.7%，在RoboTwin-Easy/Hard上分别达到86.1%/87.2%，在R2R上达到69.0%的OSR，在RxR上达到59.6%的SR，在真实世界ALOHA实验中平均OOD成功率为76.9%，在DOMINO动态操作任务中零样本成功率达到26.6%。
