Qwen-VLA:统一跨任务、环境与机器人形态的视觉-语言-动作建模

HuggingFace Daily Papers(社区热门论文)·2026-05-28 08:00·90天前
AI 导读

Qwen-VLA是一个统一的具身基础模型,将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现,使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台,引入了感知载体感知的提示条件机制,并将操作、导航与轨迹预测统一到一个框架中。实验显示,Qwen-VLA-Instruct在多个基准上表现优异,例如在LIBERO达到97.9%,在真实世界ALOHA实验中平均分布外成功率为76.9%。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

Qwen-VLA:统一跨任务、环境与机器人形态的视觉-语言-动作建模

2026-05-28 08:00· 90天前
AI 导读

Qwen-VLA是一个统一的具身基础模型,将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现,使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台,引入了感知载体感知的提示条件机制,并将操作、导航与轨迹预测统一到一个框架中。实验显示,Qwen-VLA-Instruct在多个基准上表现优异,例如在LIBERO达到97.9%,在真实世界ALOHA实验中平均分布外成功率为76.9%。

推荐理由

Qwen-VLA 让一个模型同时搞定操作、导航和轨迹,在具身智能统一化上迈出了关键一步。虽然还停在实验室阶段,但 97.9% LIBERO 和真实世界泛化结果证明这条路走得通,做机器人的值得认真读。

正文 · AI 翻译

具身智能通常通过针对操作或导航等单个任务的专用模型进行研究,导致能力碎片化,且在任务、环境和机器人本体之间的泛化能力有限。在本工作中,我们研究了异构的具身决策问题能否统一到一个单一的视觉-语言-动作模型中。我们提出了Qwen-VLA,一个统一的具身基础模型,它将Qwen的视觉-语言建模栈从感知、理解和推理扩展到了通过基于DiT的动作解码器进行连续动作和轨迹生成。Qwen-VLA通过一个大规模联合预训练方案进行训练,数据来源多样,包括机器人操作轨迹、人类第一人称演示、合成仿真数据、视觉与语言导航数据、轨迹中心监督数据以及辅助的视觉-语言数据。为了支持多种机器人平台,我们引入了具身感知提示词条件化,其中特定于机器人的文本描述指明了当前的本体和控制约定。我们进一步将操作、导航和轨迹预测整合到一个统一的动作与轨迹预测框架中,从而实现了跨机器人形态、任务族和环境的可迁移视觉定位、空间推理和连续动作生成。在操作、导航和轨迹中心基准上的实验表明,在场景布局、背景、光照、物体配置和机器人本体变化的情况下,模型具有一致的多任务性能和分布外泛化能力。Qwen-VLA-Instruct在LIBERO上达到97.9%,在Simpler-WidowX上达到73.7%,在RoboTwin-Easy/Hard上分别达到86.1%/87.2%,在R2R上达到69.0%的OSR,在RxR上达到59.6%的SR,在真实世界ALOHA实验中平均OOD成功率为76.9%,在DOMINO动态操作任务中零样本成功率达到26.6%。