# Qwen-Robot Suite：面向物理世界智能的基础模型套件

- 来源：Qwen：Blog Retrieval（API）
- 作者：QwenTeam
- 发布时间：2026-06-16 10:00
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmqg5kvq2006fslncudi17omu
- 原文链接：https://qwen.ai/blog?id=qwen-robotsuite

## 精选理由

Qwen把导航、操作和世界模型打包成机器人基础套件，用统一语言接口串起来，这是具身智能从单点突破走向系统化的信号，虽然离真实世界还有距离，但方向很清晰。

## AI 摘要

Qwen 发布三款基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控观测协议统一指令跟随、点/物体目标导航、目标追踪和自动驾驶五类任务，在 VLN-CE RxR 上达 76.5% SR，HM3Dv2 物体目标导航（仅 RGB）75.6% SR，EVT-Bench 追踪率 90.0%，NAVSIM 91.4 PDMS。Manip 利用规范状态-动作空间对超 38,100 小时异构开源机器人数据进行跨本体训练。World 通过自然语言动作接口协同训练 20 余种本体，预测操控、驾驶和导航的物理未来。三者共同将通用智能转化为物理行动。

## 正文

摘要 Qwen 系列基础模型已具备对物理世界强大的感知与推理能力。但“看见”不等于“行动”：视觉与语言理解同物理控制之间的鸿沟，仍是具身智能的核心瓶颈。Qwen-Robot Suite 通过三个基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld——弥合了这一鸿沟。Nav 通过可控观测协议统一了五类导航任务族。Manip 将异构机器人数据转化为一致的规范空间，实现了跨形态的大规模训练。World 在单一世界模型下，通过自然语言动作接口对 20 多种形态进行协同训练。三者共同构建了一个智能体系统，使通用智能能够直接转化为物理行动。

Qwen 系列多模态基础模型在理解物理世界方面取得了显著进展。Qwen-VL 能够解析复杂的空间关系、识别杂乱场景中的物体、遵循多步骤视觉指令，并对物理配置进行推理，为物理智能体提供了初步的认知基础。一个视觉语言模型已经可以用语言进行规划：“去厨房，找到红色杯子，拿起来，放到架子上。”

但理解物理世界并不等同于在其中行动。一个能规划这些步骤的视觉语言模型，无法生成执行这些步骤所需的运动指令。这本质上是一个对齐挑战：语言指令与物理动作信号存在于不同的表征空间，弥合这一鸿沟需要的远不止感知能力。更困难的是，填补这一差距所需的具身数据与互联网文本有着根本不同。这类数据天然具有异构性，采集成本高昂，且多样性狭窄。一条导航轨迹、一次远程操控抓取、一段行车记录仪视频，它们所处的动作空间、观测格式和形态互不兼容。简单地将它们汇集在一起，产生的不是协同效应，而是冲突。

Qwen-Robot 套件通过三个基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld——填补了这一空白，每个模型都将语言与不同领域的物理动作对齐。我们追求跨语言指令的泛化能力以及对物理规律的遵循，并在两方面都取得了显著进展。在这篇文章中，我们还探讨了这些模型作为构建通用智能体系统的底层工具的潜力。

Qwen-RobotNav：物理智能体的移动入口——通过可控观测编码和面向智能体系统的工具接口，将视觉-语言表征空间桥接到移动动作，统一了指令跟随、点/物体目标导航、目标追踪和自动驾驶。Qwen-RobotManip：物理智能体的交互基础——通过规范的状态-动作空间和相机帧增量位姿，将视觉-语言表征空间桥接到操作动作，实现了在超过 38,100 小时的开源语料库上进行连贯的跨本体训练。Qwen-RobotWorld：物理智能体的无限世界——通过自然语言动作接口，将视觉-语言表征空间桥接到世界动态，使单一世界模型能够预测操作、驾驶和导航等场景中符合物理规律的未来状态。

每个模型都有各自的技术报告和深度解读博客。本文讲述的是它们如何协同配合的故事。

Qwen-RobotNav：物理移动的入口#

导航

在智能体能够操作任何物体之前，它必须先到达那里。移动导航涵盖了具有根本不同记忆需求的任务：指令跟随需要长程上下文，而目标追踪几乎完全关注最近的帧。没有任何一种固定的观测策略能同时满足两者。

基于 Qwen3-VL 构建的 Qwen-RobotNav，通过一个参数化的导航接口解决了这一问题。该接口包含两个互补维度：一是任务模式，用于选择导航行为（指令跟随、物体搜索、目标追踪、自主驾驶）；二是可控的观测参数（模型 token 预算、时间衰减、每摄像头权重、帧采样模式），用于控制视觉历史信息的编码方式。Qwen-RobotNav 在 1560 万个样本上进行了训练，并通过与视觉语言数据的协同训练来保持扎实的感知能力，从而在单一权重集下统一了五个任务族。该参数化接口也使 Qwen-RobotNav 成为构建智能体系统的天然基础模块。一个上层规划器（Qwen3.7-Plus）将长程目标分解为子任务，并在任务过程中动态切换 Qwen-RobotNav 的任务模式和上下文策略，通过反复调用同一模型来组合出复杂行为。这将该系统扩展为具备持久记忆的长程推理能力，使其能够解决需要多步导航、证据收集和基于感知的响应生成的复杂用户意图。

亮点：

5 个领域

8 项 SOTA

单一模型统一 VLN、ObjNav、

追踪、驾驶与 EQA

上下文

= 接口

4 轴观测协议

零架构改动

智能体式

导航作为工具调用

两级记忆

在 EQA 上树立新标杆

泛化能力

野外单摄像头

在未见环境中的部署

统一多域导航：一个模型、一套权重，在 5 个导航领域均达到业界领先水平：VLN-CE RxR 上成功率达 76.5%，HM3Dv2 物体目标导航（仅 RGB，超越基于深度的方法）上成功率达 75.6%，EVT-Bench 上追踪率达 90.0%，NAVSIM 上 PDMS 达 91.4，并在 3 个 EQA 基准上取得新最佳成绩，且从 2B 到 8B 参数规模均呈现一致的扩展能力。可控观测协议：四个维度（视觉 token 预算、时间衰减、每摄像头权重、帧采样模式）作为推理时参数暴露，并在训练时对每个样本随机化，从而无需重新训练或修改架构即可实现任意推理时配置。智能体导航系统：设计为双层系统中的可重配置导航原语，上层规划器（Qwen3.7-Plus）分解长程目标并调度可配置的导航调用，同时维护双层记忆，在 EXPRESS-Bench 上相比此前最佳方案提升 +15.4%，且导航步数减少 77%。野外泛化能力：零样本部署于配备单个低分辨率内置摄像头的 Unitree Go2 四足机器人上，展现出对野外环境及无约束自然语言指令的强大泛化能力，无需任何针对特定环境的微调。

Qwen-RobotNav 基准测试

部署

零样本部署于 Unitree Go2 四足机器人（NVIDIA Jetson Thor，延迟 196ms），仅使用内置低分辨率摄像头。该机器人在一个此前未见过的公寓中，跨多个房间执行逐步的口头指令。

指令跟随

我们在一个未见过的展厅中评估了一项往返导航任务：机器人首先根据语言指令从客厅导航 21.78 米到达一个病房，随后收到反向指令，必须精确地原路返回整个路线。这尤其具有挑战性，因为它要求模型在长距离中保持空间感知能力，在正向和反向两个方向上锚定多样化的视觉地标，并仅凭语言执行精确的双向位置控制。

跨具身形态

同一套权重同时服务于足式机器人导航和自动驾驶。在NAVSIM闭环驾驶测试中，Qwen-RobotNav-4B取得了91.4 PDMS的成绩。

阅读 Qwen-RobotNav 博客 →

Qwen-RobotManip：物理交互的基础#

操控

物理智能体需要与现实世界交互——例如，用机械臂完成操控任务。然而，生产线上的工业臂和厨房里的服务臂可能执行视觉上相似的抓取动作，但它们的关节配置和动作空间却完全不同。核心挑战在于让异构的具身形态在表征上兼容，从而让跨机器人和跨数据源的规模化产生协同效应而非冲突。

Qwen-RobotManip 基于 Qwen3.5-4B VL 构建，并采用流匹配 DiT 动作头，引入了三种机制来解决这一问题。一个统一的 80 维状态-动作表征在单臂、双臂、灵巧手和移动式具身形态之间共享。相机坐标系下的末端执行器增量位姿动作使得视觉上相似的动作在不同机器人之间数值上接近，从而抽象掉了形态差异。上下文策略自适应将执行历史作为隐式的具身形态特征，用于即时自适应调整。

一旦表征框架统一，数据壁垒就降低了。我们在 11,320 小时的开源机器人数据、1,933 小时的开源第一人称人类视频，以及通过我们的人到机器人合成流水线从人类视频合成的、涵盖 15 种具身形态的 24,808 小时机器人演示数据上训练该 VLA 模型——总计超过 38,100 小时。仅使用开源数据，该模型就已展现出涌现的泛化能力，包括对扰动的鲁棒性、零样本指令跟随、反应式错误恢复以及跨具身形态迁移。

亮点：

对齐

表征 · 运动 · 行为

三维对齐

仅使用开源数据

38K 小时操控数据

涵盖 15 种具身形态

领先

分布外泛化

在所有基准测试中

排名第一

RoboChallenge Table30 v1 通用型赛道

包揽前两名，领先第三名 20%

统一跨具身对齐框架——一种统一的80维状态-动作表征可适配多种具身形态，相机坐标系下的末端执行器增量位姿使视觉上相似的动作在数值上接近，而上下文策略自适应将执行历史读取为隐式具身标识符——三者共同实现跨具身形态的一致信号提取。大规模人机合成——通过动作重定向、手部去除与修复、模拟渲染及深度引导合成等流程，将1933小时的第一人称人类视频转化为涵盖15种具身形态的24808小时机器人演示数据，并配合多阶段数据筛选管线确保数据质量。分布外泛化：LIBERO-Plus 91.4%（较π0.5提升7.0），RoboTwin-C2R Hard 69.4%（较π0.5提升21.5），RoboCasa365 Composite-Unseen 14.9%（为次优方法的3倍），EBench 45.6%（较次优方法提升18.5）；RoboTwin-IF 72.0%（较π0.5提升22.4），证实了真正的语言条件控制能力；在RoboTwin-XE上达到次优方法的3倍，展示了零样本跨具身迁移能力。强劲的真实世界性能：在RoboChallenge Table30 v1通用赛道中以45%的成功率排名第一，包揽前两名并领先第三名20%；在真实机器人平台上经过验证，域内与分布外任务均达到此前最优方法的2倍，支持少样本自适应及跨具身技能迁移。

关键发现——对齐是规模化的前提。只有具备统一跨具身表征（UnifiedSpace + UnifiedEEF）的模型才展现出清晰的log-linear数据缩放规律。若缺乏对齐，增加数据只会产生波动或平坦的曲线——规模化无法弥补有缺陷的公式设计。

多样化的真实世界任务

单一通用策略即可处理涵盖多种任务类别、场景和物体的复杂操作。

指令跟随

在真实环境（上行）和仿真环境（下行）中跟随多种未见过的指令。

跨具身迁移

在其他具身形态上训练的任务可零样本迁移至新具身（上行）；少样本演示则能快速适应全新任务（下行）。

阅读 Qwen-RobotManip 博客 →

Qwen-RobotWorld：无限机器人世界#

想象一下，真实世界的经验是机器人领域最稀缺的资源。Qwen-RobotWorld 通过直接学习世界的状态转移函数来解决这一问题：给定当前观测和一个自然语言动作，它能预测世界接下来会变成什么样。其关键设计选择是将所有动作用自然语言表达——这能将末端执行器位姿、转向指令和导航路径点统一到一个接口中，使得 20 多种具身形态和 500 多种动作类别能够在“具身世界知识”语料库（860 万个视频-文本对，超过 2 亿帧）下共同训练。一个 60 层的双流 MMDiT 将 Qwen2.5-VL 的语义表征与视频潜变量耦合。使用完整的多模态大语言模型作为动作编码器——而非轻量级文本编码器——是至关重要的：它带来了内化的世界知识，即机械臂是刚体、流体会扩散、物体会下落，从而隐式地将生成结果约束在物理上合理的未来方向。每个领域相互促进：操作任务教会接触物理，驾驶任务教会 3D 几何，导航任务教会房间尺度的空间推理。

亮点：

顶尖

覆盖

4 项基准

20 多种

机器人具身形态

统一

860 万

跨场景

训练对

1300 多种

操作

技能

语言驱动的统一动作接口——自然语言将 20 多种机器人形态和 500 多个动作类别标准化为单一训练接口，使得操作、驾驶、导航以及人机迁移能够联合训练；每个领域相互增强。双流 MMDiT + Qwen2.5-VL 动作编码器——一个完整的多模态大语言模型作为动作编码器（而非轻量级文本编码器），利用内化的物理世界知识，将复杂的组合指令解析为精确的生成信号，充当合成数据引擎、闭环策略评估器和动作规划器。排名：在 EWMBench（动作保真度领先第二名 33%）和 DreamGen Bench 上综合排名第一；在 WorldModelBench（完美遵循牛顿定律、质量守恒、流体动力学）和 PBBench 上位列开源模型第一。能力：细粒度语言理解（改变一个关键词 → 产生不同的未来）；在 8 种以上形态上实现多视角一致的人机迁移；在 RoboTwin-IF 上具备零样本鲁棒性。

任意指令跟随

改变单个关键词——无论是物体、目的地还是动作动词——都会产生相应不同的未来。世界模型真正理解语言，而不仅仅是模式匹配。

不同物体

拿起红色草莓

拿起黄色土豆

不同形态

组装相机零件

组装相机零件

不同目的地

将笔放在木质托盘上

将笔放在白纸上

不同动作

向前伸出胶水

将胶水放入笔筒

多视角一致生成

给定单一指令，Qwen-RobotWorld 能生成跨多个摄像机视角、在时间和空间上一致的视频——这对于仿真到现实的迁移和多摄像机策略训练至关重要。

查看更多多视角示例（还有 16 个）

人 → 机器人迁移

给定人类演示，Qwen-RobotWorld 能生成跨多种形态的逼真机器人执行过程——无需远程操控。

ARX-L5

人类演示

机器人执行

xArm7

人类演示

机器人执行

Franka Panda

人类演示

机器人执行

Sawyer

人类演示

机器人执行

查看更多形态（Kinova Gen3, Piper, KUKA iiwa, Kinova Jaco）

Kinova Gen3

人类演示

机器人执行

Piper

人类演示

机器人执行

KUKA iiwa

人类演示

机器人执行

Kinova Jaco

人类演示

机器人执行

自动驾驶与室内导航

驾驶任务教会模型大规模三维几何与多智能体动态；导航任务则教会模型房间尺度的空间推理。每个领域都相互强化。

驾驶

室内导航

阅读 Qwen-RobotWorld 博客 →

从模型到智能体：形成闭环#

每个模型本身都具备独立用途——但由于三者都暴露了以语言优先的接口，通用型 Qwen 模型可以将它们组合为物理世界工具，从而将通用智能与物理行动连接起来。我们有一个内部项目 Qwen-RobotClaw，这是一个机器人智能体工具包，允许 Qwen VLM 智能体调用 Qwen-Robot Suite 模型作为物理世界工具，同时妥善管理长周期任务所需的上下文与记忆，推动物理智能走向更通用、更复杂的真实世界应用。以下是这一能力带来的早期示例。

开放式任务执行

Qwen-Omni 观察场景，通过语音随机提出操作任务，并实时判断执行情况。每个视频展示的是 Qwen-RobotManip 在没有预定义任务列表的情况下即时完成任务——这表明通用多模态模型可以作为任务提出者和评估者，而套件模型则负责物理执行。

长周期操作

我们开发了一个由 VLM 驱动的智能体 VLA 系统，其中基础模型 Qwen-3.5 作为高层规划器，Qwen-RobotManip 负责底层执行。借助其在场景理解、空间推理和任务进度评估方面的能力，Qwen-3.5 将复杂的高层指令分解为一系列原子子任务，再由 VLA 执行。这种分工方式显著提升了对分布外场景和指令的鲁棒性。

我们用一个杂乱桌面上放置篮子的清桌任务来演示这一点。面对这种完全超出分布的场景和抽象指令，直接使用VLA模型会表现出明显异常的行为（右侧）。而以Qwen-3.5作为规划器时，系统会实时将任务分解为细粒度的原子性子任务（左侧），让VLA能够每次专注于一个简单步骤，从而展现出组合泛化能力。

我们还观察到，子任务分解有助于系统从失败-重试循环中恢复。当高层VLM检测到执行卡住时，它会通过下发新的子任务重新规划，使系统能够继续推进，最终成功完成任务。

智能体 + VLA（成功）

仅用VLA（失败）

智能体导航与具身问答

通过将智能体系统与Qwen-RobotNav相结合，我们在长周期3D物理世界探索任务上取得了相比此前最先进水平的显著提升，这些任务包括HM-EQA、MT-HM3D和EXPRESS-Bench等具身问答基准。我们还可以在真实环境中部署同样的开放世界探索能力，如下方演示所示。更多技术细节将在后续更新中发布。

在第一个演示中，用户要求智能体在一栋真实建筑中找到一间开放的洗手间。智能体扫描环境，沿着走廊级别的线索寻找洗手间标识，发现第一间洗手间因可见的“Cleaning in Progress / 暂停使用”标识而不可用，随即重新规划，在建筑另一侧寻找替代洗手间。在通过视觉证据确认第二间洗手间开放且可进入后，它返回了一个基于证据的答案。

在第二个演示中（此前与Qwen3.7-Max一同发布），智能体调用Qwen-RobotNav自主探索一个开放的校园环境，沿途纠正偏差，最终找回一把丢失的雨伞。

Chat2Robot

我们提供了一项实验性功能——Chat2Robot，你可以在浏览器中直接与机器人对话。只需输入一条自然语言指令，即可看到机器人实时响应。快来试试，亲身体验Qwen-Robot Suite吧！

注意：Chat2Robot 目前仅支持 Qwen-RobotManip。部署的策略仅基于 RoboTwin-Clean 数据集训练，该数据集仅包含 50 个任务——它并非一个完美的策略。我们在此的目标是展示一定程度的零样本指令跟随能力。此功能仍在积极开发中，可能尚未完全完善——欢迎您提供反馈和建议！

我们感谢 D-Robotics（Digua）对此功能的支持。

下一步计划#

物理世界智能仍处于起步阶段。接触密集的长程任务、持续学习、通用规划器与物理世界执行器之间更紧密的集成，以及更丰富的人-机器人-环境交互，这些都仍是待解难题。但路径正变得清晰：从强大的多模态理解出发，将视觉-语言表征空间桥接到每种物理动作类型，扩大训练规模，并追求泛化能力。

一个能够去往任何地方、执行任何任务、并预见下一步的物理智能体。

这就是我们的目标——而 Qwen-Robot Suite 是我们迈向它的第一步。

@article{qwenrobotnav, title={Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System}, author={Qwen Team}, year={2026}}@article{qwenrobotmanip, title={Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models}, author={Qwen Team}, year={2026}}@article{qwenrobotworld, title={Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation}, author={Qwen Team}, year={2026}}
