Qwen:Blog Retrieval(API)
精选
81AI 编辑部评分,满分 100

Qwen-AgentWorld:面向通用智能体的语言世界模型

2026-06-23 11:30· 46天前· QwenTeam
AI 导读

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

推荐理由

Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。

正文 · AI 翻译
  • 原生世界建模:环境建模是从持续预训练阶段(CPT → SFT → RL)开始就作为训练目标,而非在通用大语言模型之上进行的事后适配。
  • 七个领域,一个模型:单个模型即可模拟基于文本(MCP、搜索、终端、SWE)和基于图形界面(网页、操作系统、安卓)的环境,且知识可在不同领域间迁移。

与该模型一同发布的还有 AgentWorldBench,这是一个涵盖七个领域的评估基准,并配有来自真实环境的成对真实观测数据。两者均可从 Hugging Face 和 ModelScope 获取。


语言智能体经过训练可在交互式环境中行动,但此前没有任何语言模型被明确训练过对环境本身进行建模——即根据当前状态和智能体的动作预测接下来会发生什么。

路线图:Qwen-AgentWorld 是我们探索如何基于语言模型构建的世界建模,进一步推动通用智能体能力边界的尝试。

我们同时探索了如何实现语言世界建模,以及如何将其应用于推进通用智能体的发展:

  • 首先,我们构建了一个用于智能体环境模拟的基础模型:Qwen-AgentWorld 是首个在单个模型内覆盖七个智能体交互领域(MCP、搜索、终端、SWE、网页、操作系统、安卓)的语言世界模型,通过 CPT → SFT → RL 在超过 1000 万条真实环境交互轨迹上进行训练。在 AgentWorldBench 上,Qwen-AgentWorld-397B-A17B 实现了最高的整体模拟质量,超越了 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。
  • 其次,我们通过两种互补范式研究了世界建模在智能体训练中的作用:作为解耦的环境模拟器,它为智能体强化学习提供了卓越的可扩展性和可控性。可控的模拟强化学习能够以真实环境无法实现的方式塑造智能体行为,并且显著优于仅在真实世界环境中训练的强化学习;作为统一的智能体基础模型,LWM 预热使得在七个基准测试(包括三个完全跨域的任务)上能够有效迁移到多轮智能体任务,而无需对智能体任务进行任何强化学习微调,这初步验证了语言世界模型可以作为构建更强智能体模型的基础。

Image 3: Qwen-AgentWorld OverviewQwen-AgentWorld:一个跨越七个统一领域的原生语言世界模型,具有两种用于增强通用智能体的互补范式。

交互式演示 #

探索由 Qwen-AgentWorld 在所有七个领域模拟的真实智能体-环境对话。点击任意思考轨迹以查看模型的内部推理过程。

Qwen-AgentWorld 演示 — 7 个领域(终端、搜索、MCP、SWE、安卓、网页、操作系统)

展开


第一部分:构建智能体环境模拟的基础模型#

七个领域,一个模型 #

Qwen-AgentWorld 涵盖了七类交互式环境。对于三个图形用户界面领域,环境观察采用可渲染代码(无障碍树 XML、HTML、UI 层级标记)的形式,而非像素帧,从而实现对视觉环境的纯文本世界建模。

领域 LWM 模拟的内容 代表性预测
文本环境
终端 命令行环境:Shell 输出、文件系统状态、进程行为 多步命令管道的完整 Shell 输出
搜索 搜索引擎结果:URL、摘要、排名、页面内容 真实的 URL 标识符、自然的来源排序顺序、查询特定的事实细节
MCP API 服务器响应:工具调用结果、数据库状态、服务协议 跨九个连续 Notion API 调用的跨调用模式一致性
SWE IDE / 代码编辑环境:git diff、测试结果、编译错误 代码变更的文件修改和测试结果
图形用户界面环境
网页 用户交互后的浏览器 DOM 状态变化 HTML 与无障碍树更新
Android 触摸/手势操作后的 Android UI 层级变化 UI 层级 XML 标记
操作系统 桌面操作系统状态:文件系统、窗口管理、应用程序行为 无障碍树 XML 更新

训练流程 #

Image 4: Training Pipeline三阶段训练流程:CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度。

Qwen-AgentWorld 采用端到端训练,从持续预训练阶段起就将环境建模作为明确目标。三阶段流程遵循同一原则:CPT 注入,SFT 激活,RL 提升。

第一阶段:持续预训练(CPT)通过非思考轨迹注入环境知识。数据来源于专用智能体基础设施(容器化执行沙箱、MCP 服务器、Android/Web/OS 模拟器)、开放环境交互轨迹以及内部智能体轨迹。除环境数据外,我们还纳入了涵盖工业控制、网络安全、法律、医学、金融和时事等领域的专业世界知识语料库。一项关键贡献是轮次级信息论损失掩码:针对每个(动作,观察)对的四项表层统计指标,识别出携带真实环境信息的轮次,并将其余轮次从损失中屏蔽,同时保留它们作为上下文。

第二阶段:监督微调(SFT)通过 `<think>...</think>` 块将下一状态预测激活为显式思维模式。我们采用拒绝采样来筛选高质量的思考轨迹,最终得到 7,094 个训练样本。

第三阶段:强化学习(RL)通过混合奖励机制提升输出质量。我们使用 GSPO 进行 RL 训练。奖励结合了基于评分标准的 LLM 裁判(评估多维质量)与基于规则的验证器(适用于可通过编程方式检查精确正确性的领域)。

AgentWorldBench #

Image 5: AgentWorldBench OverviewAgentWorldBench 概览:领域分布、源基准、评估维度及各领域轨迹统计。

为评估语言世界模型,我们推出了 AgentWorldBench,这是一个综合性基准测试,基于 5 个前沿模型在 9 个成熟基准(如 Tool Decathlon、Terminal-Bench 1.0 与 2.0、OSWorld-Verified)上的轨迹真实观测数据构建而成。每个评估样本都配有从真实环境执行中获取的 ground-truth 观测结果,从而支持基于参考的评分。AgentWorldBench 通过开放式评分标准,从格式、事实性、一致性、真实性和质量五个维度评估世界建模质量,深入检验模型的推理、知识和长上下文能力。

Performance #

Image 6: Qwen-AgentWorld Main ResultsAgentWorldBench 结果:各领域五维评分均值。Qwen-AgentWorld-397B-A17B 取得最高总分(58.71),超越 GPT-5.4(58.25)及其他前沿模型。

Qwen-AgentWorld-397B-A17B 取得最高总体均值(58.71),超越 GPT-5.4(58.25)及所有其他前沿模型。其优势在 Terminal 和 SWE 两个领域最为显著,这两个领域的预测需要对代码执行状态和工具 API 行为进行精确建模。

在 35B-A3B 规模下,三阶段流水线将总体均值提升了 +8.66 分(从 47.73 提升至 56.39),使 Qwen-AgentWorld-35B-A3B 超越 Claude Sonnet 4.6(56.04)。这一改进在文本和 GUI 两个领域均表现一致。

世界模型的思维内部

除了整体性能,语言世界模型的趣味之处在于其推理方式。我们分析了横跨四个文本领域的 129 条思考轨迹,发现了三种涌现的推理模式。

Image 7: Qwen-AgentWorld Reasoning PatternsLWM 推理模式:审慎性自我修正、信息泄露防范以及多步因果推理。

审慎性自我修正。模型使用“等等!”作为认知中断信号来修正中间预测。在 129 轮次中,我们统计到 1,347 次此类中断(每轮 10.4 次),涵盖事实错误、认识论局限(“我实际上无法执行 np.random.seed(42)”)以及视角转换。

信息泄露防护。在搜索领域中,模型持有一个智能体试图寻找的参考答案。当查询不相关时,模型通过确保摘要片段不会意外泄露目标来防止信息泄露——这相当于世界模型层面的心智理论。

多步因果推理。预测 `curl -s localhost:3000 | python3 -m json.tool` 的输出需要六步推理链:Node.js 缺失 → 服务器从未启动 → 端口 3000 上无监听进程 → curl 静默失败 → 空管道 → json.tool 抛出 JSONDecodeError。


第二部分:探究世界建模在智能体训练中的作用#

我们研究了两种互补范式,世界建模通过这两种范式来增强通用智能体。

为什么世界建模对智能体至关重要?#

不是为了替代真实环境,也不是为了降低成本,而是作为推动前沿边界的互补维度

语言世界模型的作用。在智能体-环境交互循环中,策略决定做什么,世界模型预测接下来会发生什么。语言世界模型接收当前的交互历史和智能体的动作,并预测环境会返回什么:终端输出、API 响应、更新后的 DOM。这不是基于模板的生成。忠实的模拟需要多步因果推理(串联六个系统知识步骤来预测 curl 管道故障)、状态追踪(在连续九个 Notion API 调用中维护引用完整性)以及领域特定知识(Unix 语义、API 模式、浏览器渲染规则)。

为什么不仅仅/只使用真实环境?真实环境交互仍然是让智能体行为扎根于现实的金标准。语言世界模型并非旨在取代它,也主要不是一种降本措施。相反,语言世界模型开辟了一条补充真实环境的互补维度。

(1)超越真实环境的可扩展性与可控性。LWM 能够在不依赖专用基础设施(沙箱、GUI 虚拟机)的情况下,实现不同环境的轮次级扩展,涵盖极端场景、真实世界任务以及因不可逆操作或专有部署而无法实际执行的高价值专业领域。除了可扩展性,LWM 还具备精确的可控性:在真实环境中罕见或缺失的定向扰动,可以系统性地暴露智能体的弱点。针对这些扰动进行训练,有助于智能体处理仅靠真实环境训练无法覆盖的边缘情况,最终超越仅在真实环境中训练的智能体。

(2)内化的世界预测作为智能体能力。一个强大的通用智能体应同时具备决策能力和世界建模能力。世界建模使智能体能够预测未来环境状态,从而优化动作选择,有效实现作为内部规划步骤的心理模拟——而传统智能体训练仅关注从状态到动作的决策过程。因此,下一状态预测被内化为一种类似于“反思”但面向未来的元推理模式:先预测,再行动。此外,准确的下一状态预测本身就需要推理、知识、指令遵循和长上下文处理能力——这些正是通用智能体的基础能力。

通用语言环境模拟如何成为可能?构建通用语言世界模型需要三个要素协同作用。首先,环境多样性:在尽可能多的不同环境轨迹上进行训练,使模型能够接触到完整的状态转换模式谱系,而非仅仅记忆狭窄的集合。其次,跨领域泛化:我们的实验表明,在单一文本领域上进行训练能够提升所有其他文本领域的表现,这表明存在共享的底层环境建模能力,且该能力会随领域覆盖范围的扩大而增强。第三,通过持续预训练(CPT)获取世界知识:仅靠环境轨迹无法提供忠实模拟所需的事实基础。模拟合规监管平台需要法律知识;模拟搜索引擎对时事新闻的响应需要最新的事实覆盖。通过在持续预训练阶段融入专业领域的世界知识语料库(工业控制、网络安全、法律、医学、金融、时事),模型获得了环境模拟所依赖的事实基础。这三个要素——环境多样性、跨领域迁移和世界知识——共同使单一模型能够作为通用模拟器,服务于七个智能体交互领域。

范式一:解耦式模拟 #

作为独立模拟器,策略智能体与世界模型为分离模型时,Qwen-AgentWorld 提供了真实环境无法实现的扩展性与可控性。在此模拟强化学习(Sim RL)设置中,世界模型在智能体强化学习训练期间替代真实环境:智能体执行动作,世界模型预测下一观测状态,智能体从这些模拟推演中学习。关键发现如下:

  • 零样本环境泛化。Qwen-AgentWorld 能够模拟训练中完全未出现的 4k 个 OpenClaw 环境,在无需任何领域特定适配的情况下,在 Claw-Eval 上取得 +4.3 的模拟强化学习增益,在 QwenClawBench 上取得 +7.1 的增益。
  • 受控模拟至关重要。不受控的模拟强化学习带来的提升微乎其微;而可控扰动使 MCPMark 提升了 12.3 分,WideSearch 提升了 16.3 分,远超不受控的模拟强化学习。
  • 超越真实环境训练。可控模拟强化学习在 F1 分数上(50.3% 对 45.6%)超过了在真实搜索引擎上训练的 Real RL,同时通过对抗性片段设计塑造了更具针对性的智能体行为。
  • 虚构世界行之有效。在完全虚构且自洽的世界中训练的智能体能够泛化到真实搜索任务,同时从结构上防止智能体将模拟事实与现实世界知识混淆。
  • 状态是瓶颈。模拟强化学习的效果取决于向世界模型提供足够详细的初始状态;否则,模拟保真度会下降,下游收益也会随之减少。

可泛化的环境缩放 #

我们测试了世界模型是否能泛化到训练中完全未出现过的环境。OpenClaw 是一个开源智能体平台,其任务涵盖日程安排、编程、邮件分类、浏览器自动化和文件管理——这些任务完全超出了 Qwen-AgentWorld 的分布范围。我们为智能体强化学习训练模拟了 4,000 个 OpenClaw 环境,未进行任何领域特定的适配,同时对模拟器本身进行了消融实验:使用 Qwen3.6-Plus 作为模拟器带来的提升微乎其微,而 Qwen-AgentWorld-397B-A17B 则产生了显著的增益——这证实了世界模型的质量是模拟强化学习的瓶颈。智能体与不逼真的模拟器交互几乎学不到任何东西。

Claw-Eval QwenClawBench
Qwen3.5-35B-A3B 65.4 47.9
+ 模拟强化学习(使用 Qwen3.6-Plus) 66.7 47.8
+ 模拟强化学习(使用 Qwen-AgentWorld-397B-A17B) 69.7 55.0
Δ +4.3 +7.1
  • 所有分数均为在最大序列长度 256K 下,3 次独立运行的平均值。

可控模拟 #

更强大的能力在于可控性:使用自然语言指令在训练过程中塑造模拟器的行为。我们验证了两种模式。

MCP:环境适配。我们从真实的 MCP 工具使用轨迹中合成模拟系统提示词:每个提示词指定工具架构和服务器配置,总结隐藏的环境状态(数据库内容、权限设置、服务可用性),并定义可控的模拟指令,这些指令决定了模拟器在每一轮交互中的响应方式。控制指令会注入有针对性的扰动——间歇性 API 错误、需要后续调用的分页响应、强制进行多步检索的不完整中间结果,以及批量操作中的部分失败——从而系统性地暴露那些真实部署中很少出现的智能体弱点。

结果呈现出鲜明对比:没有控制指令的标准 Sim RL 没有带来有意义的提升(Tool Decathlon 实际上从 32.4 下降到了 31.5),因为模拟器缺乏足够的依据来生成可靠的响应。采用可控模拟后,Tool Decathlon 提升了 +3.7,MCPMark 提升了 +12.3。可控性不仅仅是影响提升幅度的因素——它是 Sim RL 在该领域能够起作用的先决条件。MCPMark 上更大的提升幅度(+12.3 对比 +3.7)表明,可控模拟对于需要大量顺序工具调用和谨慎处理中间结果的任务尤其有效。

Tool Decathlon MCPMark
Qwen3.5-35B-A3B-SFT 32.4 21.5
+ Sim RL(无控制) 31.5 24.6
+ Sim RL(有控制) 36.1 33.8
Δ +3.7 +12.3

搜索:虚构世界构建。我们构建了 1,000 个自洽的虚构环境,每个环境以一个包含内部一致虚构事实的关系型数据库(300–500 行)为基础。一个时间偏移后的环境可能包含一份 2029 年的智能手机市场排名,其中使用真实品牌名称但型号编号不存在。由于答案只存在于虚构设定中,智能体无法通过参数记忆来绕过搜索工具作答;由于所有事实都是虚构的,智能体不会将模拟事实与现实世界知识混淆。

按项目 F1 按行 F1
Qwen3.5-35B-A3B-SFT 34.02 13.72
+ Sim RL(有控制) 50.31 24.21
Δ +16.29 +10.49
Qwen3.5-397B-A17B-SFT 70.11 45.69
+ Sim RL(有控制) 73.98 51.74
Δ +3.87 +6.05

Sim RL 对比真实 RL

Image 8: Sim RL vs Real RL Training Curves模拟强化学习与真实强化学习在 WideSearch 上的对比:可控的模拟强化学习能够追踪甚至略微超越使用实时搜索引擎训练的真实强化学习。

性能表现。我们直接在 WideSearch 上对比了可控模拟强化学习与真实强化学习(使用实时搜索引擎训练)。模拟强化学习能够追踪甚至略微超越真实强化学习:在第 60 步时,按项目计算的 F1 分数达到 50.3%,而真实强化学习为 45.6%。

Image 9: Sim RL vs Real RL Tool Usage工具使用差异:经模拟强化学习训练的智能体会增加 `web_extractor` 调用次数,而经真实强化学习训练的智能体则会减少调用,这反映出可控模拟如何塑造出不同的智能体行为。

行为表现。更具信息量的信号来自智能体的行为。两种训练方式都将每条轨迹中的 `web_search` 调用次数从约 5 次减少到约 3.5 次,但 `web_extractor` 的调用次数出现了显著分化:模拟强化学习将其使用量从 2.5 次增加到 4.0 次,而真实强化学习则从 2.5 次减少到 1.5 次。由于模拟生成的摘要片段故意省略了详细内容,经模拟强化学习训练的智能体认识到,提取完整页面是组装完整答案的必要步骤。可控模拟能够以真实环境无法实现的方式,有针对性地塑造智能体行为。

范式二:智能体基础模型 #

在范式一中,智能体和世界模型是分开的模型。在此我们将其统一:同一个模型既选择动作,也预测环境状态。LWM 训练将下一状态预测作为一种内化的推理能力进行灌输。主要发现如下:

  • 激进的跨任务泛化能力。单轮、非智能体的 LWM 强化学习预热(无工具调用)能够迁移到跨五个领域、七个基准测试的多轮、工具调用型智能体任务上。
  • 领域泛化能力。在完全属于分布外、且 LWM 训练中完全不存在的领域上,性能也出现了提升(Claw-Eval 提升 11.3 分,QwenClawBench 提升 9.7 分,BFCL v4 提升 9.0 分),这证实了其具备可迁移的能力,而非领域特定的捷径。
  • 下一状态预测作为元推理模式。LWM 训练教会智能体在行动之前,先在头脑中模拟环境响应,这种能力能够跨任务格式和领域进行泛化。

我们通过在 Qwen3.5-35B-A3B-SFT 上运行 LWM 强化学习来验证这一点——这是一个无需工具调用的单轮任务——然后直接在七个基准测试的多轮、工具调用型智能体任务上进行评估,无需额外微调,其中包括三个 LWM 训练中未涉及的域外基准测试。

域内 域外
Terminal-Bench 2.0 SWE-Bench Verified
基线 33.3 64.5
+ LWM 强化学习 39.6 67.9
差值 +6.3 +3.4

域外结果尤其值得关注:LWM 训练流程中不包含任何 Claw 或函数调用数据,但在完全未参与世界模型训练的领域上,却分别取得了 +11.3、+9.7 和 +9.0 的提升。


使用 Qwen-AgentWorld 构建 #

部署 #

我们已开源 Qwen-AgentWorld-35B-A3B(Hugging Face、ModelScope),这是一个基于 MoE 架构的语言世界模型,总参数量 35B / 激活参数量 3B,支持 256K 上下文窗口。可通过以下方式进行部署和使用。

# SGLangpython -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3
# vLLMvllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

from transformers import AutoModelForCausalLM, AutoTokenizermodel = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen-AgentWorld-35B-A3B", torch_dtype="auto", device_map="auto",)tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen-AgentWorld-35B-A3B")

评估 #

AgentWorldBench 已在 Hugging Face 和 ModelScope 上以按领域划分的 JSONL 文件形式提供,每个文件包含来自真实环境的交互轨迹及其对应的真实观测结果。评估通过 eval/eval.py 使用三步流程进行:(1) 推理——运行世界模型生成预测观测结果;(2) 评判——使用大语言模型评判器,从五个维度(格式、事实性、一致性、真实感、质量)对每个预测结果与真实结果进行评分;(3) 汇总——计算各领域得分及总体得分。世界模型和评判器均使用兼容 OpenAI 的 API,支持 SGLang、vLLM 或专有端点。完整设置、数据格式及示例命令请参阅 GitHub README。

总结 #

Qwen-AgentWorld 是一个原生语言世界模型,在单个模型内以两种规模(35B-A3B 和 397B-A17B)覆盖了七个智能体交互领域。通过三阶段方案,CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度,从而从零开始逐步构建世界建模能力。我们研究了世界建模增强通用智能体的两种互补范式。作为解耦模拟器,我们在 Tool Decathlon、MCPMark 和 WideSearch 上验证了可控模拟的有效性,超越了非受控模拟和真实环境训练。作为统一智能体基础模型,LWM 预热迁移至七个基准测试(包括三个完全跨域任务)上的多轮智能体任务,初步验证了语言世界模型可作为构建更强智能体模型的基础。语言世界建模为扩展通用智能体开辟了一条互补的轴,超越了仅靠真实环境交互所能提供的范畴。

引用 #

@article{zuo2026qwen, title={Qwen-agentworld: language world models for general agents}, author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others}, journal={arXiv preprint arXiv:2606.24597}, year={2026}}

来源:Qwen:Blog Retrieval(API) · qwen.ai

事件后续 · 2查看事件全部 →

Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen:Blog Retrieval(API)·2026-06-23 11:30·46天前·QwenTeam
AI 导读

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

正文 · AI 翻译
  • 原生世界建模:环境建模是从持续预训练阶段(CPT → SFT → RL)开始就作为训练目标,而非在通用大语言模型之上进行的事后适配。
  • 七个领域,一个模型:单个模型即可模拟基于文本(MCP、搜索、终端、SWE)和基于图形界面(网页、操作系统、安卓)的环境,且知识可在不同领域间迁移。

与该模型一同发布的还有 AgentWorldBench,这是一个涵盖七个领域的评估基准,并配有来自真实环境的成对真实观测数据。两者均可从 Hugging Face 和 ModelScope 获取。


语言智能体经过训练可在交互式环境中行动,但此前没有任何语言模型被明确训练过对环境本身进行建模——即根据当前状态和智能体的动作预测接下来会发生什么。

路线图:Qwen-AgentWorld 是我们探索如何基于语言模型构建的世界建模,进一步推动通用智能体能力边界的尝试。

我们同时探索了如何实现语言世界建模,以及如何将其应用于推进通用智能体的发展:

  • 首先,我们构建了一个用于智能体环境模拟的基础模型:Qwen-AgentWorld 是首个在单个模型内覆盖七个智能体交互领域(MCP、搜索、终端、SWE、网页、操作系统、安卓)的语言世界模型,通过 CPT → SFT → RL 在超过 1000 万条真实环境交互轨迹上进行训练。在 AgentWorldBench 上,Qwen-AgentWorld-397B-A17B 实现了最高的整体模拟质量,超越了 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。
  • 其次,我们通过两种互补范式研究了世界建模在智能体训练中的作用:作为解耦的环境模拟器,它为智能体强化学习提供了卓越的可扩展性和可控性。可控的模拟强化学习能够以真实环境无法实现的方式塑造智能体行为,并且显著优于仅在真实世界环境中训练的强化学习;作为统一的智能体基础模型,LWM 预热使得在七个基准测试(包括三个完全跨域的任务)上能够有效迁移到多轮智能体任务,而无需对智能体任务进行任何强化学习微调,这初步验证了语言世界模型可以作为构建更强智能体模型的基础。

Image 3: Qwen-AgentWorld OverviewQwen-AgentWorld:一个跨越七个统一领域的原生语言世界模型,具有两种用于增强通用智能体的互补范式。

交互式演示 #

探索由 Qwen-AgentWorld 在所有七个领域模拟的真实智能体-环境对话。点击任意思考轨迹以查看模型的内部推理过程。

Qwen-AgentWorld 演示 — 7 个领域(终端、搜索、MCP、SWE、安卓、网页、操作系统)

展开


第一部分:构建智能体环境模拟的基础模型#

七个领域,一个模型 #

Qwen-AgentWorld 涵盖了七类交互式环境。对于三个图形用户界面领域,环境观察采用可渲染代码(无障碍树 XML、HTML、UI 层级标记)的形式,而非像素帧,从而实现对视觉环境的纯文本世界建模。

领域 LWM 模拟的内容 代表性预测
文本环境
终端 命令行环境:Shell 输出、文件系统状态、进程行为 多步命令管道的完整 Shell 输出
搜索 搜索引擎结果:URL、摘要、排名、页面内容 真实的 URL 标识符、自然的来源排序顺序、查询特定的事实细节
MCP API 服务器响应:工具调用结果、数据库状态、服务协议 跨九个连续 Notion API 调用的跨调用模式一致性
SWE IDE / 代码编辑环境:git diff、测试结果、编译错误 代码变更的文件修改和测试结果
图形用户界面环境
网页 用户交互后的浏览器 DOM 状态变化 HTML 与无障碍树更新
Android 触摸/手势操作后的 Android UI 层级变化 UI 层级 XML 标记
操作系统 桌面操作系统状态:文件系统、窗口管理、应用程序行为 无障碍树 XML 更新

训练流程 #

Image 4: Training Pipeline三阶段训练流程:CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度。

Qwen-AgentWorld 采用端到端训练,从持续预训练阶段起就将环境建模作为明确目标。三阶段流程遵循同一原则:CPT 注入,SFT 激活,RL 提升。

第一阶段:持续预训练(CPT)通过非思考轨迹注入环境知识。数据来源于专用智能体基础设施(容器化执行沙箱、MCP 服务器、Android/Web/OS 模拟器)、开放环境交互轨迹以及内部智能体轨迹。除环境数据外,我们还纳入了涵盖工业控制、网络安全、法律、医学、金融和时事等领域的专业世界知识语料库。一项关键贡献是轮次级信息论损失掩码:针对每个(动作,观察)对的四项表层统计指标,识别出携带真实环境信息的轮次,并将其余轮次从损失中屏蔽,同时保留它们作为上下文。

第二阶段:监督微调(SFT)通过 `<think>...</think>` 块将下一状态预测激活为显式思维模式。我们采用拒绝采样来筛选高质量的思考轨迹,最终得到 7,094 个训练样本。

第三阶段:强化学习(RL)通过混合奖励机制提升输出质量。我们使用 GSPO 进行 RL 训练。奖励结合了基于评分标准的 LLM 裁判(评估多维质量)与基于规则的验证器(适用于可通过编程方式检查精确正确性的领域)。

AgentWorldBench #

Image 5: AgentWorldBench OverviewAgentWorldBench 概览:领域分布、源基准、评估维度及各领域轨迹统计。

为评估语言世界模型,我们推出了 AgentWorldBench,这是一个综合性基准测试,基于 5 个前沿模型在 9 个成熟基准(如 Tool Decathlon、Terminal-Bench 1.0 与 2.0、OSWorld-Verified)上的轨迹真实观测数据构建而成。每个评估样本都配有从真实环境执行中获取的 ground-truth 观测结果,从而支持基于参考的评分。AgentWorldBench 通过开放式评分标准,从格式、事实性、一致性、真实性和质量五个维度评估世界建模质量,深入检验模型的推理、知识和长上下文能力。

Performance #

Image 6: Qwen-AgentWorld Main ResultsAgentWorldBench 结果:各领域五维评分均值。Qwen-AgentWorld-397B-A17B 取得最高总分(58.71),超越 GPT-5.4(58.25)及其他前沿模型。

Qwen-AgentWorld-397B-A17B 取得最高总体均值(58.71),超越 GPT-5.4(58.25)及所有其他前沿模型。其优势在 Terminal 和 SWE 两个领域最为显著,这两个领域的预测需要对代码执行状态和工具 API 行为进行精确建模。

在 35B-A3B 规模下,三阶段流水线将总体均值提升了 +8.66 分(从 47.73 提升至 56.39),使 Qwen-AgentWorld-35B-A3B 超越 Claude Sonnet 4.6(56.04)。这一改进在文本和 GUI 两个领域均表现一致。

世界模型的思维内部

除了整体性能,语言世界模型的趣味之处在于其推理方式。我们分析了横跨四个文本领域的 129 条思考轨迹,发现了三种涌现的推理模式。

Image 7: Qwen-AgentWorld Reasoning PatternsLWM 推理模式:审慎性自我修正、信息泄露防范以及多步因果推理。

审慎性自我修正。模型使用“等等!”作为认知中断信号来修正中间预测。在 129 轮次中,我们统计到 1,347 次此类中断(每轮 10.4 次),涵盖事实错误、认识论局限(“我实际上无法执行 np.random.seed(42)”)以及视角转换。

信息泄露防护。在搜索领域中,模型持有一个智能体试图寻找的参考答案。当查询不相关时,模型通过确保摘要片段不会意外泄露目标来防止信息泄露——这相当于世界模型层面的心智理论。

多步因果推理。预测 `curl -s localhost:3000 | python3 -m json.tool` 的输出需要六步推理链:Node.js 缺失 → 服务器从未启动 → 端口 3000 上无监听进程 → curl 静默失败 → 空管道 → json.tool 抛出 JSONDecodeError。


第二部分:探究世界建模在智能体训练中的作用#

我们研究了两种互补范式,世界建模通过这两种范式来增强通用智能体。

为什么世界建模对智能体至关重要?#

不是为了替代真实环境,也不是为了降低成本,而是作为推动前沿边界的互补维度

语言世界模型的作用。在智能体-环境交互循环中,策略决定做什么,世界模型预测接下来会发生什么。语言世界模型接收当前的交互历史和智能体的动作,并预测环境会返回什么:终端输出、API 响应、更新后的 DOM。这不是基于模板的生成。忠实的模拟需要多步因果推理(串联六个系统知识步骤来预测 curl 管道故障)、状态追踪(在连续九个 Notion API 调用中维护引用完整性)以及领域特定知识(Unix 语义、API 模式、浏览器渲染规则)。

为什么不仅仅/只使用真实环境?真实环境交互仍然是让智能体行为扎根于现实的金标准。语言世界模型并非旨在取代它,也主要不是一种降本措施。相反,语言世界模型开辟了一条补充真实环境的互补维度。

(1)超越真实环境的可扩展性与可控性。LWM 能够在不依赖专用基础设施(沙箱、GUI 虚拟机)的情况下,实现不同环境的轮次级扩展,涵盖极端场景、真实世界任务以及因不可逆操作或专有部署而无法实际执行的高价值专业领域。除了可扩展性,LWM 还具备精确的可控性:在真实环境中罕见或缺失的定向扰动,可以系统性地暴露智能体的弱点。针对这些扰动进行训练,有助于智能体处理仅靠真实环境训练无法覆盖的边缘情况,最终超越仅在真实环境中训练的智能体。

(2)内化的世界预测作为智能体能力。一个强大的通用智能体应同时具备决策能力和世界建模能力。世界建模使智能体能够预测未来环境状态,从而优化动作选择,有效实现作为内部规划步骤的心理模拟——而传统智能体训练仅关注从状态到动作的决策过程。因此,下一状态预测被内化为一种类似于“反思”但面向未来的元推理模式:先预测,再行动。此外,准确的下一状态预测本身就需要推理、知识、指令遵循和长上下文处理能力——这些正是通用智能体的基础能力。

通用语言环境模拟如何成为可能?构建通用语言世界模型需要三个要素协同作用。首先,环境多样性:在尽可能多的不同环境轨迹上进行训练,使模型能够接触到完整的状态转换模式谱系,而非仅仅记忆狭窄的集合。其次,跨领域泛化:我们的实验表明,在单一文本领域上进行训练能够提升所有其他文本领域的表现,这表明存在共享的底层环境建模能力,且该能力会随领域覆盖范围的扩大而增强。第三,通过持续预训练(CPT)获取世界知识:仅靠环境轨迹无法提供忠实模拟所需的事实基础。模拟合规监管平台需要法律知识;模拟搜索引擎对时事新闻的响应需要最新的事实覆盖。通过在持续预训练阶段融入专业领域的世界知识语料库(工业控制、网络安全、法律、医学、金融、时事),模型获得了环境模拟所依赖的事实基础。这三个要素——环境多样性、跨领域迁移和世界知识——共同使单一模型能够作为通用模拟器,服务于七个智能体交互领域。

范式一:解耦式模拟 #

作为独立模拟器,策略智能体与世界模型为分离模型时,Qwen-AgentWorld 提供了真实环境无法实现的扩展性与可控性。在此模拟强化学习(Sim RL)设置中,世界模型在智能体强化学习训练期间替代真实环境:智能体执行动作,世界模型预测下一观测状态,智能体从这些模拟推演中学习。关键发现如下:

  • 零样本环境泛化。Qwen-AgentWorld 能够模拟训练中完全未出现的 4k 个 OpenClaw 环境,在无需任何领域特定适配的情况下,在 Claw-Eval 上取得 +4.3 的模拟强化学习增益,在 QwenClawBench 上取得 +7.1 的增益。
  • 受控模拟至关重要。不受控的模拟强化学习带来的提升微乎其微;而可控扰动使 MCPMark 提升了 12.3 分,WideSearch 提升了 16.3 分,远超不受控的模拟强化学习。
  • 超越真实环境训练。可控模拟强化学习在 F1 分数上(50.3% 对 45.6%)超过了在真实搜索引擎上训练的 Real RL,同时通过对抗性片段设计塑造了更具针对性的智能体行为。
  • 虚构世界行之有效。在完全虚构且自洽的世界中训练的智能体能够泛化到真实搜索任务,同时从结构上防止智能体将模拟事实与现实世界知识混淆。
  • 状态是瓶颈。模拟强化学习的效果取决于向世界模型提供足够详细的初始状态;否则,模拟保真度会下降,下游收益也会随之减少。

可泛化的环境缩放 #

我们测试了世界模型是否能泛化到训练中完全未出现过的环境。OpenClaw 是一个开源智能体平台,其任务涵盖日程安排、编程、邮件分类、浏览器自动化和文件管理——这些任务完全超出了 Qwen-AgentWorld 的分布范围。我们为智能体强化学习训练模拟了 4,000 个 OpenClaw 环境,未进行任何领域特定的适配,同时对模拟器本身进行了消融实验:使用 Qwen3.6-Plus 作为模拟器带来的提升微乎其微,而 Qwen-AgentWorld-397B-A17B 则产生了显著的增益——这证实了世界模型的质量是模拟强化学习的瓶颈。智能体与不逼真的模拟器交互几乎学不到任何东西。

Claw-Eval QwenClawBench
Qwen3.5-35B-A3B 65.4 47.9
+ 模拟强化学习(使用 Qwen3.6-Plus) 66.7 47.8
+ 模拟强化学习(使用 Qwen-AgentWorld-397B-A17B) 69.7 55.0
Δ +4.3 +7.1
  • 所有分数均为在最大序列长度 256K 下,3 次独立运行的平均值。

可控模拟 #

更强大的能力在于可控性:使用自然语言指令在训练过程中塑造模拟器的行为。我们验证了两种模式。

MCP:环境适配。我们从真实的 MCP 工具使用轨迹中合成模拟系统提示词:每个提示词指定工具架构和服务器配置,总结隐藏的环境状态(数据库内容、权限设置、服务可用性),并定义可控的模拟指令,这些指令决定了模拟器在每一轮交互中的响应方式。控制指令会注入有针对性的扰动——间歇性 API 错误、需要后续调用的分页响应、强制进行多步检索的不完整中间结果,以及批量操作中的部分失败——从而系统性地暴露那些真实部署中很少出现的智能体弱点。

结果呈现出鲜明对比:没有控制指令的标准 Sim RL 没有带来有意义的提升(Tool Decathlon 实际上从 32.4 下降到了 31.5),因为模拟器缺乏足够的依据来生成可靠的响应。采用可控模拟后,Tool Decathlon 提升了 +3.7,MCPMark 提升了 +12.3。可控性不仅仅是影响提升幅度的因素——它是 Sim RL 在该领域能够起作用的先决条件。MCPMark 上更大的提升幅度(+12.3 对比 +3.7)表明,可控模拟对于需要大量顺序工具调用和谨慎处理中间结果的任务尤其有效。

Tool Decathlon MCPMark
Qwen3.5-35B-A3B-SFT 32.4 21.5
+ Sim RL(无控制) 31.5 24.6
+ Sim RL(有控制) 36.1 33.8
Δ +3.7 +12.3

搜索:虚构世界构建。我们构建了 1,000 个自洽的虚构环境,每个环境以一个包含内部一致虚构事实的关系型数据库(300–500 行)为基础。一个时间偏移后的环境可能包含一份 2029 年的智能手机市场排名,其中使用真实品牌名称但型号编号不存在。由于答案只存在于虚构设定中,智能体无法通过参数记忆来绕过搜索工具作答;由于所有事实都是虚构的,智能体不会将模拟事实与现实世界知识混淆。

按项目 F1 按行 F1
Qwen3.5-35B-A3B-SFT 34.02 13.72
+ Sim RL(有控制) 50.31 24.21
Δ +16.29 +10.49
Qwen3.5-397B-A17B-SFT 70.11 45.69
+ Sim RL(有控制) 73.98 51.74
Δ +3.87 +6.05

Sim RL 对比真实 RL

Image 8: Sim RL vs Real RL Training Curves模拟强化学习与真实强化学习在 WideSearch 上的对比:可控的模拟强化学习能够追踪甚至略微超越使用实时搜索引擎训练的真实强化学习。

性能表现。我们直接在 WideSearch 上对比了可控模拟强化学习与真实强化学习(使用实时搜索引擎训练)。模拟强化学习能够追踪甚至略微超越真实强化学习:在第 60 步时,按项目计算的 F1 分数达到 50.3%,而真实强化学习为 45.6%。

Image 9: Sim RL vs Real RL Tool Usage工具使用差异:经模拟强化学习训练的智能体会增加 `web_extractor` 调用次数,而经真实强化学习训练的智能体则会减少调用,这反映出可控模拟如何塑造出不同的智能体行为。

行为表现。更具信息量的信号来自智能体的行为。两种训练方式都将每条轨迹中的 `web_search` 调用次数从约 5 次减少到约 3.5 次,但 `web_extractor` 的调用次数出现了显著分化:模拟强化学习将其使用量从 2.5 次增加到 4.0 次,而真实强化学习则从 2.5 次减少到 1.5 次。由于模拟生成的摘要片段故意省略了详细内容,经模拟强化学习训练的智能体认识到,提取完整页面是组装完整答案的必要步骤。可控模拟能够以真实环境无法实现的方式,有针对性地塑造智能体行为。

范式二:智能体基础模型 #

在范式一中,智能体和世界模型是分开的模型。在此我们将其统一:同一个模型既选择动作,也预测环境状态。LWM 训练将下一状态预测作为一种内化的推理能力进行灌输。主要发现如下:

  • 激进的跨任务泛化能力。单轮、非智能体的 LWM 强化学习预热(无工具调用)能够迁移到跨五个领域、七个基准测试的多轮、工具调用型智能体任务上。
  • 领域泛化能力。在完全属于分布外、且 LWM 训练中完全不存在的领域上,性能也出现了提升(Claw-Eval 提升 11.3 分,QwenClawBench 提升 9.7 分,BFCL v4 提升 9.0 分),这证实了其具备可迁移的能力,而非领域特定的捷径。
  • 下一状态预测作为元推理模式。LWM 训练教会智能体在行动之前,先在头脑中模拟环境响应,这种能力能够跨任务格式和领域进行泛化。

我们通过在 Qwen3.5-35B-A3B-SFT 上运行 LWM 强化学习来验证这一点——这是一个无需工具调用的单轮任务——然后直接在七个基准测试的多轮、工具调用型智能体任务上进行评估,无需额外微调,其中包括三个 LWM 训练中未涉及的域外基准测试。

域内 域外
Terminal-Bench 2.0 SWE-Bench Verified
基线 33.3 64.5
+ LWM 强化学习 39.6 67.9
差值 +6.3 +3.4

域外结果尤其值得关注:LWM 训练流程中不包含任何 Claw 或函数调用数据,但在完全未参与世界模型训练的领域上,却分别取得了 +11.3、+9.7 和 +9.0 的提升。


使用 Qwen-AgentWorld 构建 #

部署 #

我们已开源 Qwen-AgentWorld-35B-A3B(Hugging Face、ModelScope),这是一个基于 MoE 架构的语言世界模型,总参数量 35B / 激活参数量 3B,支持 256K 上下文窗口。可通过以下方式进行部署和使用。

# SGLangpython -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3
# vLLMvllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

from transformers import AutoModelForCausalLM, AutoTokenizermodel = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen-AgentWorld-35B-A3B", torch_dtype="auto", device_map="auto",)tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen-AgentWorld-35B-A3B")

评估 #

AgentWorldBench 已在 Hugging Face 和 ModelScope 上以按领域划分的 JSONL 文件形式提供,每个文件包含来自真实环境的交互轨迹及其对应的真实观测结果。评估通过 eval/eval.py 使用三步流程进行:(1) 推理——运行世界模型生成预测观测结果;(2) 评判——使用大语言模型评判器,从五个维度(格式、事实性、一致性、真实感、质量)对每个预测结果与真实结果进行评分;(3) 汇总——计算各领域得分及总体得分。世界模型和评判器均使用兼容 OpenAI 的 API,支持 SGLang、vLLM 或专有端点。完整设置、数据格式及示例命令请参阅 GitHub README。

总结 #

Qwen-AgentWorld 是一个原生语言世界模型,在单个模型内以两种规模(35B-A3B 和 397B-A17B)覆盖了七个智能体交互领域。通过三阶段方案,CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度,从而从零开始逐步构建世界建模能力。我们研究了世界建模增强通用智能体的两种互补范式。作为解耦模拟器,我们在 Tool Decathlon、MCPMark 和 WideSearch 上验证了可控模拟的有效性,超越了非受控模拟和真实环境训练。作为统一智能体基础模型,LWM 预热迁移至七个基准测试(包括三个完全跨域任务)上的多轮智能体任务,初步验证了语言世界模型可作为构建更强智能体模型的基础。语言世界建模为扩展通用智能体开辟了一条互补的轴,超越了仅靠真实环境交互所能提供的范畴。

引用 #

@article{zuo2026qwen, title={Qwen-agentworld: language world models for general agents}, author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others}, journal={arXiv preprint arXiv:2606.24597}, year={2026}}

来源:Qwen:Blog Retrieval(API)· qwen.ai

事件后续 · 2查看事件全部 →