# 面壁智能ALIGN：自动对齐智能体与环境接口

- 来源：OpenBMB (@OpenBMB)
- 发布时间：2026-07-31 21:00
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms8zb830079vro7v2z6a4btv
- 原文链接：https://x.com/OpenBMB/status/2083175856563003724

## 精选理由

做 agent 的人都知道环境对齐是个隐形的坑，这篇论文不仅把问题讲透了，还给了开箱即用的 wrapper，ALFWorld 上成功率从 13% 拉到 31%，原因只是改写了反馈措辞，我觉得这是今年 agent 工程最被低估的发现。

## AI 摘要

面壁智能与清华NLP团队提出ALIGN，自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率，并减少65%连续无效动作，且接口可跨智能体架构和LLM骨干迁移。

## 正文

每个构建LLM智能体的人都在智能体的策略或更困难的环境上投入大量精力。而它们之间的接口却几乎无人关注，而这恰恰往往是智能体真正出问题的地方。

ALFWorld 中的一个典型案例：智能体试图检查 shelf 1，但环境要求必须先执行 go to，于是环境只返回“Nothing happens”，智能体便断定该货架是空的。仅仅改写这条反馈信息，就能让一个 Qwen2.5-7B 智能体的成功率从 13.4% 提升到 31.3%。

来自 @TsinghuaNLP（OpenBMB 成员）的 ALIGN 自动生成对齐的接口来解决这种错配问题。 论文：https://arxiv.org/abs/2505.21055 代码：https://github.com/THUNLP-MT/ALIGN

1️⃣ 问题在于智能体与环境的错配：智能体对某个动作效果的预期与环境真实的转移结果存在偏差，因为隐式规则和描述不充分的观测从未被显式呈现。论文表明这是一个普遍存在的瓶颈，而非智能体推理能力的失败。

2️⃣ ALIGN 用两个模块包装环境。INFERRULES 在任务开始前显式呈现静态规则和约束（前置条件、动作顺序）；WRAPSTEP 拦截每个动作，并用成功/失败条件丰富原始观测信息。它是一个轻量级的 Python 包装器，无需改动智能体逻辑或环境代码。

3️⃣ 接口由分析器（从失败轨迹中诊断错配）和优化器（将接口综合并精炼为 Python 函数）迭代生成。两者都会针对实时环境运行实验验证以对抗模型幻觉；移除该验证会导致准确率大幅下降。

4️⃣ 在具身、网页和工具使用四个基准测试中，ALFWorld 上的成功率提升高达 +45.67%，连续无效动作减少 65%。接口可即插即用地跨智能体架构（ReAct、Self-Consistency、Planning 等）和跨 LLM 主干（Qwen、Llama）迁移，无需重新生成。
