基于策略内知识边界增强的智能体强化学习

HuggingFace Daily Papers(社区热门论文)·2026-05-26 08:00·96天前
AI 导读

本文研究智能体强化学习在训练工具使用大语言模型时出现的问题,即导致冗余工具调用增加和模糊模型知识边界。现有基于奖励塑造的方法会引发奖励黑客问题。为此,提出AKBE方法,通过双路径(使用工具与不使用工具)滚动动态探测模型知识边界,定义是否需要工具及最少工具调用次数,并通过比较正确性构建监督信号以引导高效工具使用。在七个问答基准测试中,AKBE将任务准确率平均提升1.85,减少18%工具调用,工具生产力提高25%,且无准确率-效率权衡。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

基于策略内知识边界增强的智能体强化学习

2026-05-26 08:00· 96天前
AI 导读

本文研究智能体强化学习在训练工具使用大语言模型时出现的问题,即导致冗余工具调用增加和模糊模型知识边界。现有基于奖励塑造的方法会引发奖励黑客问题。为此,提出AKBE方法,通过双路径(使用工具与不使用工具)滚动动态探测模型知识边界,定义是否需要工具及最少工具调用次数,并通过比较正确性构建监督信号以引导高效工具使用。在七个问答基准测试中,AKBE将任务准确率平均提升1.85,减少18%工具调用,工具生产力提高25%,且无准确率-效率权衡。

推荐理由

让Agent学会「什么时候不用工具」是比单纯提高准确率更难的活,这篇用一个巧妙的双路径对比方法把这事做成了,直接降18%工具调用还涨点,做Agent的可以抄代码了。

正文 · AI 翻译

陈定伟

, 宗泽方

, 马志鹏

, 罗利奥

, 李阳

李成明

陈鹏

蒋杰

腾讯公司

深圳北理莫斯科大学

cuso4cdw@gmail.com

licm@smbu.edu.cn

{willzong,thomasyngli}@tencent.com

本工作完成于腾讯公司实习期间。通讯作者。

摘要

基于智能体的强化学习已被证明能有效训练基于大语言模型的智能体,使其具备外部工具使用能力。然而,我们发现智能体强化学习训练会导致冗余工具调用增加,并模糊模型的内在知识边界——模型难以区分何时需要调用工具、何时仅凭参数化知识即可作答。现有基于奖励塑形的解决方案会生成粗粒度的优化目标,往往倾向于不加区分地抑制工具调用,从而引发奖励作弊行为。本文提出AKBE(智能体知识边界增强),一种在训练过程中通过双路径(带工具与不带工具)轨迹展开来动态探测模型内在知识边界的在策略方法。我们将知识边界定义为:针对每个实例判断是否需要工具,以及所需的最少工具调用次数。通过比较不同路径的正确性,AKBE对轨迹进行分类,并构建针对性的监督信号,引导每个问题采用高效的工具使用模式。这些信号无缝集成到智能体强化学习训练循环中。在七个问答基准上的实验表明,与标准智能体强化学习相比,AKBE平均提升了任务准确率,并将工具调用次数减少了18%,在无需权衡准确率与效率的前提下,实现了25%的工具生产力提升。进一步分析表明,该方法在不同强化学习算法间具有即插即用的兼容性,并揭示了各类信号类别的作用机制。我们的代码已开源:https://github.com/CuSO4-Chen/AKBE。

基于在策略内在知识边界增强的高效智能体强化学习

丁伟晨♠◇††致谢:本工作完成于腾讯实习期间,宗泽方♠,马志鹏♠,罗利奥♠,李阳♠,李成明,陈鹏♠,蒋杰♠22脚注标记:2 ♠腾讯 ◇香港中文大学 ♡深圳北理莫斯科大学 cuso4cdw@gmail.com, licm@smbu.edu.cn {willzong,thomasyngli}@tencent.com

Refer to caption
图1:GRPO训练过程中冗余工具调用的增长(Qwen3-4B 多跳任务)。将早期训练(第20步)中正确回答且工具调用次数为0/1/2的样本追踪至后期训练(第240步)。左图:所有组别的工具调用次数均显著增加。右图:轨迹退化为原始(仍正确)、冗余(正确但额外增加工具调用)和幻觉(因噪声检索而退化为错误)三类。

1 引言

大语言模型智能体通过将内部推理与外部工具交互相结合(Yao等人,2023;Schick等人,2023;Si等人,2026;Luo等人,2026),在解决复杂任务方面展现出卓越能力。通过使用搜索引擎和代码解释器等工具,这些智能体将其推理能力扩展至参数化知识之外。近年来,强化学习已成为一种强大的后训练范式,用于进一步增强智能体能力,其中GRPO(Shao等人,2024)、DAPO(Yu等人,2025)以及专门的智能体强化学习算法(Feng等人,2025;Dong等人,2025;Zong等人,2026)在工具增强推理基准测试上取得了显著改进。

然而,智能体强化学习训练中一个关键但尚未充分探索的副作用是:当模型被优化以增强借助工具进行推理的能力时,它会越来越多地产生冗余的工具调用——要么在参数化知识足够时仍调用工具,要么在少量调用即可满足需求时过度调用,这被定义为认知卸载(Wang et al., 2025; Xie et al., 2026)。如图1所示,这表现为训练过程中工具调用数量的持续增长。这种对工具调用的过度依赖存在两个问题:(1)它浪费了计算资源并增加了推理延迟;(2)不必要的工具调用可能会引入噪声,用误导性的检索信息覆盖正确的内部推理,从而导致答案质量下降。

现有的高效智能体强化学习方法主要通过奖励塑形来解决这个问题,即将工具调用模式纳入奖励函数中(Wang et al., 2025; Wu et al., 2025b)。然而,直接将工具调用行为与奖励信号耦合会形成一个粗粒度的优化目标。这会激励模型减少整体工具使用量以获取额外奖励,而不考虑具体调用是否必要,从而导致奖励破解和任务准确率下降。更根本的是,这种基于奖励的方法无法捕捉每个实例中必要调用与冗余调用之间的区别,也无法适应训练过程中模型知识边界的动态演变。

在本文中,我们提出了 AKBE(智能体知识边界增强),这是一种在策略方法,通过在训练过程中显式探测模型的内在知识边界来解决这一局限性。我们将知识边界定义为:针对每个实例,判断是否需要外部工具,以及在需要时,为得出正确答案所需的最少工具调用次数,这代表了每个问题最有效的工具调用模式。关键思路在于,对于训练批次中的每个问题,我们分别执行带外部工具和不带外部工具的双路径 rollout。通过比较这两条路径的正确性,我们能够判断该问题是处于模型的参数化知识范围内,还是确实需要外部工具调用,并进一步确定在后者情况下所需的最少工具使用量。基于此识别结果,AKBE 对每个问题进行分类并构建针对性的监督信号:工具依赖型选择最少工具调用的正确轨迹以强化高效工具使用,效率型选择无工具的正确轨迹以消除冗余调用,幻觉型选择无工具的正确轨迹以减轻有害的工具依赖,而两者皆错型则不提供信号,仅依赖 RL 目标。这些由知识边界引导的信号,作为辅助的在策略训练损失,与标准 RL 目标无缝集成到训练循环中,在不修改 RL 奖励或优化过程的前提下,提供细粒度的实例级指导。我们的贡献总结如下:

  • 我们提出了 AKBE,一种用于高效智能体 RL 的在策略知识边界增强方法。该方法通过双路径 rollout 动态探测模型的内在知识边界,并构建由边界引导的监督信号,以消除冗余工具调用并强化高效的工具使用模式。

  • 我们在两个骨干模型上,针对七个问答基准进行了大量实验,结果表明,与标准智能体强化学习相比,AKBE 平均提升了任务准确率,并将工具调用次数减少了 18%,从而使工具生产率提高了 25%。在大多数情况下,它的表现优于基线方法,且无需在准确率与效率之间进行任何权衡。

  • 我们进一步证明,AKBE 作为一个即插即用模块,能够兼容多种不同的智能体强化学习算法,并揭示了模型的知识边界在训练过程中会动态演化,其中每个信号类别会自然地适应,以解决工具使用行为中一种特定的失败模式。

2 相关工作

近期研究将强化学习应用于训练具备外部工具使用能力的大语言模型智能体(Shao 等人,2024;Yu 等人,2025;Zheng 等人,2025)。此外,一系列工作设计了针对智能体场景的专用算法,例如基于熵的展开和信用分配(Jin 等人,2025;Dong 等人,2025;Ji 等人,2025;Zong 等人,2026;Chen 等人,2026)。然而,这些方法在训练过程中均表现出工具调用冗余不断增加的问题(Xie 等人,2026)。为缓解这一问题,OTC-PO(Wang 等人,2025)引入了工具生产力奖励项,-GRPO(Wu 等人,2025b)加入了置信度阈值,HiPRAG(Wu 等人,2025a)则应用分层过程奖励来评估每一步的工具调用。然而,这些基于奖励的方法要么对整体工具调用行为施加粗粒度的惩罚,导致智能体总是学会不加区分地减少工具调用以获取额外奖励,从而引发奖励破解;要么单独评估每一步的工具调用,但依赖外部模型或 API(Wu 等人,2025a),引入了额外的开销和依赖。SMART(Qian 等人,2025)则离线构建元认知 SFT 数据,但静态数据集无法追踪强化学习训练过程中不断变化的知识边界。与这些方法不同,我们提出的 AKBE 在强化学习训练循环内部运行,通过在线策略的双路径(带工具和不带工具)展开动态探测模型的内在知识边界,从而构建边界引导的监督信号,该信号可作为即插即用模块无缝集成到任何智能体强化学习算法中。

3 预备知识

3.1 任务定义

我们考虑一个智能体场景,其中语言模型策略迭代地与外部工具环境交互,以回答给定的问题。遵循 ReAct 范式(Yao 等人,2023),智能体生成一系列推理与行动交替的步骤。在每一步,智能体根据当前上下文生成一个思考和一个行动。该行动要么是调用外部工具(工具会返回一个观察结果并附加到上下文中),要么是一个结束行动,用于终止本轮交互并返回最终答案。一次完整的交互因此形成一条轨迹,其中 表示最终步骤。根据最终答案是否与真实答案匹配,会分配一个结果奖励。学习目标是最大化训练分布上的期望奖励:

(1)

3.2 智能体强化学习

虽然 PPO(Schulman 等人,2017)提供了一个通用的策略优化框架,但它对独立价值评估器的依赖引入了大量的内存和训练开销。GRPO(Shao 等人,2024)通过引入组相对优势解决了这一问题,并已成为近期智能体强化学习研究中的主流算法(Jin 等人,2025;Dong 等人,2025;Ji 等人,2025)。

具体来说,对于每个问题,GRPO 从当前策略中采样一组轨迹,并计算组相对优势:

(2)

策略通过最大化带有 KL 正则化项的裁剪策略目标函数来更新:

(3)

其中 是重要性采样比率, 是裁剪阈值, 控制相对于参考策略 的 KL 正则化强度。请注意,来自工具观察结果的 token 在训练期间会被屏蔽。

Refer to caption
图 2:AKBE 框架。对于每个问题,并行执行双路径展开(带工具和不带工具)。根据每条路径的正确性,选择相应的目标轨迹来构建基于策略的知识边界引导监督信号。这些信号与智能体强化学习目标相结合。
媒体内容 · 前往原文查看
算法 1 AKBE 训练(每批次)
1:训练批次 ,策略 ,带工具展开次数 ,不带工具展开次数 ,系数
2:
3:对于每个问题 执行
4:从带工具轨迹中采样
5:从不带工具轨迹中采样
6:如果满足条件,则……否则……
7:如果满足条件,则……否则……
8:如果满足条件,则依赖工具
9:
10:
11:否则如果满足条件,则效率
12:
13:
14:否则如果满足条件,则模型幻觉
15:
16:
17:结束条件 两者都错:跳过
18:结束循环
19:从带工具轨迹计算
20:
21:用……更新

4 方法

在本节中,我们提出 AKBE,该方法通过从双路径展开中获取的、以知识边界为指导的训练信号来增强智能体强化学习目标。通过探测模型对每个问题是否需要外部工具以及最少需要多少次调用,AKBE 选择高效的轨迹作为有针对性的在线策略优化信号,从而消除冗余的工具调用,同时在确实需要外部工具的场景下强化高效的工具使用。我们在图 2 中展示了该框架,并在算法 1 中详细说明了训练流程。

4.1 双路径轨迹展开

对于训练批次中的每个问题,AKBE 并行执行双路径轨迹展开(带工具和不带工具):

带工具轨迹展开:我们对策略可以访问外部工具的智能体展开进行采样。其轨迹包含一次或多次工具调用。设 表示是否至少有一条带工具轨迹得出了正确答案。

不带工具轨迹展开:我们对禁用工具访问的展开进行采样,迫使策略仅依赖其参数化知识。设 表示是否至少有一条不带工具轨迹得出了正确答案。

我们将策略在问题 上的知识边界定义为:

(4)

其中 表示 位于模型的内在知识范围内(即无需工具调用),而 表示需要外部工具。由于不带工具的展开不涉及任何工具交互或环境延迟,与带工具展开相比,其时间消耗显著降低,使得这一探测步骤在计算上非常高效。

4.2 边界引导的信号构建

基于双路径结果 ,我们将每个问题的轨迹分为四类,并构建相应的训练信号:

工具依赖(=✓, =✗)。模型仅在需要工具调用时,才能通过工具调用正确作答。我们选择正确使用工具且工具调用次数最少的轨迹作为目标,在保留必要工具调用的同时,强化高效的工具使用模式。当多条正确轨迹具有相同的最小工具调用次数时,我们随机采样其中一条以避免偏差。在更细粒度上,每次工具调用都反映了动态的步骤级知识边界决策:当模型的参数化知识不足以支撑某个具体过程推理步骤时,模型便会调用工具。因此,选择最小工具调用轨迹,能够针对特定问题,在每一步强化最广泛可达的知识边界。

高效(=✓, =✓)。模型无需工具即可正确作答,此时工具调用是多余的。我们随机选择一条正确的无工具轨迹作为目标,教导模型在知识边界范围内的问题上,绕过不必要的工具调用。

模型幻觉(=✗, =✓)。模型无需工具即可正确作答,但使用工具后反而答错,这表明工具调用引入了有害噪声,或将模型引向了错误的推理路径。我们选择一条正确的无工具轨迹作为目标,引导模型在特定问题上摆脱有害的工具依赖。

双错(=✗, =✗)。两种路径均未得出正确答案。无法构建可靠的监督信号;对于这些实例,我们仅依赖原始的强化学习目标。

4.3 联合训练目标

整体训练目标将原始强化学习损失与知识边界引导的训练目标相结合:

(5)

其中 可替换为任何经典的智能体强化学习损失(例如 DAPO、GSPO),而 是基于所选目标轨迹的在线策略交叉熵训练目标:

(6)

其中 分别表示来自工具依赖、高效和模型幻觉类别中具有构建信号的题目集合, 是第 4.2 节中所述的针对题目 所选的目标轨迹。系数 控制边界引导目标相对于强化学习损失的强度。

关键在于,由于两者都是基于当前模型的在策略(on-policy) rollout 计算得出的,因此知识边界在每个训练步骤都会被动态重新评估。随着模型通过强化学习训练不断改进,特定问题的知识边界可能会发生变化,而边界引导信号也会相应调整。这种在策略特性使得 AKBE 与那些使用静态离线数据、无法追踪此类动态演变的方法区分开来。此外,AKBE 被设计为一个即插即用模块:它可以通过在训练期间简单地添加相关项,无缝集成到任何智能体强化学习算法中,无论该算法的具体形式如何。

5 实验

媒体内容 · 前往原文查看
表 1:在两个骨干模型上、跨越七个数据集的实验结果。加粗数值表示最佳结果。我们提出的 AKBE 在大多数情况下优于现有方法。
方法 多跳 单跳
Hotpot 2Wiki MuSiQue Bamb. 平均 TC TP NQ TriviaQA PopQA 平均 TC TP
骨干模型:Qwen3-4B
ReAct 30.42 32.92 12.83 44.80 30.01 3.43 8.75 26.75 53.53 35.34 41.31 2.27 18.19
Search-o1 35.18 38.45 14.21 48.00 34.83 3.31 10.52 33.85 57.42 40.27 46.11 1.72 26.81
R1-Searcher 45.62 49.83 19.51 50.40 45.20 3.28 13.78 46.85 64.52 49.43 54.95 1.48 37.13
Search-R1 44.80 50.66 18.94 52.00 45.40 3.16 14.33 45.98 65.17 49.18 54.97 1.41 38.99
OTC-PO 38.74 47.71 15.16 48.00 41.27 2.06 20.03 45.31 64.35 49.86 54.90 1.02 53.83
-GRPO 45.83 51.49 21.06 56.00 46.39 3.01 15.41 47.00 64.73 49.95 55.30 1.53 36.15
离线 AKBE 45.21 51.12 19.84 54.40 45.84 2.45 18.71 46.52 64.55 49.72 55.06 1.22 45.13
AKBE(我们的方法) 46.53 51.89 21.17 56.80 46.82 2.60 18.01 47.33 65.18 50.80 55.90 1.16 48.19
骨干模型:Qwen2.5-7B
ReAct 2.85 1.94 0.58 4.00 2.10 4.04 0.52 4.34 10.67 9.32 9.23 1.36 6.79
Search-o1 18.52 16.73 5.42 16.00 16.10 3.92 4.11 15.87 32.45 22.18 25.37 1.28 19.82
R1-Searcher 47.21 44.85 20.63 44.00 43.02 3.91 11.00 45.12 63.28 49.05 54.07 1.08 50.06
Search-R1 46.64 45.60 19.97 45.90 43.19 3.77 11.45 44.35 63.65 48.70 53.96 1.05 51.39
OTC-PO 42.16 43.72 20.48 44.80 40.72 1.56 26.10 48.72 63.46 47.64 53.89 1.00 53.89
-GRPO 48.02 47.92 21.60 48.00 45.13 3.34 13.51 47.89 64.21 48.18 54.35 1.03 52.76
离线 AKBE 47.38 46.81 20.95 46.40 44.22 2.68 16.50 47.15 63.92 48.05 54.08 1.01 53.54
AKBE(我们的方法) 48.69 47.59 22.23 48.80 45.24 2.94 15.39 49.64 64.63 47.91 54.59 1.00 54.59

5.1 实验设置

数据集。我们在工具增强的搜索场景下,使用七个问答评测基准来评估 AKBE。遵循 Search-R1(Jin 等人,2025)的设置,我们部署了一个基于维基百科的轻量级搜索引擎作为外部工具环境。这些评测基准分为两类:多跳问答,包括 HotpotQA(Yang 等人,2018)、2WikiMultihopQA(Ho 等人,2020)、MuSiQue(Trivedi 等人,2022)和 Bamboogle(Press 等人,2023),这些需要多步检索和推理;以及单跳问答,包括 Natural Questions(NQ)(Kwiatkowski 等人,2019)、TriviaQA(Joshi 等人,2017)和 PopQA(Mallen 等人,2022),这些通常只需要一次检索。所有评测基准均使用精确匹配(EM)作为主要评估指标。我们还额外报告了工具调用次数(TC),定义为每个问题平均调用的工具次数,以及工具生产力(TP),用于衡量每单位工具使用所对应的准确率。

基线方法。我们将 AKBE 与以下方法进行对比:(1)ReAct(Yao 等人,2023):一种基于提示词的方法,作为没有经过强化学习训练的参考基准;(2)Search-o1(Li 等人,2025):一个将智能体搜索流程整合到推理过程中的框架;(3)R1-Searcher(Song 等人,2025)和(4)Search-R1(Jin 等人,2025):两种经典的智能体强化学习框架,它们部署 GRPO 来增强搜索能力;(5)OTC-PO(Wang 等人,2025):一种奖励塑形方法,通过引入工具生产力项来惩罚冗余的工具调用;(6)-GRPO(Wu 等人,2025b):一种奖励塑形方法,它引入了一个基于置信度的阈值来减少不确定性;以及(7)离线 AKBE:AKBE 的一种离线变体,它使用相同的知识边界引导信号构建策略,但从一个固定的、经过 GRPO 训练的检查点生成信号数据,作为直接对比来验证在线动态信号构建的必要性。请注意,基线方法和 AKBE 的更多实现细节在附录 A 中提供。

5.2 AKBE 的主要结果

我们在表 1 中展示了基于两种骨干模型和七个基准测试的主要结果。AKBE 在多跳和单跳基准测试上均获得了最高的平均 EM 分数,同时大幅降低了 TC,并在大多数情况下带来了持续的 TP 提升。在 Qwen3-4B 上,AKBE 在所有七个基准测试中的平均 EM 相比其基础方法提升了 +1.85,同时将 TC 降低了 18%,工具生产力提升约 25%。同样的效果在 Qwen2.5-7B 上也成立,证实了其在不同模型架构和规模上的通用性。相比之下,OTC-PO 在所有设置中实现了最低的 TC(在表 1 中用下划线标出),但严重牺牲了准确性,这证实了粗粒度的奖励塑造会激励不加区分地抑制工具调用,从而导致奖励作弊。-GRPO 通过其置信度阈值避免了 EM 崩溃,但提供的 TC 降低有限。AKBE 实现了严格意义上更好的平衡:在比 -GRPO 更大程度降低 TC 的同时,还提升了 EM。

将 AKBE 与其离线变体(Offline AKBE)进行比较,揭示了在线策略信号构建的重要性。Offline AKBE 在 EM 分数上始终低于 AKBE,尽管其 TC 更低,这反映了从冻结的已训练策略中生成的过于激进的“减少工具调用”信号。离线数据所捕获的知识边界反映了模型在训练后期阶段的能力,这对于早期训练中较弱的策略来说过于乐观。由此产生的静态边界信号无法与模型在整个训练过程中不断演变的知识状态保持一致,导致过早的工具抑制和精度下降。这验证了我们的核心主张:动态的在线策略知识边界追踪对于实现 EMTC 平衡至关重要。

5.3 分析

5.3.1 即插即用泛化

由于 AKBE 通过辅助监督信号增强模型的知识边界感知,而非修改 RL 奖励或优化流程,因此它天然地与基础智能体 RL 算法的选择正交,可作为即插即用模块使用。为验证这一点,我们将 AKBE 与四种智能体 RL 算法集成:GRPO (Shao et al., 2024)、DAPO (Yu et al., 2025)、GSPO (Zheng et al., 2025) 和 AEPO (Dong et al., 2025),每种算法代表不同的优化策略,例如动态采样、序列级优化和熵驱动探索。

如表 2 所示,AKBE 在所有四种基础算法上均一致地提升了平均 EM 并降低了 TC。值得注意的是,无论基础方法本身的特性如何,这种提升都是一致的:DAPO 由于其针对多样化轨迹的动态采样策略,已经实现了较低的 TC,但 AKBE 仍能进一步将其降低,同时提升 EM。对于基础 TC 较高(3.23 和 3.08)的 GSPO 和 AEPO,AKBE 带来了更大的 TC 降低,同时 EM 也持续提升。TP 指标在所有四种组合中均一致提升,增益范围从 到 。这些结果证实 AKBE 是一个高效的正交模块。边界引导的训练目标提供了互补的学习信号,提升了工具调用效率,同时不干扰基础 RL 算法的优化动态。

媒体内容 · 前往原文查看
表 2:在 Qwen3-4B Multi-Hop 上的即插即用结果。AKBE 在与不同智能体 RL 算法结合时,一致地提升了 EM 并降低了 TC。
方法 Hotpot 2Wiki MuSi. Bamb. 平均 TC TP
GRPO 44.80 50.66 18.94 52.00 45.40 3.16 14.33
+ AKBE 46.53 51.89 21.17 56.80 46.82 2.60 18.01
DAPO 45.95 51.81 21.68 51.20 46.65 2.61 17.85
+ AKBE 45.83 52.35 22.51 52.80 47.01 2.38 19.75
GSPO 47.07 49.25 22.68 49.60 45.69 3.23 14.16
+ AKBE 47.62 49.78 23.50 48.00 46.24 2.84 16.28
AEPO 46.36 51.78 23.47 52.00 46.96 3.08 15.25
+ AKBE 46.89 52.26 24.24 54.40 47.50 2.73 17.40
媒体内容 · 前往原文查看
表 3:轨迹信号类别的消融实验(Qwen3-4B Multi-Hop)。移除每个类别揭示了其对 AKBE 的独特贡献。
配置 平均 EM TC TP
GRPO 45.40 3.16 14.33
AKBE(我们的方法) 46.86 2.60 18.02
无工具依赖 43.56 2.15 20.26
无效率 46.50 2.92 15.93
无幻觉 46.55 2.58 18.04
仅依赖工具 46.02 2.85 16.15
Refer to caption
图 3:Qwen2.5-7B 多跳任务中,训练早期与晚期轨迹类别分布对比。两者均错类别大幅下降(5.8%),效率类别增益最大(+4.2%),表明 AKBE 训练过程中发生了知识内化。

5.3.2 轨迹类别消融研究

为理解每个信号类别的贡献,我们通过从知识边界引导的训练目标中逐一移除单个类别来进行消融实验。

在表 3 中,我们发现移除依赖工具信号会导致 EM 显著低于 GRPO,尽管其 TC 达到最低。剩余的效率与幻觉类别仅监督无工具轨迹,导致对必要工具调用的过度抑制,从而降低了任务准确率。这证实了依赖工具信号作为一种关键保护机制,防止了效率导向信号过度抑制必要的工具调用。移除效率信号导致 TC 上升,表明它是消除冗余工具调用的主要力量。移除幻觉信号导致 EM 小幅下降,而 TC 保持可比,验证了幻觉类别纠正了工具调用覆盖正确内部推理的有害工具调用路径,从而促进了 EM 的提升。值得注意的是,仅依赖工具信号一项就已优于 GRPO,表明即使在无工具展开大多失败的高难度问题上,AKBE 仍然有效。完整的 AKBE 优于所有子集,证实了这三个类别是互补的:依赖工具信号教导何时以及如何高效使用工具,效率信号教导何时不需要工具,幻觉信号教导何时工具是有害的。

5.3.3 系数的选择策略

Refer to caption
图 4:系数对 Qwen3-4B 多跳任务的影响。AKBE 在 (图 (a) 绿色区域)范围内优于 GRPO,且在所有 值下 TC 和 TP 均持续高于 GRPO。

我们研究了平衡强化学习损失与边界引导目标之间系数的选择策略。图4报告了在Qwen3-4B多跳任务上,当系数在某个范围内变化时,平均精确匹配率、工具调用次数和工具调用通过率的实验结果。AKBE在所有系数取值下的精确匹配率均持续优于GRPO,并在某个系数值上取得了最佳平衡。当系数超过0.2时,精确匹配率急剧下降,这表明过强的边界引导目标主导了强化学习损失,导致对工具调用的过度抑制。值得注意的是,在所有系数取值下,工具调用次数和工具调用通过率均持续优于GRPO,这表明无论信号强度如何,AKBE都能可靠地提升工具使用效率。最优系数自然地在两个目标之间平衡了梯度贡献,因为边界引导目标每个问题最多作用于一条目标轨迹,而强化学习损失则基于多条采样轨迹计算。关于这一点,我们在附录B中提供了详细的理论分析。

Refer to caption
图5:Qwen3-4B多跳任务上每步训练时间对比。尽管增加了无工具采样轨迹,但由于高效的无工具采样轨迹以及训练过程中工具调用次数减少从而缩短了整体时间,AKBE平均速度快了15%。

5.3.4 训练过程中的轨迹分布

为了考察知识边界在训练过程中如何演变,我们在图3中比较了Qwen2.5-7B多跳任务上训练早期(第1-40步)和训练后期(第201-240步)的轨迹类别分布。

最显著的变化是“两者皆错”比例大幅下降,这表明智能体强化学习训练逐步使模型能够解决先前无法解答的问题。关键在于,“效率”类别的提升幅度最大,证明 AKBE 成功促进了知识内化——模型越来越倾向于利用其参数化知识来回答问题。与此同时,“模型幻觉”显著减少,证实了幻觉信号在训练过程中有效纠正了有害的工具调用路径。这些变化验证了我们设计的两个关键方面:(1)知识边界在训练过程中并非静态,这证明了采用在线策略信号构建方法优于静态离线方法;(2)AKBE 的边界引导目标与强化学习目标协同作用——强化学习增强了模型的工具增强推理能力,而 AKBE 则提供知识边界引导的效率信号,指导模型最大化利用其知识边界,从而实现高效推理路径,并最大程度减少冗余的工具调用。

5.3.5 计算开销

一个自然的担忧是,AKBE 中额外的不使用工具的 rollout 是否会引入过高的计算开销。图 5 比较了在 Qwen3-4B 多跳任务上,GRPO 与 AKBE 每个训练步骤的时间消耗。令人惊讶的是,尽管每批次执行了额外的不使用工具的 rollout,AKBE 平均仍比 GRPO 快 15%。这一结果源于两个因素:(1)不使用工具的 rollout 完成速度远快于使用工具的 rollout,因为它们不涉及工具交互或环境延迟;(2)随着 AKBE 在训练过程中逐步减少工具调用,使用工具的 rollout 本身也因工具调用次数减少而变得更短,导致训练后期步骤时间加速。这表明 AKBE 引入的计算开销很小,并且在大多数情况下,其带来的效率提升足以弥补这部分开销。我们进一步在附录 E 中提供了工具调用次数和响应长度的详细逐步骤对比。

6 结论

在本文中,我们提出了 AKBE,一种简单而有效的方法,通过在智能体强化学习训练期间进行同策略双路径推演,动态探测模型的内在知识边界。通过构建知识边界引导的监督信号,AKBE 消除了冗余的工具调用,同时保留了必要的工具调用,并引导模型形成高效的工具调用模式。与容易遭受奖励破解问题的奖励塑形方法不同,AKBE 在不修改强化学习目标的情况下,在实例层面提供更细粒度的引导,从而同时提升任务准确率和工具调用效率。在七个问答基准测试和两个骨干模型上的实验验证了其有效性,表明显式的同策略知识边界建模是一种有前景且通用的高效智能体强化学习策略。

7 局限性

尽管由于在训练后期减少了工具调用,AKBE 的平均训练时间比 GRPO 更快,但在训练早期阶段,当工具调用尚未减少时,额外的无工具推演确实引入了额外的计算成本。未来的工作可以探索更高效的推演策略,例如自适应采样,仅对可能处于知识边界内的问题选择性执行无工具推演。此外,系数在整个训练过程中是固定的,而 和 之间的最优平衡可能随训练阶段和任务难度而变化。一种能够根据当前轨迹分布或任务复杂度,在每一步自适应调整 的方法,可能进一步提升性能。

参考文献

  • D. Chen, Z. Zong, Z. Ma, L. Luo, Y. Li, C. Li, P. Chen, and J. Jiang (2026) A 2 tgpo: agentic turn-group policy optimization with adaptive turn-level clipping. arXiv preprint arXiv:2605.06200. 引用自:§2.
  • G. Dong, L. Bao, Z. Wang, K. Zhao, X. Li, J. Jin, J. Yang, H. Mao, F. Zhang, K. Gai, G. Zhou, Y. Zhu, J. Wen, and Z. Dou (2025) Agentic entropy-balanced policy optimization. External Links: 2510.14545, Link 引用自:§A.2, §1, §2, §3.2, §5.3.1.
  • L. Feng, Z. Xue, T. Liu 和 B. An (2025) 《组内组策略优化用于大语言模型智能体训练》。arXiv 预印本 arXiv:2505.10978。引用自:§1。
  • X. Ho, A. Duong Nguyen, S. Sugawara 和 A. Aizawa (2020) 《构建用于全面评估推理步骤的多跳问答数据集》。载于《第 28 届国际计算语言学会议论文集》,D. Scott, N. Bel 和 C. Zong 主编,西班牙巴塞罗那(线上),第 6609–6625 页。外部链接:链接,文献标识码。引用自:§A.3, §5.1。
  • Y. Ji, Z. Ma, Y. Wang, G. Chen, X. Chu 和 L. Wu (2025) 《用于大语言模型智能体强化学习的树搜索》。外部链接:2509.21240,链接。引用自:§2, §3.2。
  • B. Jin, H. Zeng, Z. Yue, J. Yoon, S. Arik, D. Wang, H. Zamani 和 J. Han (2025) 《Search-R1:训练大语言模型进行推理并利用强化学习调用搜索引擎》。arXiv 预印本 arXiv:2503.09516。引用自:§A.1, §A.2, §A.6, §2, §3.2, §5.1, §5.1。
  • M. Joshi, E. Choi, D. Weld 和 L. Zettlemoyer (2017) 《TriviaQA:一个用于阅读理解的大规模远程监督挑战数据集》。载于《第 55 届计算语言学协会年会论文集(第一卷:长论文)》,R. Barzilay 和 M. Kan 主编,加拿大温哥华,第 1601–1611 页。外部链接:链接,文献标识码。引用自:§A.3, §5.1。
  • T. Kwiatkowski, J. Palomaki, O. Redfield, M. Collins, A. Parikh, C. Alberti, D. Epstein, I. Polosukhin, J. Devlin, K. Lee, K. Toutanova, L. Jones, M. Kelcey, M. Chang, A. M. Dai, J. Uszkoreit, Q. Le 和 S. Petrov (2019) 《Natural Questions:一个用于问答研究的基准》。计算语言学协会汇刊 7,第 452–466 页。外部链接:链接,文献标识码。引用自:§A.3, §5.1。
  • X. Li, G. Dong, J. Jin, Y. Zhang, Y. Zhou, Y. Zhu, P. Zhang 和 Z. Dou (2025) 《Search-o1:智能体搜索增强的大型推理模型》。载于《2025 年自然语言处理经验方法会议论文集》,第 5420–5438 页。引用自:§5.1。
  • Z. Luo, Z. Luo, M. Zhang 和 R. Mao (2026) 《TabTracer:用于大语言模型复杂表格推理的蒙特卡洛树搜索》。arXiv 预印本 arXiv:2602.14089。引用自:§1。
  • A. Mallen、Asai、Akari、V. Zhong、R. Das、H. Hajishirzi 和 D. Khashabi(2022)《何时不应信任语言模型:探究参数化与非参数化记忆的有效性与局限性》。arXiv 预印本。引用自:§A.3、§5.1。
  • O. Press、M. Zhang、S. Min、L. Schmidt、N. A. Smith 和 M. Lewis(2023)《衡量并缩小语言模型中的组合性差距》。外部链接:2210.03350,链接。引用自:§A.3、§5.1。
  • C. Qian、E. C. Acikgoz、H. Wang、X. Chen、A. Sil、D. Hakkani-Tur、G. Tur 和 H. Ji(2025)《SMART:用于缓解工具过度使用的自我感知智能体》。收录于《计算语言学协会发现:ACL 2025》,第 4604–4621 页。引用自:§2。
  • Qwen、:、A. Yang、B. Yang、B. Zhang、B. Hui、B. Zheng、B. Yu、C. Li、D. Liu、F. Huang、H. Wei、H. Lin、J. Yang、J. Tu、J. Zhang、J. Yang、J. Yang、J. Zhou、J. Lin、K. Dang、K. Lu、K. Bao、K. Yang、L. Yu、M. Li、M. Xue、P. Zhang、Q. Zhu、R. Men、R. Lin、T. Li、T. Tang、T. Xia、X. Ren、X. Ren、Y. Fan、Y. Su、Y. Zhang、Y. Wan、Y. Liu、Z. Cui、Z. Zhang 和 Z. Qiu(2025)《Qwen2.5 技术报告》。外部链接:2412.15115,链接。引用自:§A.7。
  • T. Schick、J. Dwivedi-Yu、R. Dessi、R. Raileanu、M. Lomeli、E. Hambro、L. Zettlemoyer、N. Cancedda 和 T. Scialom(2023)《Toolformer:语言模型可以自学使用工具》。收录于《第三十七届神经信息处理系统会议》,外部链接:链接。引用自:§1。
  • J. Schulman、F. Wolski、P. Dhariwal、A. Radford 和 O. Klimov(2017)《近端策略优化算法》。外部链接:1707.06347,链接。引用自:§3.2。
  • Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. K. Li、Y. Wu 和 D. Guo(2024)《DeepSeekMath:突破开放语言模型数学推理的极限》。外部链接:2402.03300,链接。引用自:§1、§2、§3.2、§5.3.1。
  • G. Sheng、C. Zhang、Z. Ye、X. Wu、W. Zhang、R. Zhang、Y. Peng、H. Lin 和 C. Wu(2024)《HybridFlow:一种灵活高效的 RLHF 框架》。arXiv 预印本:arXiv:2409.19256。引用自:§A.7。
  • S. Si, H. Zhao, Y. Lei, Q. Wang, D. Chen, Z. Wang, Z. Wang, K. Luo, Z. Wang, G. Chen 等人 (2026) 《从上下文到技能:语言模型能否从上下文中熟练学习?》. arXiv 预印本 arXiv:2604.27660. 引用于:§1.
  • H. Song, J. Jiang, Y. Min, J. Chen, Z. Chen, W. X. Zhao, L. Fang, 和 J. Wen (2025) 《R1-searcher:通过强化学习激励大语言模型的搜索能力》. arXiv 预印本 arXiv:2503.05592. 引用于:§5.1.
  • H. Trivedi, N. Balasubramanian, T. Khot, 和 A. Sabharwal (2022) 《MuSiQue:通过单跳问题组合实现多跳问题》. 《计算语言学协会汇刊》第10卷,第539–554页. 外部链接:链接, 文献 引用于:§A.3, §5.1.
  • H. Wang, C. Qian, W. Zhong, X. Chen, J. Qiu, S. Huang, B. Jin, M. Wang, K. Wong, 和 H. Ji (2025) 《少行动即多推理!教会模型高效行动》. arXiv 预印本 arXiv:2504.14870. 引用于:§1, §1, §2, §5.1.
  • L. Wang, N. Yang, X. Huang, B. Jiao, L. Yang, D. Jiang, R. Majumder, 和 F. Wei (2022) 《通过弱监督对比预训练的文本嵌入向量》. arXiv 预印本 arXiv:2212.03533. 引用于:§A.6.
  • P. Wu, M. Zhang, K. Wan, W. Zhao, K. He, X. Du, 和 Z. Chen (2025a) 《Hiprag:用于高效智能体检索增强生成的分层过程奖励》. arXiv 预印本 arXiv:2510.07794. 引用于:§2.
  • P. Wu, M. Zhang, X. Zhang, X. Du, 和 Z. Chen (2025b) 《明智搜索:通过降低不确定性来缓解次优的智能体搜索》. 载于《2025年自然语言处理经验方法会议论文集》,第19734–19745页. 引用于:§1, §2, §5.1.
  • R. Xie, D. Gopinath, D. Qiu, D. Lin, H. Sun, S. Potdar, 和 B. Dhingra (2026) 《搜索增强型大语言模型中的过度搜索》. arXiv 预印本 arXiv:2601.05503. 引用于:§1, §2.
  • A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, C. Zheng, D. Liu, F. Zhou, F. Huang, F. Hu, H. Ge, H. Wei, H. Lin, J. Tang, J. Yang, J. Tu, J. Zhang, J. Yang, J. Yang, J. Zhou, J. Zhou, J. Lin, K. Dang, K. Bao, K. Yang, L. Yu, L. Deng, M. Li, M. Xue, M. Li, P. Zhang, P. Wang, Q. Zhu, R. Men, R. Gao, S. Liu, S. Luo, T. Li, T. Tang, W. Yin, X. Ren, X. Wang, X. Zhang, X. Ren, Y. Fan, Y. Su, Y. Zhang, Y. Zhang, Y. Wan, Y. Liu, Z. Wang, Z. Cui, Z. Zhang, Z. Zhou, 和 Z. Qiu (2025) Qwen3 技术报告。外部链接: 2505.09388, 链接 引用自: §A.7。
  • Z. Yang, P. Qi, S. Zhang, Y. Bengio, W. Cohen, R. Salakhutdinov, 和 C. D. Manning (2018) HotpotQA:一个用于多样化、可解释的多跳问答的数据集。载于《2018年自然语言处理经验方法会议论文集》,E. Riloff, D. Chiang, J. Hockenmaier, 和 J. Tsujii 编,比利时布鲁塞尔,第2369–2380页。外部链接: 链接, 文献标识码 引用自: §A.3, §5.1。
  • S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. R. Narasimhan, 和 Y. Cao (2023) ReAct:在语言模型中协同推理与行动。载于《第十一届国际学习表征会议》,外部链接: 链接 引用自: §1, §3.1, §5.1。
  • Q. Yu, Z. Zhang, R. Zhu, Y. Yuan, X. Zuo, YuYue, W. Dai, T. Fan, G. Liu, J. Liu, L. Liu, X. Liu, H. Lin, Z. Lin, B. Ma, G. Sheng, Y. Tong, C. Zhang, M. Zhang, R. Zhang, W. Zhang, H. Zhu, J. Zhu, J. Chen, J. Chen, C. Wang, H. Yu, Y. Song, X. Wei, H. Zhou, J. Liu, W. Ma, Y. Zhang, L. Yan, Y. Wu, 和 M. Wang (2025) DAPO:一个大规模开源大语言模型强化学习系统。载于《第三十九届神经信息处理系统年度会议》,外部链接: 链接 引用自: §A.4, §1, §2, §5.3.1。
  • C. Zheng, S. Liu, M. Li, X. Chen, B. Yu, C. Gao, K. Dang, Y. Liu, R. Men, A. Yang, J. Zhou, 和 J. Lin (2025) 组序列策略优化。外部链接: 2507.18071, 链接 引用自: §A.4, §2, §5.3.1。
  • Z. Zong, D. Chen, Y. Li, Q. Yi, B. Zhou, C. Li, B. Qian, P. Chen, 和 J. Jiang (2026) AT²po:基于树搜索的智能体回合制策略优化。arXiv 预印本 arXiv:2601.04767。引用自: §A.2, §1, §2。

附录 A 实现细节

A.1 奖励设计

我们的训练流程采用一种二元结果奖励,该奖励将答案正确性与结构格式要求相结合。正确性信号遵循 Search-R1(Jin 等人,2025)的奖励公式,使用精确匹配作为主要评估标准。

精确匹配奖励。

给定从智能体轨迹中提取的最终答案和真实答案,EM 奖励定义如下:

(7)

这种严格的二元公式消除了部分评分带来的模糊性,推动策略向完全正确的答案收敛,为智能体强化学习提供了清晰的优化信号。

格式约束。

除了正确性之外,每条轨迹还必须满足结构有效性要求。响应必须包含由 `<think>...</think>` 标签包裹的推理过程,以及由 `<answer>...</answer>` 标签包裹的最终答案,且答案需进一步用 `\boxed{}` 括起来。格式指示器为:

(8)

违反此格式的响应无论答案正确与否均不得分,从而确保可靠的工具调用解析和最终答案提取。

最终奖励。

整体奖励结合了上述两个部分:

(9)

只有当轨迹满足格式要求并提供完全正确的答案时,才能获得最高奖励 1;格式违规将受到明确惩罚。

A.2 提示词模板

媒体内容 · 前往原文查看
图 6:我们实验设置中带工具展开的提示词模板。
媒体内容 · 前往原文查看
图 7:我们实验设置中无工具展开的提示词模板。

AKBE 需要两个提示词模板用于其双路径展开,如图 6 和图 7 所示。

带工具提示词。

带工具模板(图 6)遵循先前智能体强化学习工作中采用的基于标签的格式(Jin 等人,2025;Dong 等人,2025;Zong 等人,2026)。每次展开被结构化为由专用标签对分隔的语义不同区域:推理步骤在 `<think></think>` 内表述,检索查询通过 `<search></search>` 发出,环境观察结果注入到 `<result></result>` 中,最终预测在 `<answer></answer>` 内输出,且标准答案用 `\boxed{}` 括起来以便进行精确匹配提取。

无工具提示词。

无工具模板(图 7)移除了所有与工具相关的指令和标签(`<search>` 和 `<result>`),仅保留推理(`<think></think>`)和回答(`<answer></answer>`)部分。这迫使模型仅依靠其参数化知识生成答案,从而使 AKBE 能够通过比较两条路径的正确性来探测知识边界。

A.3 数据集

我们在两类广泛使用的问答基准上进行了实验,以评估我们提出的 AKBE 的有效性。

多跳问答。

该类别评估多轮工具使用和组合推理能力,正确答案无法从单次检索的段落中获得。HotpotQA(Yang 等人,2018)是一个基于维基百科的大规模基准,包含支持事实标注,是广泛使用的多跳问答测试平台。2WikiMultiHopQA(Ho 等人,2020)将维基百科段落与 Wikidata 三元组结合,生成需要显式多跳实体推理的问题。MuSiQue(Trivedi 等人,2022)包含约 2.5 万个问题,涵盖 2 到 4 跳推理,通过单跳原语的受控组合合成,以探测细粒度的推理深度。Bamboogle(Press 等人,2023)提供了一组规模虽小但具有对抗性的组合查询,作为智能体 RL 策略的鲁棒性探针。

单跳问答。

该类别验证单步检索任务的性能。Natural Questions(NQ)(Kwiatkowski 等人,2019)汇总了从维基百科回答的真实用户查询,是检索增强生成的标准基准。TriviaQA(Joshi 等人,2017)的问题与支持证据之间存在显著的词汇和句法差异,用于测试对表面形式变化的鲁棒性。PopQA(Mallen 等人,2022)是一个以实体为中心的基准,旨在区分外部检索与参数化记忆的贡献,因此它自然适用于诊断策略是否真正利用了搜索工具,还是依赖于记忆的事实。

A.4 AKBE 设置

关于我们AKBE的实现细节,我们使用的训练批次大小为 ,小批次大小为 ,最大响应长度为 。在策略执行阶段,对于带工具的策略执行,我们使用的策略执行大小为 ,对于无工具的策略执行,策略执行大小为 ,最大工具使用次数设置为 。AKBE目标的裁剪阈值设置为 (与GRPO相同)。遵循先前的研究工作(Yu等人,2025;Zheng等人,2025),我们移除了KL正则化项(),以允许策略探索多样化的策略执行策略。在多跳和单跳设置下,AKBE系数均设置为 ,这从经验上平衡了 和 之间的梯度贡献(详见§B分析)。

A.5 基线设置

媒体内容 · 前往原文查看
表4:实验中智能体强化学习基线使用的共享超参数。
配置 数值
优化器 AdamW
学习率 1e-6
裁剪比率 0.2
训练批次大小 64
PPO小批次大小 8
策略执行次数 16
最大提示词长度 2000
最大响应长度 6192
最大工具调用轮次 6
奖励指标 EM
检索器 本地维基百科
前K个检索段落 3

表4总结了所有基于强化学习的基线所使用的共享超参数。对于特定方法的配置,我们遵循各自原始论文中报告的设置。所有基线均在没有任何额外SFT阶段的情况下进行训练。我们选择并报告在所有评估基准上达到最高平均EM值的检查点结果。

A.6 搜索工具环境

我们的搜索工具环境遵循Search-R1(Jin等人,2025)的设置。我们使用维基百科快照作为检索语料库,并使用e5-base-v2(Wang等人,2022)作为密集检索器。该知识库包含约2100万个维基百科条目,为单跳和多跳查询提供了广泛的事实覆盖。在策略发出检索动作的每一轮中,搜索引擎会根据查询对候选段落进行评分,并返回最相关的3个条目,这些条目作为工具观察结果注入到上下文中,供模型进行推理。

A.7 硬件与工件

所有训练和评估实验均在配备 8 块 NVIDIA H20 GPU 的单节点上进行。我们采用两个公开可用的检查点作为骨干策略:Qwen3-4B(Yang 等人,2025)和 Qwen2.5-7B(Qwen 等人,2025),选择它们是因为其强大的推理能力以及与智能体后训练的良好兼容性。我们的训练基础设施基于 VeRL 框架(Sheng 等人,2024),这是一个混合控制器强化学习系统,其模块化的 rollout 接口支持 AKBE 双路径设计所需的多轮、工具交互式 rollout 调度。

附录 B 系数的理论分析

我们从 与 之间的梯度贡献平衡角度,对 的最优值进行了理论分析。

设置。

考虑一个包含 个问题的训练批次。对于每个问题 ,GRPO 目标函数是在 条带工具 rollout 轨迹上计算的,而 AKBE 目标函数最多选择一条目标轨迹 。总训练损失为:

(10)
梯度分析。

来自 GRPO 损失的每个问题梯度贡献涉及 条轨迹:

(11)

其中 是组内相对优势。假设每条轨迹贡献近似相等的梯度幅度 ,则每个问题的预期梯度范数为:

(12)

其中 是组内优势估计值的标准差。

对于 AKBE 损失,每个问题最多贡献一条目标轨迹:

(13)

其梯度范数近似为 。然而,并非所有问题都能产生信号。设 为可构造信号的问题比例()。AKBE 对每个问题的有效梯度贡献(在批次上取平均)为:

(14)
Refer to caption
图 8:Qwen3-4B 多跳任务上信号集成方法的比较。左图:训练步数上的 EM 评估。右图:训练奖励曲线。基于 DPO 的集成在初期表现良好,但在后期训练中崩溃。
平衡条件。

为了使两个目标函数对整体参数更新的贡献相当,我们需要:

(15)

代入每个问题的估计值,并注意到 GRPO 损失对轨迹进行了归一化,而 AKBE 则作用于单条轨迹:

(16)
实际估计。

在我们的设定中,采用二元奖励()并结合组相对归一化时,优势标准差在构造上是固定的。信号比例通常较高(约 70–80% 的问题在两条路径中至少有一条正确轨迹)。然而,关键缩放因子是轨迹数量的比值:对每个问题从条轨迹中聚合梯度(每条轨迹按权重加权),而则只使用一条完整权重的轨迹。为防止单条 AKBE 轨迹主导 RL 轨迹,应按下式缩放:

(17)

在我们的实验中,取时,得到,与我们的经验最优值高度吻合。考虑到任务难度和信号比例变化等动态因素,我们发现,在我们的实验设定中,构成一个合理范围。

附录 C 交叉熵与 DPO 在信号整合中的对比

一个自然的问题是,边界引导信号能否通过偏好优化(例如 DPO)而非交叉熵来整合。由于 AKBE 的信号构造为每个问题识别出偏好轨迹,因此还可以额外选择被拒绝轨迹,并应用 DPO 风格的目标函数:

(18)

其中和分别表示偏好轨迹和被拒绝轨迹。

信号构造差异。

基于交叉熵的 AKBE 仅保留正信号,引导模型朝向选定的目标轨迹,而不显式惩罚其他备选轨迹。相比之下,基于 DPO 的变体还会从错误或低效的 rollout 中额外选择被拒绝轨迹,具体选择工具调用次数最多(即与偏好模式偏差最大)的轨迹作为负信号。这就在高效与低效的工具使用行为之间创建了显式的偏好对。

实验对比。

我们在 Qwen3-4B 多跳任务上比较了三种配置:标准 GRPO、带交叉熵的 AKBE(我们的方法)以及带 DPO 整合的 AKBE。图 8 展示了 EM 评估结果和训练奖励动态。两个实验均采用。

结果与分析。

如图 8 所示,基于 DPO 的变体最初表现良好,甚至在训练中期阶段(第 80–140 步)超越了 GRPO。然而,随后它突然崩溃,在第 150 步之后,EM 和训练奖励均急剧下降。相比之下,AKBE(基于交叉熵)在整个训练过程中保持了稳定且单调的提升。

我们将这种不稳定性归因于偏好轨迹与拒绝轨迹之间固有的相似性。正面和负面信号都是涉及推理和工具调用的轨迹;它们仅在工具调用策略或最终正确性上有所不同。由于 DPO 明确降低了拒绝轨迹的概率,模型逐渐学会了惩罚偏好样本和拒绝样本中共同存在的工具调用模式,而不是学习高效与低效工具使用之间的细微差别。这导致工具调用行为被逐步过度抑制,最终引发训练崩溃。交叉熵通过仅提供正向监督来避免这种失败模式:它教会模型高效模式是什么样的,而不明确惩罚其他替代方案,从而为知识边界增强提供了更稳定、更具针对性的优化信号。

附录 D 知识边界估计的可靠性

Refer to caption
图 9:在 Qwen3-4B 多跳任务上,被分类为 NT=1 的正确无工具轨迹数量的分布。大多数 NT=1 的问题有 4/8 个正确的 rollout,表明知识边界估计是可靠的。

我们讨论一个潜在问题:基于无工具 rollout 中“至少一个正确”(在我们的实验设置中)的知识边界估计是否可靠,或者它是否被模型仅凭运气猜对的问题所主导。

具体而言,我们分析了训练过程中所有被归类为 NT=1 的问题的正确展开(rollout)次数分布。如图 9 所示,NT=1 的问题在训练早期平均有 5.0/8 个正确展开,在训练后期平均有 5.2/8 个正确展开。仅有 18.1%(早期)和 16.7%(后期)的 NT=1 问题恰好有 1/8 正确,而大多数问题(早期 63.4%,后期 67.1%)实现了 4/8 的正确展开。值得注意的是,有 30.9%(早期)至 36.7%(后期)的问题达到了完美的 8/8,这表明模型能够充分且可靠地利用其参数化知识。

这些结果表明,知识边界估计具有高置信度,而非由噪声驱动。此外,从训练早期到后期的改进证实,AKBE 的在线策略(on-policy)设计随着训练进行,逐步增强了边界估计的可靠性。对于少数可能存在噪声的情况(1/8 正确),较小的系数确保这些弱信号无法覆盖主导的强化学习目标,而在线策略机制则提供了额外的保障。

附录 E 补充开销分析

Refer to caption
图 10:GRPO 与 AKBE 在 Qwen3-4B 多跳任务上,每步工具调用次数(左)和平均响应长度(右)的对比。在训练过程中,AKBE 始终产生更少的工具调用和更短的响应。

为了补充正文(§5.3.5)中的每步开销对比,我们对驱动 AKBE 计算效率的两个底层因素进行了补充分析:工具调用频率和响应长度。

工具调用次数。

图 10(左)展示了每个训练批次中搜索调用总数随训练步数的变化。两种方法在初始阶段处于相似水平(每批次 320 次调用),但随着训练推进,其变化轨迹出现分化。GRPO 的工具调用次数稳步增长,从约 320 次上升至第 300 步时的 370 次以上,这反映了强化学习训练后的智能体在仅以正确性作为奖励时,倾向于增加工具使用的普遍现象。相比之下,AKBE 在整个训练过程中将工具调用次数稳定维持在 290–300 次左右,在训练中期(第 50–150 步)甚至略有下降。平均而言,AKBE 在整个训练过程中相比 GRPO 减少了 8.4% 的工具调用。

响应长度。

图 10(右)揭示了平均响应长度的显著差异。GRPO 呈现强劲上升趋势,平均响应长度从 2,300 个模型 token 增长至第 300 步时的 2,500 个模型 token 以上。这一增长与更多工具调用产生更长的多轮交互序列相关。相比之下,AKBE 在训练早中期阶段(第 1–100 步)呈现下降趋势,此后稳定在 1,600–1,700 个模型 token 左右。整体响应长度减少了 23.0%,这直接转化为更低的推理延迟和计算成本。

这些趋势证实了 AKBE 基于知识边界的引导信号产生了复合效率效应:通过在训练早期教会模型避免不必要的工具调用,后续的生成过程自然变得更短,从而同时加速了训练和推理。

附录 F 案例研究

我们展示了训练过程中(Qwen3-4B 多跳任务)来自 AKBE 三种信号类别的代表性案例。这些案例说明了双路径对比如何揭示模型的知识边界并指导信号构建。对于每个案例,我们展示了来自两条路径的完整推理轨迹、信号类别分类,以及哪条轨迹被选为监督目标。

案例 #1 分析(效率)。

此案例展示了效率信号类别,即模型拥有足够的参数化知识,无需外部检索即可正确作答。在带工具路径中,模型明确表示“我对《Donker Mag》并不熟悉”并启动了搜索,尽管无工具路径表明它能够从其内部知识中轻松回忆起该专辑与Die Antwoord的关联。这种差异暴露了第一级知识边界违规:模型在非必要时仍默认使用工具。通过将无工具轨迹选为监督目标,AKBE教会模型信任其对已知事实的参数化记忆,从而减少冗余工具调用并提升推理效率。

案例#2分析(工具依赖型)。

此案例展示了工具依赖类别,即外部检索确实必要。无工具路径暴露了明显的知识缺口:模型产生了看似合理但错误的答案(“沃伦·巴菲特”),在多个猜测间循环却未能得出正确答案(塞思·卡拉曼)。相比之下,带工具路径制定了针对性查询(“Baupost Group创始人”),立即检索到相关段落,从而实现了正确推理。此处,工具调用次数最少(TC=1)的带工具轨迹被选为目标。这一信号强化了第二级边界意识:对于超出参数化知识范围的问题,模型应学习高效的检索模式,通过单次工具调用解决查询。

案例#3分析(模型幻觉)。

这个案例揭示了一种微妙的失败模式:检索引发的模型幻觉。模型搜索“Arline Burks Gant 死亡日期”,但检索器返回了关于“Barbara Stoddard Burks”的不相关段落。使用工具路径没有识别出检索失败,反而基于相同的姓氏错误地将两人混为一谈,通过有缺陷的推理(“也许 Arline Burks Gant 和 Barbara Stoddard Burks 是同一个人?”)得出了错误答案。与此同时,不使用工具路径正确地回忆起 Maurice Pialat 死于 2003 年,而 Arline Burks Gant 一直活到 2011 年。这个案例表明,当检索结果嘈杂或偏离目标时,使用工具可能产生负面影响。通过选择不使用工具的轨迹作为目标,AKBE 引导模型避免在参数知识比嘈杂的搜索结果更可靠的查询上过度依赖检索。

这三个案例共同说明了 AKBE 的双路径比较机制如何在知识边界自适应地识别适当行为。信号构建并非统一偏向某一路径;相反,它会针对每个特定查询选择能反映最恰当工具使用决策的轨迹。这种细粒度、逐查询的监督使模型能够在不同场景下发展出细微的知识边界意识。

媒体内容 · 前往原文查看
表 5:案例 #1:效率(=✓, =✓)。模型已从参数知识中获知答案;工具调用是多余的。选择不使用工具的轨迹作为目标信号。
问题:Donker Mag 是哪个非洲嘻哈乐团的专辑?正确答案:Die Antwoord
使用工具路径(TC=1, EM=1.0)
<think> 好的,用户询问的是专辑“Donker Mag”,想知道它属于哪个非洲嘻哈乐团。首先,我需要弄清楚这张专辑与哪些艺术家相关。我对“Donker Mag”并不熟悉,所以应该查一下。 </think>
<search> Donker Mag 专辑 </search>
<result> 助手回复 Donker Mag 是南非嘻哈乐团 Die Antwoord 的第三张录音室专辑,于 2014 年 6 月 3 日由 Zef Records 发行。 </result>
第 1 页:“Die Antwoord” 然而,这张专辑遭到了许多评论家的平庸乃至负面评价。继《Ten$Ion》之后,他们发行了一首非专辑单曲《XP N$IV $H1T》。在《XP N$IV $H1T》发布后,Die Antwoord 于 6 月至 7 月在欧洲进行了一次短暂的巡演。巡演开始后不久,一首名为《Cookie Thumper!》的新单曲片段被发布,该单曲还将配有音乐视频。在新单曲发布前后,Die Antwoord 还公布了他们的第三张专辑《Donker Mag》的名称,该专辑于 2014 年 6 月 3 日发行。《Cookie Thumper!》的音乐视频于 2014 年 5 月 27 日作为该专辑的首支单曲发布。
第 2 页:《Magnet(杂志)》 《Magnet》是一本音乐杂志,主要关注另类、独立或非主流的乐队。该杂志每年出版四期,由 Eric T. Miller 独立拥有并编辑。20 世纪 90 年代,具有类似关注点的音乐杂志包括《Option》、《Raygun》和《Alternative Press》。《Magnet》的第一期于 1993 年中期出版。
第 3 页:“Green Monkey Records” (CDR GM1028) The OF - Escape Goat (CD GM1029) Jim McIver - Sunlight Reaches (CD GM1030) Tom Dyer’s New Pagan Gods - History Of Northwest Rock Vol. 1, 1959-1968 (CD GM1031) Fur For Fairies (CD GM1032) The Fuzz - Best Kept Secret…
</result>
<思考> 嗯,第一个搜索结果提到了“Die Antwoord”与专辑《Donker Mag》相关。Die Antwoord 是一个南非嘻哈组合。其他结果似乎不相关。所以,答案应该是 Die Antwoord。 </思考>
<答案> 最终答案是 \boxed{Die Antwoord}。 </答案>
无工具路径(TC=0, EM=1.0) 已选为目标
《Donker Mag》这张专辑属于哪个非洲嘻哈团体?答案是:Die Antwoord。
最终答案是 \boxed{Die Antwoord}。
媒体内容 · 前往原文查看
表 6:案例 #2:工具依赖(=✓,=✗)。模型缺乏关于这一具体事实的参数化知识。选择工具调用次数最少的带工具轨迹作为目标信号。
问题:Baupost Group 曾邀请哪位美国投资者、对冲基金经理兼慈善家来管理该对冲基金?真实答案:Seth Klarman
带工具路径(TC=1,EM=1.0)被选为目标(最小 TC)
好的,让我想想。问题是关于 Baupost Group 曾邀请哪位美国投资者、对冲基金经理兼慈善家来管理该对冲基金。我需要找出答案。首先,我应该回想一下 Baupost Group 是什么。Baupost 是一家对冲基金公司,对吧?他们可能有一位知名的创始人或与之相关的著名人物。问题提到他们邀请了一个特定的人来管理该基金。所以,我需要找到那个人的名字。也许我可以搜索“Baupost Group 创始人”来找到创始人的名字。让我查一下。
<search> Baupost Group 创始人</search>
<result>
第 1 页:“Baupost Group”……截至 2013 年 12 月 31 日,管理资产规模达 299 亿美元。Baupost Group 是一家只做多头的对冲基金,由哈佛大学教授 William Poorvu 与合伙人 Howard Stevenson、Jordan Baruch 及 Isaac Auerbach 于 1982 年共同创立。Poorvu 邀请 Seth Klarman 协助管理该基金,至今 Klarman 仍担任其负责人。Baupost Group 的投资理念强调风险管理。这家全球规模最大的对冲基金之一,是一家价值投资管理机构。据彭博社报道,Baupost 自成立以来的净收益排名第四。
第 2 页:“Baupost Group”Baupost Group 是一家只做多头的对冲基金,由哈佛大学教授 William Poorvu 于 1982 年创立……Poorvu 邀请 Seth Klarman 协助管理该基金,至今 Klarman 仍担任其负责人。
第 3 页:“Baupost Group”……Baupost 首席执行官 Seth Klarman 在向麻省理工学院学生发表演讲时解释说,由情绪驱动的投资研究风险很高,可能导致糟糕的投资决策。自成立以来,该公司的三个私人合伙基金实现了平均年化 19% 的回报率。
</result>
<think> 因此,根据搜索结果,Baupost Group 由 William Poorvu 等人创立。Poorvu 邀请 Seth Klarman 协助管理该基金,至今 Klarman 仍担任其负责人。问题问的是 Baupost Group 邀请了谁来管理该对冲基金。答案是 Seth Klarman。我来确认一下:搜索结果一致提到 Seth Klarman 是现任负责人,并且他是受 Poorvu 之邀来协助管理该基金的。所以答案应该是 Seth Klarman。 </think>
<answer> 最终答案是 \boxed{Seth Klarman}。 </answer>
无工具路径(TC=0, EM=0.0)
<think> 好的,让我想想。问题是关于 Baupost Group 询问哪位美国投资者、对冲基金经理和慈善家来管理该对冲基金。嗯。我记得 Baupost Group 是一家对冲基金,对吧?所以他们可能任命了一位董事总经理或其他什么人。等等,我想答案可能是沃伦·巴菲特这样的人。不,等等,巴菲特是伯克希尔·哈撒韦的 CEO。也许是另一个人。让我想想。有个人叫比尔·阿克曼?不,他更像是一位激进投资者。或者是罗杰·L·伊韦尔特?不,那不对。等等,我想正确答案是迪克·富尔德。不,他是雷曼兄弟的 CEO。也不是。也许是别人。Baupost Group 由罗伯特·F·德雷珀和杰里·罗兹创立。但问题是他们请谁来管理该基金。也许答案终究是沃伦·巴菲特。 </think>
<answer> 最终答案是 \boxed{沃伦·巴菲特}。 </answer>
媒体内容 · 前往原文查看
表 7:案例 #3:模型幻觉(=✗, =✓)。检索器返回了不相关的结果,误导模型得出错误答案。选择无工具轨迹作为目标信号。
问题:莫里斯·皮亚拉和阿琳·伯克斯·甘特,谁先去世?真实答案:莫里斯·皮亚拉
使用工具路径(TC=4, EM=0.0)
<think> 好的,问题是问莫里斯·皮亚拉和阿琳·伯克斯·甘特谁先去世。我需要找到他们的去世日期并进行比较。首先,我应该查一下莫里斯·皮亚拉是什么时候去世的。让我搜索一下。 </think>
<search> 莫里斯·皮亚拉 去世日期 </search>
<result>
第 1 页:“莫里斯·皮亚拉” 莫里斯·皮亚拉(;1925 年 8 月 31 日 – 2003 年 1 月 11 日)是一位法国电影导演、编剧和演员,以其电影严谨而不煽情的风格而闻名。他的作品常被描述为“现实主义”。皮亚拉出生于法国多姆山省的坎拉。
第 2 页:“莫里斯·皮亚拉” ……他总是愿意根据经验来调整他的叙事…… 莫里斯·皮亚拉(;1925 年 8 月 31 日 – 2003 年 1 月 11 日)是一位法国电影导演……
第 3 页:“莫里斯·罗内” ……他因癌症在巴黎一家医院去世…… 莫里斯·罗内(1927 年 4 月 13 日 – 1983 年 3 月 14 日)是一位法国电影演员、导演和作家。
</result>
<think> 莫里斯·皮亚拉于2003年1月11日去世。现在,我需要查找阿琳·伯克斯·甘特的去世时间。让我查一下。 </think>
<search> 阿琳·伯克斯·甘特去世日期 </search>
<result>
第1页:“芭芭拉·斯托达德·伯克斯”……多年后。伯克斯于1927年与斯坦福大学国家化学研究奖学金获得者赫尔曼·拉姆斯珀格结婚;两人一直维持婚姻关系直至1932年他去世。1943年,她与长期好友罗伯特·库克订婚,但她在两人结婚前便去世了。伯克斯于1943年5月25日去世,当时她“要么是失足,要么是跳下纽约市乔治·华盛顿大桥”身亡。
第2页:“理查德·芬纳·伯吉斯”……他与埃塞尔·佩特里·谢尔顿结婚……他于1945年1月13日在埃尔帕索去世。
第3页:“阿比·G·罗杰斯”……于1894年5月21日在纽约市意外去世,享年53岁。她当时正在接受肿瘤切除手术。
</result>
<think> 嗯,第一个结果提到了芭芭拉·斯托达德·伯克斯,但那是另一个人,不是阿琳·伯克斯·甘特。第二个结果是关于理查德·芬纳·伯吉斯的。第三个是关于阿比·G·罗杰斯的。这些都不是阿琳·伯克斯·甘特。等等,也许阿琳·伯克斯·甘特就是芭芭拉·斯托达德·伯克斯?两者都出现了“伯克斯”这个姓氏。或者,可能是搞混了。假设阿琳·伯克斯·甘特与1943年去世的那位“伯克斯”有关,那么她是在莫里斯·皮亚拉(2003年)之前去世的。因此,阿琳·伯克斯·甘特先去世。 </think>
<answer> 最终答案是 \boxed{阿琳·伯克斯·甘特}。 </answer>
无工具路径(TC=0,EM=1.0)被选为目标
<think> 问题是问莫里斯·皮亚拉和阿琳·伯克斯·甘特谁先去世。我记得莫里斯·皮亚拉是著名的法国电影导演,于2003年1月11日去世。至于阿琳·伯克斯·甘特,她不太出名,但我相信她活到了2011年。因此,莫里斯·皮亚拉在2003年先于阿琳·伯克斯·甘特去世。 </think>
<answer> 最终答案是 \boxed{莫里斯·皮亚拉}。 </answer>

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org