Apple Machine Learning Research(RSS)
精选
66AI 编辑部评分,满分 100

PORTool: 基于奖励树和重要性感知的策略优化方法,用于多工具集成推理

2026-05-04 08:00· 93天前
AI 导读

研究团队提出PORTool算法,以解决多工具集成推理中仅依靠结果奖励导致的信用分配模糊问题。该方法通过重要性感知策略优化,在结果级监督下强化智能体的工具使用能力,同时实现步骤级奖励分配。PORTool生成奖励树来明确关键决策步骤,从而更精确地引导模型学习有效的工具调用序列,提升复杂任务解决的效率和可靠性。

推荐理由

不少 Agent 团队训练时都遇到过奖励信号太稀疏的问题,PORTool 试着把奖励细粒度化,给了个可实操的解法,做工具调用智能体的值得深读。

正文 · AI 翻译

多工具集成推理使基于大语言模型的工具使用智能体能够通过将自然语言推理与外部工具调用交织在一起,来解决复杂任务。然而,仅使用结果奖励来训练此类智能体会面临信用分配模糊的问题,即难以确定哪些中间步骤(或工具使用决策)导致了成功或失败。在本文中,我们提出了 PORTool,一种重要性感知的策略优化算法,该算法从结果层面的监督中强化智能体的工具使用能力,同时在步骤层面分配奖励。具体来说,PORTool 生成一个带奖励的展开树,其中各轨迹在分支前共享前缀,从而能够在相同上下文中对不同的工具使用决策进行直接比较。然后,它通过一个正确性主导信号来估计每个步骤的重要性,即该步骤的后继步骤最终能否产生正确的最终答案,再加上一个辅助项,指示该步骤的工具调用是否成功执行。利用这些步骤级的重要性估计,PORTool 更新策略以生成高效的工具调用步骤,其指导依据既包括每个分支决策内的局部比较,也包括整个轨迹的整体质量。实验表明,与最先进的基线方法相比,PORTool 在提高最终答案准确性的同时减少了工具调用步骤,而消融研究则证实了所提出的步骤级重要性估计的鲁棒性。

  • † 普渡大学
  • ** 工作完成于苹果公司任职期间

相关阅读与更新。

强化智能体:面向工具调用智能体的推理时反馈

本文已被 ACL 2026 第五届自然语言生成、评估与度量研讨会接收。

工具调用智能体在工具选择、参数准确性和范围识别方面进行评估,然而对大语言模型轨迹的评估本质上仍是事后性的。由于与主动执行循环脱节,此类评估识别出的错误通常通过提示词调整或重新训练来解决,并且从根本上无法……

ToolSandbox:一个用于评估大语言模型工具使用能力的状态化、对话式、交互式评测基准

近期大语言模型(LLM)的进展引发了学界对工具辅助型大语言模型解决现实世界挑战的日益关注,这要求对工具使用能力进行全面的评估。此前的研究要么聚焦于基于单轮用户提示词的无状态网络服务(RESTful API)评估,要么基于离策略对话轨迹进行评估,而 ToolSandbox 则包含了有状态工具执行、隐式状态依赖……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

PORTool: 基于奖励树和重要性感知的策略优化方法,用于多工具集成推理

Apple Machine Learning Research(RSS)·2026-05-04 08:00·93天前
AI 导读

研究团队提出PORTool算法,以解决多工具集成推理中仅依靠结果奖励导致的信用分配模糊问题。该方法通过重要性感知策略优化,在结果级监督下强化智能体的工具使用能力,同时实现步骤级奖励分配。PORTool生成奖励树来明确关键决策步骤,从而更精确地引导模型学习有效的工具调用序列,提升复杂任务解决的效率和可靠性。

正文 · AI 翻译

多工具集成推理使基于大语言模型的工具使用智能体能够通过将自然语言推理与外部工具调用交织在一起,来解决复杂任务。然而,仅使用结果奖励来训练此类智能体会面临信用分配模糊的问题,即难以确定哪些中间步骤(或工具使用决策)导致了成功或失败。在本文中,我们提出了 PORTool,一种重要性感知的策略优化算法,该算法从结果层面的监督中强化智能体的工具使用能力,同时在步骤层面分配奖励。具体来说,PORTool 生成一个带奖励的展开树,其中各轨迹在分支前共享前缀,从而能够在相同上下文中对不同的工具使用决策进行直接比较。然后,它通过一个正确性主导信号来估计每个步骤的重要性,即该步骤的后继步骤最终能否产生正确的最终答案,再加上一个辅助项,指示该步骤的工具调用是否成功执行。利用这些步骤级的重要性估计,PORTool 更新策略以生成高效的工具调用步骤,其指导依据既包括每个分支决策内的局部比较,也包括整个轨迹的整体质量。实验表明,与最先进的基线方法相比,PORTool 在提高最终答案准确性的同时减少了工具调用步骤,而消融研究则证实了所提出的步骤级重要性估计的鲁棒性。

  • † 普渡大学
  • ** 工作完成于苹果公司任职期间

相关阅读与更新。

强化智能体:面向工具调用智能体的推理时反馈

本文已被 ACL 2026 第五届自然语言生成、评估与度量研讨会接收。

工具调用智能体在工具选择、参数准确性和范围识别方面进行评估,然而对大语言模型轨迹的评估本质上仍是事后性的。由于与主动执行循环脱节,此类评估识别出的错误通常通过提示词调整或重新训练来解决,并且从根本上无法……

ToolSandbox:一个用于评估大语言模型工具使用能力的状态化、对话式、交互式评测基准

近期大语言模型(LLM)的进展引发了学界对工具辅助型大语言模型解决现实世界挑战的日益关注,这要求对工具使用能力进行全面的评估。此前的研究要么聚焦于基于单轮用户提示词的无状态网络服务(RESTful API)评估,要么基于离策略对话轨迹进行评估,而 ToolSandbox 则包含了有状态工具执行、隐式状态依赖……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com