AgentForesight:面向多智能体系统早期故障预测的在线审计框架

HuggingFace Daily Papers(社区热门论文)·2026-05-09 08:00·113天前
AI 导读

针对LLM多智能体系统在长程任务中因关键错误扩散导致整体失败的问题,本研究提出在线审计框架AgentForesight。该框架能在任务执行过程中实时观察轨迹前缀,并在最早的关键错误处发出警报。研究构建了AFTraj-2K轨迹语料库,并基于此开发了AgentForesight-7B模型。该模型采用由粗到细的强化学习策略训练,在AFTraj-2K和外部基准测试中,其性能超越GPT-4.1等领先专有模型,实现了高达+19.9%的性能提升,并将步骤定位误差降低3倍,从而将故障处理从事后归因转向部署时干预。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

AgentForesight:面向多智能体系统早期故障预测的在线审计框架

2026-05-09 08:00· 113天前
AI 导读

针对LLM多智能体系统在长程任务中因关键错误扩散导致整体失败的问题,本研究提出在线审计框架AgentForesight。该框架能在任务执行过程中实时观察轨迹前缀,并在最早的关键错误处发出警报。研究构建了AFTraj-2K轨迹语料库,并基于此开发了AgentForesight-7B模型。该模型采用由粗到细的强化学习策略训练,在AFTraj-2K和外部基准测试中,其性能超越GPT-4.1等领先专有模型,实现了高达+19.9%的性能提升,并将步骤定位误差降低3倍,从而将故障处理从事后归因转向部署时干预。

推荐理由

在多agent系统里,一个错误往往被下游接受并导致整个轨迹失败,这篇论文把事后归因变成了在线审计,用小模型在错误扩散前报警,比GPT-4.1还准,做agent部署的值得细读。

正文 · AI 翻译

基于大语言模型的多智能体系统正越来越多地被部署在长周期任务上,但一个关键性错误往往会被下游智能体接受,并级联成整个轨迹层面的失败。现有研究将此问题框架化为*事后失败归因*,即在轨迹结束后诊断出有责任的智能体和步骤。然而,这种范式放弃了在轨迹仍在进行时进行干预的任何机会。在这项工作中,我们引入了 AgentForesight,这是一个将问题重新定义为在线审计的框架:在一条正在展开的轨迹的每一步,审计者仅观察当前的前缀,并且必须在无法访问未来步骤的情况下,要么继续运行,要么在最早的关键性错误处发出警报。为此,我们整理了 AFTraj-2K,一个涵盖编程、数学和智能体领域的智能体轨迹语料库,其中安全轨迹在严格的整理流程下被保留,不安全轨迹则通过多位大语言模型评判者达成共识,在其关键性错误步骤处进行标注。在此基础上,我们开发了 AgentForesight-7B,一个紧凑的在线审计者,通过一种由粗到细的强化学习方案进行训练:该方案首先在相邻安全/不安全前缀对的失败边界上为其配备风险预期先验,然后在一个三轴奖励(分别针对审计结论的“什么”、“哪里”和“谁”)下,将该先验锐化为精确的步骤级定位。在 AFTraj-2K 和一个外部 Who&When 基准测试上,AgentForesight-7B 超越了包括 GPT-4.1 和 DeepSeek-V4-Pro 在内的领先专有模型,实现了高达 +19.9% 的性能提升和 3 倍的步骤定位误差降低,从而将事后失败检测的闭环转变为支持部署时干预。项目页面:https://zbox1005.github.io/agent-foresight/

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org