持续更新导致LLM智能体记忆效用衰退

HuggingFace Daily Papers(社区热门论文)·2026-05-13 08:00·109天前
AI 导读

研究发现,当前由大语言模型驱动的智能体记忆系统在持续整合更新记忆时,会产生错误记忆,导致性能不升反降。即使基于完全正确的经验进行整合,GPT-4在部分问题上仍有54%的失败率,而这些问题是其无记忆时曾成功解决的。性能衰退源于整合步骤本身,而非原始经验。在受控测试中,默认保留原始经历片段的智能体,其准确率是强制整合版本的两倍;完全禁用整合、仅进行片段管理,能达到与自动管理相当的性能。因此,稳健的智能体记忆系统应将原始经历片段视为首要证据,并明确控制整合的触发条件,而非在每次交互后都自动执行。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

持续更新导致LLM智能体记忆效用衰退

2026-05-13 08:00· 109天前
AI 导读

研究发现,当前由大语言模型驱动的智能体记忆系统在持续整合更新记忆时,会产生错误记忆,导致性能不升反降。即使基于完全正确的经验进行整合,GPT-4在部分问题上仍有54%的失败率,而这些问题是其无记忆时曾成功解决的。性能衰退源于整合步骤本身,而非原始经验。在受控测试中,默认保留原始经历片段的智能体,其准确率是强制整合版本的两倍;完全禁用整合、仅进行片段管理,能达到与自动管理相当的性能。因此,稳健的智能体记忆系统应将原始经历片段视为首要证据,并明确控制整合的触发条件,而非在每次交互后都自动执行。

推荐理由

LLM 整合记忆的常规套路被这篇论文掀了桌子。连续更新反而会把有用的经验搞坏,甚至 GPT-5.4 自己解过的题,加上记忆后正确率暴跌。做 agent 的人值得认真看看,记忆架构可能要转向保留原始轨迹。

正文 · AI 翻译

从过往经验中学习受益于两种互补的记忆形式:情节性痕迹——所发生事件的原始轨迹——以及从众多情节中提炼出的、可复用的图式化经验教训,即整合性抽象知识。当前的智能体记忆系统追求的是整合形式:大语言模型将过去的轨迹重写为文本记忆库,并通过新的交互不断更新,从而有望实现无需参数更新的自我改进型智能体。然而我们发现,即便源自有用经验,当前大语言模型产生的这类整合记忆也常常存在缺陷。随着整合的推进,记忆效用先上升,后下降,甚至可能低于无记忆基线。更令人惊讶的是,即便从真实解决方案进行整合,GPT-5.4 在一组其先前无需记忆即可解决的 ARC-AGI 问题上仍有 54% 的失败率。我们将这种性能倒退追溯至整合步骤,而非底层经验本身:相同的轨迹在不同的更新策略下会产生性质不同的记忆,而仅保留这些轨迹的纯情节性对照组与我们测试的整合系统相比仍具竞争力。在暴露了“保留”、“删除”和“整合”操作的受控 ARC-AGI Stream 环境中,智能体默认保留原始情节,其准确率是强制整合方案的两倍;完全禁用整合(仅进行情节管理)则能达到与这种自动模式相同的效果。在实践中,稳健的智能体记忆应将原始情节视为首要证据,并显式地控制整合过程,而非在每次交互后都自动触发。展望未来,可靠的智能体记忆需要大语言模型能够在整合的同时,不覆盖其所依赖的证据。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org