# 智能体记忆并非越多越好：八款模型评测显示剂量需按能力校准

- 来源：Hugging Face：Blog（RSS）
- 发布时间：2026-08-19 02:09
- AIHOT 分数：66
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsz1974l06hbro20gosn5d78
- 原文链接：https://huggingface.co/blog/ibm-research/altk-evolve-hmm

## 精选理由

把智能体记忆的配置从越多越好修正为按模型能力校准，弱模型用检索核心比全量更准且成本更低，为上下文预算提供量化依据。

## AI 摘要

智能体记忆并非可随意开启的功能，而是需按模型能力校准的剂量。强模型适合注入完整指南集，DeepSeek-V3.2（671B MoE）任务完成率提升+9.5个百分点；较弱模型采用精选检索效果最佳，gpt-oss-120b（117B MoE）提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注，通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。

## 正文

Vatche Isahagian Vatche 关注

Gaodan Fang gaodan-fang 关注

Jayaram Radhakrishnan jayaramkr 关注

Punleuk Oum illeatmyhat 关注

Ashwath Vaithinathan Aravindan ashwath-vaithina 关注

Evelyn Duesterwald evduester 关注

G Thomas gsthomasx 关注

Vinod Muthusamy vinodmut 关注

Merve Unuvar mrvnvr 关注

在上一篇文章中，我们将 ALTK-Evolve 与 ACE 进行了对比，并展示了智能体自我蒸馏指南的交付方式——是每项任务检索几条，还是把整套指南全部注入——会同时影响准确率和成本。本文则退一步，回到更前置的问题：到底该给智能体多少记忆？为智能体配备智能体记忆听起来很简单：从它过去的工作中蒸馏经验教训，放回上下文中，经验越多就应该表现越好。但事实并非总是如此。当我们将评估扩展到八个模型——从 30B 稠密模型到前沿闭源系统——有一个发现格外突出：

智能体记忆不是一项打开即用的功能，而是一剂需要针对模型校准的剂量。

摘要

ALTK-Evolve 让智能体从自身过去的轨迹中学习：蒸馏出可复用的指南，并在推理时注入回上下文，无需更新权重，也无需人工标注。

合适的剂量因模型层级而异：有余量的强模型需要完整的指南集，较弱的模型用紧凑核心加按任务检索效果最好，而已经饱和的模型则没有可测量的提升。

精选检索可以同时是最准确也最经济的选择：gpt-oss-120b 在仅增加 +5% token 的情况下任务完成率提升了 +16.1 个百分点——而且提示词缓存让完整指南集在生产环境中也保持低成本。

核心洞察：剂量取决于能力

并非每个模型都能从相同量的记忆中获益。在横跨能力谱系的八个模型上，我们观察到了三种反复出现的模式：

有余量的强模型需要完整的指南集——包括罕见的边缘案例经验在内的每一条指南。它们有能力吸收并运用全部内容。DeepSeek-V3.2（671B MoE）在获得完整的自我挖掘指南集后，任务完成率提升了 +9.5 个百分点。

较小或较弱的模型容易被庞大的指南集淹没。对于这类模型，一个紧凑的高置信度核心指南，加上按任务检索到的少量相关指南，效果最佳。gpt-oss-120b（117B MoE）采用这种选择性方法后提升了 +16.1 个百分点——而使用完整指南集不仅提升更少，还多消耗约 50% 的 token。

已经饱和的模型没有表现出可衡量的提升。我们称之为“饱和模式”——这个标签描述的是我们观察到的现象，而非已证实的成因。该模型可能在这些任务上已经接近其能力上限，指南可能没有针对其剩余的失败点，或者模型可能没有有效地应用这些指导。在我们的运行中，GLM-5（745B MoE）就处于这种模式。

决定一个模型落入哪种模式的因素并非仅仅是参数量。基准测试的提升空间、上下文窗口大小、架构、指南质量以及任务分布似乎都会影响模型最终所处的模式，而厘清这些因素的各自作用仍在进行中。无论哪种情况，实际结论都成立：合适剂量的“记忆”取决于模型本身，而我们可以对其进行校准。

学习发生在模型周围，而非模型内部

这里的“记忆”并不意味着回放过去的对话记录。它指的是一套指南——包括行之有效的策略、需要避免的错误以及边缘情况——这些内容是从智能体自身过往的执行轨迹中提炼出来的。这个循环很直接：

智能体尝试执行任务并产生执行轨迹。

ALTK-Evolve 从其成功和失败的运行中提取行为指南。

它将这些指南整合成一套可复用的指南集。

在推理时，智能体会收到完整的指南集，或其中与任务相关的部分。

模型权重没有任何更新。这个学习循环改变的是可供智能体使用的指导，而非底层模型本身——这正是它采用成本低、并且在我们测试的八个模型中具有可移植性的原因。

全谱系结果

我们在 AppWorld 上进行了评估——该基准涵盖 9 个模拟应用（日历、消息、支付等）中的 585 个多步骤任务（168 个 testnormal + 417 个 testchallenge）。任务采用两种方式评分：智能体是否完整完成每个任务（TGC——任务目标完成率），以及场景的每个变体是否全部通过（SGC——场景目标完成率，这是一项更严格、全有或全无的指标）。完整定义见附录。

我们对比的三种配置

由于任何记忆研究的难点都在于上下文窗口中实际包含什么内容，我们事先对配置进行了定义。

两种记忆配置都来自同一套指南集，该指南集仅从 AppWorld 的训练集划分中（通过上述循环）挖掘一次。两者之间的区别仅在于这套指南的交付方式——完整指南集在每一步都注入全部内容，而精选检索则提供选定的子集——指南的生成方式从未改变，且构建过程中绝不使用任何测试集数据。

配置 智能体上下文中的内容

基线 无记忆——即智能体出厂时的原始状态。

完整指南集 所有挖掘出的指南，在每一步 ReAct 循环中都全部注入。

精选检索 上述指南中一个固定的、高置信度的核心子集，加上为每个任务检索到的少量任务相关指南（固定部分 + 可变部分）。

模型挖掘出的指南数量取决于其自身能力，因此我们按策略来报告配置——即“完整指南集”对比“精选检索”——而不是按原始数量，因为不同模型之间的数量不具备可比性。

三种模式，一图概览

八模型扫描中的代表性模型，以 testnormal 上的任务完成率（TGC）衡量：

图 1. 三种观察模式中的代表性模型。柱状图显示基线 vs. 最佳记忆配置在 AppWorld test\normal 上的 TGC；x 轴从 40% 开始以便差异可见。仅看 TGC 会低估更大的 SGC 提升——请参见下表中的 SGC 列。

图中绘制 TGC 以保持可读性；表格则补充了更严格的 SGC 指标，该指标上的提升往往更大：

模型 模式 基线 TGC / SGC 最佳记忆 TGC / SGC 最佳配置 Δ TGC Δ SGC

gpt-oss-120b（117B MoE） 弱 / 选择性 39.9 / 21.4 56.0 / 37.5 精选检索 +16.1 +16.1

DeepSeek-V3.2（671B MoE） 表现强劲，仍有提升空间 79.8 / 64.3 89.3 / 80.4 完整指南集 +9.5 +16.1

Claude Opus 4.6 表现强劲，仍有提升空间 90.5 / 87.5 94.6 / 94.6 完整指南集 +4.1 +7.1

GPT-5.5 表现强劲（接近上限） 92.3 / 82.1 95.2 / 89.3 完整指南集 +2.9 +7.2

GLM-5（745B MoE） 已饱和 87.5 / 80.4 87.5 / 80.4 完整指南集 0.0 0.0

看 SGC 这一列，更严格的指标通常比 TGC 变动更大——DeepSeek 的 SGC 提升了 +16.1 个百分点，而 TGC 只提升了 +9.5 个百分点——因为好的指南尤其能帮助智能体通过某个场景的所有变体，而不仅仅是平均情况。而且这种效果在顶尖模型上也不会消失：GPT-5.5 和 Opus 在 TGC 上都已经接近上限，但 SGC 仍然分别提升了 +7.2 和 +7.1 个百分点。只要模型还有剩余的失败模式可以针对，记忆就会持续带来回报。

最省钱的记忆策略也可能是最好的策略

一个实际顾虑：注入完整的指南集会膨胀每个 ReAct 步骤的输入，因为指南会在每一轮重新发送。以下是我们观察到的结果：

模型 配置 每个任务的 token 数（基线） 每个任务的 token 数（+记忆） 额外开销

DeepSeek-V3.2 完整指南集 148K 263K +78%

gpt-oss-120b 完整指南集 110K 166K +51%

gpt-oss-120b 精选检索 110K 116K +5%

表 1. 每个任务的平均 token 使用量，跨智能体步骤累计，与无记忆基线对比。

两点结论：

精选检索让成本保持在基线附近。对于较弱的模型，在准确性上精选胜出，在成本上它也胜出——两全其美（gpt-oss-120b 的 TGC 提升 +16.1 个百分点，token 只增加了 5%）。更好的性能在这里并不需要更高的推理成本。

记忆不会让推理循环失控。DeepSeek 在带记忆和不带记忆的情况下运行的 ReAct 步骤数大致相同（平均约 18–19 步），所以增加的成本来自输入 token 的膨胀，而不是更长的推理轨迹。

生产环境中真正的效率杠杆是提示词缓存：指南集中静态部分在各步骤间完全一致，可以被缓存，从而大幅降低实际成本。缓存感知的提示词设计——保持共享指南集前缀稳定，使其始终可被缓存——值得投入工程精力。我们还推测上下文窗口大小也起作用：上下文窗口更大的模型可能更有效地吸收完整指南集，而上下文较小的模型则更受益于检索，使注入内容保持紧凑。我们尚未开展隔离这一因素的受控实验。

记忆应当被校准，而非仅仅累积

经验教训不是把智能体学到的一切都给它，而是给它它实际能用的经验量。

对于弱模型，这意味着一个紧凑的核心加上几条任务特定的经验——而这恰好也是最经济的选择。

对于有余力的强模型，这意味着保留完整指南集，并通过提示词缓存在生产中保持成本可控。

对于已饱和的模型，这意味着在剩余失败模式被更好理解之前，不额外占用上下文。

收益在各方面都是实实在在的——自动、无泄漏、无需人工标注——但前提是剂量匹配模型。

下一步

这是起点，而非终点：

学习型选择器。我们当前的检索按余弦相似度对指南排序，而我们已经证明这并不能完美预测哪些指南对给定任务有帮助。基于结果信号训练的选择器是自然的下一步。

极弱模型的记忆。低于最低能力基线时，自蒸馏缺乏信号。针对极弱模型的教师蒸馏记忆是我们正在探索的另一个独立问题。

超越 AppWorld。这些结果在 AppWorld 上得到验证——这是一个严谨的多步骤基准，但只是单一基准。更广泛的智能体基准和真实部署正在进行中。

隔离上下文窗口。如上所述，我们希望进行受控实验，将上下文窗口大小与原始能力分离开来。

可以试试 ALTK-Evolve 库——它包含了这里用到的抽取、整合和检索流水线——或者阅读完整的技术报告，了解完整方法和消融实验。

附录：理解各项指标

AppWorld 任务由两项指标评分，均以百分比形式报告（越高越好）：

TGC——任务目标完成率。智能体完整且正确完成的单个任务所占的比例。这是衡量“任务是否真正完成”的核心指标。

SGC——场景目标完成率。这是一个更严格的“全有或全无”指标。每个场景包含同一任务的多个变体（相同请求但数据、措辞或边界条件不同）。只有当智能体在每个变体上都成功时，SGC 才将该场景计为通过。它衡量的是可靠性——一个大多数时候能解决任务但在某个变体上失败的智能体，在 TGC 上能得分，但在 SGC 上则不能。
