摘要
大语言模型智能体需要记忆才能在长时间交互中保持一致的行为,然而许多系统使用额外的 LLM 调用来操作该记忆。生成中间记录并调解其检索会增加重复的 token 和时间成本,而省略或合并的细节可能会掩盖原始证据。我们质疑结构化记忆访问是否真的需要生成。Zero-Mem 引入了零 token 记忆操作:除最终问答之外的任何步骤都不会调用 LLM,也不会消耗 LLM 输入或输出 token;编码器计算单独核算。Zero-Mem 保留原始交互轨迹作为其记录来源。它通过两种互补的方式组织这些轨迹。实体-上下文图揭示了交互之间的联系,而时间层次结构则保留了对话的局部性和会话状态。对于每个查询,Zero-Mem 会权衡这两种视图,从两者中检索,并遵循其结构来恢复支持性关系或周围上下文。确定性校准首先丢弃冲突证据,然后使阅读器的答案基于检索到的轨迹。只有最终问答阅读器才会调用 LLM。在长记忆和长上下文问答基准测试中,Zero-Mem 在消除记忆操作中的 LLM 调用和 LLM token 消耗的同时,实现了具有竞争力的性能。在相同的最终问答阅读器和上下文预算下,与最快的对比基线相比,它将记忆操作的时间成本降低了 57.6%。消融实验支持了这两种视图及其查询依赖协调的贡献。总体而言,结果表明结构化智能体记忆不需要生成过去的中间表示。同行评审后,代码和实现细节将在 https://github.com/TheMoon0815/Zero-mem 提供。
引言
大语言模型(LLM)智能体越来越多地运行在长时间交互场景中,不断积累对话内容、操作行为、工具观测结果以及任务产出(Luo 等,2025;Du 等,2026;Xi 等,2025)。因此,其可靠性不仅取决于对当前输入进行推理的能力,还取决于能否从不断增长的交互历史中恢复出正确的证据。记忆系统必须跨会话保留信息,同时防止无关或过时的痕迹主导当前决策。因此,核心挑战已不再仅仅是如何存储更多上下文,而是如何在证据与正确的实体、会话和时间状态相关联时,将其准确恢复出来(Zhang 等,2025b;Hu 等,2026b;Yang 等,2026;Wu 等,2025)。
在智能体记忆与智能体化结构化检索系统中,语言模型已被用于对经验进行摘要或反思、构建层级化抽象与图索引,以及生成或演化相互关联的记忆记录(Zhong et al. 2024; Salama et al. 2025; Sun et al. 2026; Gutierrez et al. 2024; Anokhin et al. 2025; Zhang et al. 2025a)。这些转换虽然能让大规模历史记录更易于访问,但也将记忆管理变成了一项反复出现的生成式工作负载。当生成的抽象内容介入后续检索时,被省略的细节、被合并的主体或被模糊化的时间更新,可能会削弱与原始交互之间的可追溯性。相反的策略则是保留完整历史,直接从原始痕迹中进行检索(Yan et al. 2025; Xu et al. 2022)。尽管这种方式保留了源证据,但扁平化的词法检索或稠密检索可能会混淆来自不同用户、会话或时间状态下语义相似的痕迹,并且当支撑证据分散在多次交互中时,检索也可能失效。因此,有效的记忆既需要忠实的保留,也需要结构化的、以查询为条件的证据选择。
近期系统只是降低这种依赖,而非彻底消除。SimpleMem(Liu 等人,2026)通过语义结构化压缩、在线语义综合和意图感知检索规划来提升 token 效率,而 LightMem(Fang 等人,2026)则将多项记忆操作从大型 LLM 转移到专门的小型语言模型上,并将在线检索与离线整合分离。这些方法降低了生成开销,但并未针对“最终问答是唯一依赖 LLM 的阶段”这一记忆流水线进行优化。因此我们提出疑问:智能体记忆系统能否在最终问答之外的每一项操作中消除 LLM 调用,同时保留超越扁平相似性检索的结构化访问能力?我们将这种运行模式称为零 token 记忆操作:记忆构建、组织、路由、检索、证据闭合,以及读前证据校准和读后答案校准均不调用 LLM,也不消耗任何 LLM 输入或输出 token。编码器计算和最终问答推理单独核算。
我们提出 Zero-Mem,它将记忆操作重新定义为对带溯源交互轨迹的结构化证据选择。Zero-Mem 并非用生成的抽象来替代历史记录,而是保留原始轨迹作为权威记录来源,并在此基础上衍生出两种互补的、非生成式的视图。实体-上下文图捕获观察到的共现关系和轨迹邻接性,用于关系型访问;而按时间排序的层级结构则保留对话局部性和会话级状态。两种视图都解析到相同的带溯源源单元。在查询时,一个轻量级配置文件根据查询的结构需求协调这两种视图。它们的排序结果被融合,证据闭包用关系连接和周围轨迹上下文补充主要候选。随后,确定性证据校准生成紧凑的证据集,用于最终问答。阅读器是唯一依赖 LLM 的阶段;之后,确定性答案校准应用证据支持、类型和格式检查,而无需调用另一个模型。因此,在原始轨迹与暴露给阅读器的证据之间,没有任何生成的记忆介入。
在长上下文和长记忆问答基准测试中,Zero-Mem 在实现有竞争力性能的同时,将记忆操作的 LLM 调用和 token 数降至零。在采用相同的最终问答阅读器和等效上下文预算的情况下,与最高效的基线相比,Zero-Mem 实现了 57.6% 的记忆操作延迟降低,消融研究进一步验证了每个核心模块的有效性。我们的贡献有三点:
- •
我们定义了零 token 智能体记忆,这是一种运行机制,其中最终问答之外的每项操作都使用零 LLM 调用和零 LLM 输入或输出 token,从而将记忆操作成本与最终阅读器推理分离。
- •
我们引入 Zero-Mem,这是一个保留溯源的框架,它协调关系型视图和时间排序视图,直接在原始交互轨迹上进行结构化证据选择。
- •
我们在多个长时记忆基准上评估了 Zero-Mem,证明了其在零记忆操作大语言模型成本下的竞争性表现,并分析了其互补核心模块的贡献。
相关工作
智能体记忆系统负责组织、更新和检索不断增长的交互历史(Yao 等人,2023;Schick 等人,2023;Wang 等人,2024;Park 等人,2023;Shinn 等人,2023)。Zep(Rasmussen 等人,2025)构建了一个具有时间感知的知识图谱记忆层,包含情景子图、语义实体子图和社区子图,并采用双时间模型跟踪事件时间和摄取时间。Mem0(Chhikara 等人,2025)通过大语言模型工具调用增量式提取和更新记忆,支持添加、更新、删除和无操作等操作;Mem0g 使用有向标记图对实体关系进行建模。A-Mem(Xu 等人,2025)遵循 Zettelkasten 笔记法,构建带有关键词、标签和上下文描述的结构化记忆笔记,同时动态关联相关记忆。MemoryOS(Kang 等人,2025)采用受操作系统启发的架构,包含短期、中期和长期存储,支持分页和基于流行度的更新。GAM(Yan 等人,2025)在即时记忆范式下将轻量级离线记忆与在线深度研究相结合,以更高的查询时成本构建任务特定上下文。CompassMem(Hu 等人,2026a)将经验组织为以事件为中心的记忆图,并为复杂问题提供显式关系。LightMem(Fang 等人,2026)将记忆更新与在线推理解耦,应用预压缩和主题分割来降低延迟和 token 成本。SimpleMem(Liu 等人,2026)结合语义结构化压缩、在线语义综合和意图感知检索规划来减少 token 消耗。总体而言,这些系统提升了记忆效率,但其中许多系统仍在记忆生命周期内保留了生成式处理。
预备知识
一个 LLM 智能体会累积过往交互的历史记录,其中每条痕迹单元可能包含用户消息、助手回复或动作、工具观察结果、时间戳、发言者以及会话元数据。面对当前查询时,智能体记忆系统会从历史记录中检索相关信息,以构建证据集。
| (1) |
随后,一个阅读型 LLM 利用检索到的证据来生成答案:
| (2) |
在本研究中,Zero-Mem 通过非生成式的记忆构建、组织、检索、路由和校准来实现记忆功能。
方法
Zero-Mem 概览
Zero-Mem 通过无 token 的证据选择来实现记忆功能。它保留原始交互痕迹作为权威记忆来源,并在此基础上构建非生成式检索结构。Zero-Mem 由四个组件构成:保留溯源信息的无 token 记忆基座、查询条件证据路由、双视图证据检索与补全,以及确定性证据校准。图视图恢复关系型证据,而层级视图保留局部、时间及会话上下文。路由控制两者的相对优先级,补全通过结构相关的证据补充检索候选集,校准则剔除不一致或缺乏支撑的内容。所有记忆操作均不消耗 token,只有最终的阅读器生成答案。
保留溯源信息的无 token 记忆基座
Zero-Mem 并不会用生成的抽象内容来替代原始历史记录。每个派生单元都保留其原始文本,连同来源标识符、会话时间、边界标识符以及其他可用元数据。因此,检索到的证据始终可追溯到实际观察到的交互,而非模型生成的记忆陈述。
关系追踪图。
Zero-Mem 对每个上下文单元应用非生成式命名实体识别(NER)模型(如 spaCy),并根据检测到的实体构建一个“实体—上下文”观测图:
| (3) |
其中 和 分别表示上下文节点和实体节点。 包含实体—上下文共现边, 包含相邻上下文单元之间的邻接边。当实体 在上下文单元 中被检测到时,即添加一条实体—上下文边,其权重为:
| (4) |
其中 是 在 中的出现频率。 表示在 中检测到的实体集合。相邻的上下文单元也会被连接起来,以保留局部连续性。该图记录的是观测到的共现关系和追踪邻接关系,而非生成语义三元组或推断出的关系。
分层追踪单元。
仅靠图结构无法保留交互的局部顺序和时间状态。Zero-Mem 在多个粒度上组织追踪数据:
| (5) |
轮次(Turn)保留原子话语,窗口(Window)保留短程上下文,片段(Episode)则根据语义连续性以及可用的时间或会话边界,将相邻窗口分组为连贯的事件区域。局部跨度(Local span)保留候选轮次的紧邻上下文,在所选证据需要周围语境时使用。所有单元都继承自其底层原始追踪数据的来源信息。
词法与稠密访问信号。
Zero-Mem 还使用词法统计(BM25)和稠密嵌入向量(BGE-M3)对追踪单元建立索引。词法信号用于识别精确的名称、日期、数字、标题和短语,而稠密信号则在表层重叠较弱时提供语义锚点。这些表示仅用于索引、种子化和打分;它们不会生成或改写记忆内容。
查询条件化证据路由
对于每个查询,Zero-Mem 都会构建一个轻量级画像
| (6) | ||||
主题和关键词提供内容锚点,而答案类型和时间线索则刻画了所请求证据的结构性要求。在可用时,边界限定了允许的交互范围。这些信号从查询和可用元数据中获取,不使用金标准答案,并由路由和后续证据选择共享。该画像决定哪个证据视图获得优先权:
| (7) |
关系路由表示图优先,而局部路由表示层级优先。路由决策基于确定性的查询结构信号,包括问题形式、时间或聚合要求,以及主题锚点的可用性。两种视图都在完整模型中执行;路由主要控制它们在融合过程中的相对权重。设 表示全局共享的主视图权重。关系查询分别将权重 和 分配给图视图和层级视图,而局部查询则反转这些权重。
双视图证据检索
图证据传播。
图视图首先将从查询中提取的每个实体与其最相似的观测图实体 对齐。其初始激活为:
| (8) |
其中 和 是它们的稠密表示。当对齐实体可用时,稠密上下文匹配提供上下文先验;当未检测到任何实体时,则提供直接的回退排序,而词汇和短语信号则细化生成的上下文排序。Zero-Mem 随后通过相关的共现句子,将这些匹配图实体的激活进行扩展。设 表示包含实体 的句子集合。实体 的传播激活为
| (9) |
其中 是传播步数, 是第 步的活跃图实体集合,其中 由匹配实体组成, 表示查询与句子 之间的稠密相似度。因此,当一个实体与已激活的图实体在与查询相关的句子中共同出现时,该实体将获得高分。传播后的实体激活和稠密上下文先验被组合成一个查询特定的重置向量 。个性化 PageRank 随后将此证据分布到关系图上:
| (10) |
其中是查询条件下的平稳节点得分向量,是结合了传播的实体激活与稠密上下文先验的归一化重置分布,是行归一化的图转移矩阵,是阻尼因子。上下文节点上的 PageRank 值构成图视角的排序。最后,精确的词汇和短语匹配被用于细化该排序,以处理名称、日期、数值、标题和引述表达。
层级化证据检索。
层级化视角通过从粗到细的搜索来检索证据。每个单元都通过联合考量其与查询的语义相关性及其与查询画像的结构兼容性来进行评估。兼容性信号包括主题一致性、时间有效性、边界一致性、预期答案类型以及词汇或短语支持。这些信号被用于细化语义排序,而非被视为独立生成的证据。检索从事件片段推进到时间窗口,再到单个对话轮次:
| (11) |
事件片段识别相关的事件区域,时间窗口将搜索范围缩小到局部上下文,对话轮次则揭示原始证据。当选定的对话轮次依赖于邻近信息时,其局部跨度会被添加进来,以保留即时的叙述或对话状态。与图传播不同,该视角明确维护了顺序、时间局部性和会话级上下文。
| 模型 | 方法 | LoCoMo | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 单跳 | 多跳 | 时间 | 开放域 | 平均 | |||||||
| F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | ||
| GPT-4o-mini | LONG-LLM | 46.68 | 37.54 | 29.23 | 22.76 | 25.97 | 19.42 | 16.87 | 13.70 | 37.31 | 29.57 |
| RAG | 52.45 | 47.94 | 27.50 | 20.13 | 46.07 | 40.35 | 23.23 | 17.94 | 44.73 | 39.40 | |
| HippoRAG | 54.84 | 48.84 | 33.59 | 25.46 | 48.17 | 39.32 | 28.59 | 23.89 | 47.92 | 41.02 | |
| A-Mem | 44.65 | 37.06 | 27.02 | 20.09 | 45.85 | 36.67 | 12.14 | 12.00 | 39.65 | 32.31 | |
| Mem0 | 47.65 | 38.72 | 38.72 | 27.13 | 48.93 | 40.51 | 28.64 | 21.58 | 45.10 | 35.90 | |
| MemoryOS | 48.62 | 42.99 | 35.27 | 25.22 | 41.15 | 30.76 | 20.02 | 16.52 | 42.84 | 35.54 | |
| LightMem | 41.79 | 37.83 | 29.78 | 24.80 | 43.71 | 39.72 | 16.89 | 13.92 | 38.44 | 34.36 | |
| SimpleMem | 53.48 | 47.59 | 36.93 | 28.80 | 51.30 | 45.29 | 21.78 | 15.67 | 48.02 | 41.68 | |
| CompassMem | 57.36 | 49.79 | 38.84 | 27.98 | 57.96 | 50.51 | 26.61 | 20.01 | 52.18 | 44.09 | |
| GAM | 57.75 | 52.10 | 42.29 | 34.44 | 59.45 | 53.11 | 33.30 | 26.97 | 53.75 | 47.51 | |
| Zero-Mem | 66.65 | 60.53 | 41.61 | 32.92 | 61.97 | 57.45 | 35.52 | 30.47 | 59.15 | 52.96 | |
| Qwen2.5-14B | LONG-LLM | 46.05 | 39.56 | 32.08 | 24.46 | 30.51 | 24.45 | 14.89 | 11.41 | 38.31 | 31.90 |
| RAG | 47.87 | 42.79 | 26.38 | 19.54 | 30.78 | 25.97 | 14.16 | 10.52 | 38.27 | 33.01 | |
| HippoRAG | 42.45 | 37.14 | 27.57 | 20.62 | 30.66 | 26.33 | 19.74 | 15.81 | 35.85 | 30.53 | |
| A-Mem | 33.75 | 30.04 | 22.09 | 15.28 | 27.19 | 22.05 | 13.49 | 10.74 | 28.98 | 24.47 | |
| Mem0 | 42.58 | 35.15 | 31.73 | 24.82 | 28.96 | 26.24 | 15.03 | 11.28 | 36.04 | 29.91 | |
| MemoryOS | 46.33 | 41.62 | 38.19 | 29.26 | 32.24 | 27.86 | 20.27 | 15.94 | 40.28 | 34.89 | |
| LightMem | 34.92 | 31.22 | 25.45 | 19.61 | 32.03 | 27.70 | 15.81 | 11.81 | 31.39 | 27.15 | |
| SimpleMem | 51.11 | 45.47 | 34.04 | 25.65 | 48.46 | 36.07 | 23.41 | 21.45 | 45.71 | 38.39 | |
| CompassMem | 61.02 | 55.93 | 42.32 | 32.66 | 47.18 | 39.69 | 25.88 | 22.01 | 52.52 | 46.17 | |
| GAM | 58.93 | 53.74 | 42.96 | 34.48 | 51.52 | 44.43 | 30.63 | 26.04 | 52.70 | 46.55 | |
| Zero-Mem | 64.09 | 58.19 | 44.06 | 35.13 | 58.34 | 53.61 | 37.57 | 32.46 | 57.57 | 51.41 | |
双视角证据闭合
Zero-Mem 首先通过查询级分数归一化来对齐图谱视角与层级视角的排序。对于每个视角,
| (12) |
其中 和 是基于视角 返回的候选结果计算得到的。归一化后的排序通过双视角路由系数 进行融合:
| (13) |
图谱视角主要面向关系型查询,而层级视角主要面向局部查询。设 表示融合后保留的主要证据。Zero-Mem 用两个视角中受查询条件约束的有界支持信息对其进行增强:
| (14) |
此处, 提供具有关系或桥接支持能力的额外图谱排序上下文,而 则恢复相邻轮次或局部片段;当无需额外补充时,任一支持集均可为空。重复项通过共享单元标识符或可用的来源溯源信息进行合并,最终得到兼具关系支持与局部支持的紧凑证据集。
确定性证据校准
Zero-Mem 在证据层面和答案层面均应用确定性校准。在证据闭合之后,它会移除违反来源约束或查询边界约束的候选结果,并按主题、时间以及答案类型兼容性对剩余证据进行排序:
| (15) |
在这里,`enforces` 强制执行硬约束,而 `orders` 在不改变其内容的情况下对可采纳的证据进行排序。阅读器根据 `prompt` 生成初始答案。对于支持确定性检查的答案形式,Zero-Mem 提取证据局部候选并校准输出:
| (16) | ||||
校准在答案受支持且格式良好时予以保留;否则,应用保留证据的归一化、提取式缩短或逐项列表修剪。标量答案仅在被 `candidates` 中唯一类型兼容的候选替换;如果没有可用的确定性修正,则保留 `answer`。
| 方法 | 答案质量 | 记忆操作开销 | ||||
|---|---|---|---|---|---|---|
| F1 分数 | BLEU-1 | Token 数 | Token / 查询 | 时间(秒) | 时间 / 查询(秒) | |
| SimpleMem | 48.02 | 41.68 | 14,096,246 | 9,153.41 | 8,365.38 | 5.43 |
| LightMem | 38.44 | 34.36 | 877,086 | 569.54 | 788.76 | 0.51 |
| GAM | 53.75 | 47.51 | 28,570,674 | 18,552.39 | 9,237.25 | 6.00 |
| Zero-Mem(本文方法) | 59.15 | 52.96 | 0 | 0 | 334.77 | 0.22 |
| 相对增益/降幅 | 10.0% | 11.5% | 100.0% | 100.0% | 57.6% | 57.6% |
实验
实验设置
数据集。
我们在两个互补的基准上评估 Zero-Mem。1)LoCoMo(Maharana 等,2024)是一个广泛采用的基准,用于评估对话智能体在跨越多轮、多会话交互中的长期记忆能力。遵循先前工作(Yan 等,2025),我们评估其单跳、多跳、时间推理和开放域任务。2)HotpotQA(Yang 等,2018)是一个基于 Wikipedia 的多跳问答基准。遵循 MemAgent(Yu 等,2026),我们采用其整理的记忆评估变体,该变体将黄金支持文档与干扰段落相结合。改变干扰项数量可产生 56K、224K 和 448K token 三种上下文长度设置。
基线方法。
我们将对比方法分为两组。1)无记忆基线包括LONG-LLM和RAG。LONG-LLM使用滑动窗口将交互历史划分为多个文本块,独立处理每个块,并返回置信度最高的候选答案。RAG将历史划分为2,048个token的块,并通过语义相似性检索前五个块作为答案生成的支撑上下文。2)基于记忆的基线包括A-Mem(Xu等人,2025)、Mem0(Chhikara等人,2025)、MemoryOS(Kang等人,2025)、LightMem(Fang等人,2026)、SimpleMem(Liu等人,2026)、CompassMem(Hu等人,2026a)和GAM(Yan等人,2025)。这些方法在历史信息上维护专门的记忆结构,并在推理期间访问这些结构以支持基于记忆的任务。其他基线描述见附录。
实现细节。
我们使用GPT-4o-mini和Qwen2.5-14B-Instruct作为Zero-Mem及所有基线的主干大语言模型,分别代表闭源和开源设置。在每种设置中,所有方法使用相同的最终问答读取器和等效的上下文预算,因此对比可以隔离其记忆管道的差异。阻尼因子和双视角路由系数均设置为0.6。所有实验在配备NVIDIA RTX 4090 GPU的通用硬件环境中执行。为进行受控对比,我们将每种方法的检索项数量上限设为五个。我们遵循先前工作中建立的评估指标和协议(Yan等人,2025;Liu等人,2026)。
| 方法 | GPT-4o-mini | Qwen2.5-14B | ||||
|---|---|---|---|---|---|---|
| 56K | 224K | 448K | 56K | 224K | 448K | |
| LONG-LLM | 56.56 | 54.29 | 53.92 | 49.75 | 46.82 | 43.17 |
| RAG | 52.71 | 51.84 | 54.01 | 51.81 | 46.72 | 48.36 |
| A-Mem | 33.90 | 30.22 | 31.37 | 27.04 | 25.65 | 22.92 |
| Mem0 | 32.58 | 31.74 | 27.41 | 30.12 | 32.44 | 26.55 |
| MemoryOS | 26.47 | 23.10 | 24.16 | 24.58 | 30.25 | 23.13 |
| LightMem | 40.93 | 35.28 | 30.02 | 37.30 | 27.72 | 28.25 |
| GAM | 63.22 | 64.56 | 59.81 | 64.07 | 55.99 | 57.87 |
| Zero-Mem | 72.07 | 66.43 | 65.04 | 68.58 | 65.47 | 61.02 |
主要结果
LoCoMo。
表1报告了在LoCoMo上的结果,该基准评估多会话对话中的记忆能力,并强调对实体特定信息、时间信息和跨会话信息的恢复。Zero-Mem在两种LLM阅读器下均取得了最佳的平均F1和BLEU-1分数。相对于整体最强的基线GAM,Zero-Mem在使用GPT-4o-mini时将平均F1和BLEU-1分别提升了5.40和5.45个百分点,在使用Qwen2.5-14B时分别提升了4.87和4.86个百分点。在使用GPT-4o-mini时,Zero-Mem在单跳、时间和开放域问题上领先,而在多跳问题上与GAM保持竞争力。在使用Qwen2.5-14B时,Zero-Mem在每种问题类型和指标上均排名第一。与LONG-LLM和RAG相比,Zero-Mem在时间和开放域问题上的显著优势表明,仅靠长上下文访问或平面相似性检索不足以实现对状态和边界敏感的回忆。这种在不同LLM阅读器和记忆需求下的一致性表明,Zero-Mem能够恢复相关的对话证据,同时保留其关系和时间上下文,尽管其记忆操作不需要任何LLM调用或token。
HotpotQA。
表3报告了HotpotQA在上下文长度从56K token增加到448K token时的结果。通过逐步添加干扰段落,该基准测试方法在越来越长的上下文中定位并连接分散支持证据的能力。Zero-Mem在所有阅读器和上下文长度下均取得了最高的F1分数,包括具有挑战性的448K token设置,相对于最强基线平均提升了5.52个百分点。综合LoCoMo和HotpotQA的结果表明,Zero-Mem对于长期对话记忆和长上下文多跳检索均有效,展示了其在零token记忆操作下结构化证据选择框架的通用性。
效率对比
表2评估了降低内存操作开销是否以牺牲回答质量为代价。我们将Zero-Mem与主实验中表现最强的基线GAM,以及SimpleMem和LightMem这两个具有代表性的面向效率的内存系统进行了比较。所有方法均在相同的并发设置和硬件环境下使用GPT-4o-mini进行评估。我们报告了回答质量,以及共享最终问答阶段之外内存操作所产生的总开销和每次查询开销。Zero-Mem取得了最高的F1和BLEU-1分数,在这两项指标上分别比排名第二的GAM提升了10.0%和11.5%。因此,消除基于LLM的内存操作并不会损害回答质量。在开销方面,Zero-Mem在内存处理过程中不调用任何LLM,因此消耗的LLM输入或输出token为零,而即使是最节省token的基线LightMem,也消耗了超过87万个token。零token操作并不意味着零计算,因为编码器推理、内存组织、检索和确定性校准仍会产生处理成本。尽管如此,Zero-Mem总共仅需334.77秒,每次查询仅需0.22秒,相比最快的基线LightMem,内存操作延迟降低了57.6%。这一结果表明,移除生成式内存调用并未将成本转移到更慢的非生成式流水线上。在统一设置下,Zero-Mem在回答质量上优于所有对比基线,同时实现了最低的内存操作token和开销。这些结果表明,其效率提升并非以牺牲回答质量为代价。
消融研究
图3报告了在HotpotQA上使用56K-token上下文和GPT-4o-mini进行的消融实验结果。我们将完整模型与单视图变体以及移除证据闭合或校准的变体进行了比较,同时保持所有其他设置不变。完整模型达到了72.07的F1分数和69.66的BLEU-1分数。仅保留图视图将分数降至62.50和59.90,而仅保留层级视图则得到54.88和51.40。仅图视图表现更强,这与HotpotQA强调关系推理和跨文档推理的特点一致。然而,两种变体仍远低于完整模型,这表明这两种结构提供了互补的证据:图连接了分布在多个文档中的信息,而层级结构则保留了解释这些连接所需的局部和多粒度上下文。移除证据闭合导致F1降至67.90、BLEU-1降至65.43,而移除证据校准则得到70.13和66.45。这些一致的下降支持了它们在完善和优化双视图检索返回证据方面的作用。总体而言,结果证明了结合图检索和层级检索的重要性,而证据闭合和证据校准则为进一步支持检索到的证据提供了保障。
检索预算的影响
图4考察了Zero-Mem对检索预算的敏感性,检索预算定义为证据闭包之前保留的最大主要候选数量。从1增加到5,平均F1和BLEU-1分数分别从52.59和46.79显著提升至59.15和52.96。性能在时达到整体最高水平,而更大的预算仅产生微小波动,表明额外证据的边际收益递减。各任务的结果表现出不同的饱和点:单跳问题需要相对较少的候选,而多跳、时间性和开放域问题通常受益于更广泛的证据覆盖。总体而言,Zero-Mem在适中的检索预算下保持稳定。我们在主要实验中使用以匹配所有基线的检索设置;该配置仅落后0.65 F1和0.83 BLEU-1,同时保留的主要候选数量减半。
结论
我们引入了Zero-Mem,并形式化了零token记忆操作,这是一种操作机制,其中最终问答之外的每个操作都不调用LLM,也不消耗任何LLM输入或输出token。Zero-Mem保留原始交互轨迹,并通过互补的关系性和时间排序视图检索证据,而无需生成中间记忆表示。综合实验表明,在长期对话记忆和长上下文多跳推理方面均具有竞争力的性能。消融实验进一步证实了两种证据视图的互补性。在相同的最终问答阅读器和等效上下文预算下,Zero-Mem消除了记忆操作的token消耗,并将延迟相对于最高效的基线降低了57.6%。这些结果表明,有效的智能体记忆不需要生成的中间表示,并确立了保留来源的证据选择作为生成式记忆管道的实用替代方案。
参考文献
- P. Anokhin、N. Semenov、A. Sorokin、D. Evseev、A. Kravchenko、M. Burtsev 和 E. Burnaev(2025)《AriGraph:利用情景记忆为 LLM 智能体学习知识图谱世界模型》。载于《第三十四届国际人工智能联合会议论文集》,IJCAI '25。外部链接:ISBN 978-1-956792-06-5,链接,文献。被引用:引言。
- P. Chhikara、D. Khant、S. Aryan、T. Singh 和 D. Yadav(2025)《Mem0:构建具备可扩展长期记忆的生产级 AI 智能体》。外部链接:2504.19413,链接。被引用:相关工作、基线。
- S. Du、J. Zhao、J. Shi、Z. Xie、X. Jiang、Y. Bai 和 L. He(2026)《基于大语言模型的智能体优化综述》。ACM 计算机调查,58(9)。外部链接:ISSN 0360-0300,链接,文献。被引用:引言。
- J. Fang、X. Deng、H. Xu、Z. Jiang、Y. Tang、Z. Xu、S. Deng、Y. Yao、M. Wang、S. Qiao、H. Chen 和 N. Zhang(2026)《LightMem:轻量高效的记忆增强生成》。载于《第十四届国际学习表征会议》。外部链接:链接。被引用:引言、相关工作、基线。
- B. J. Gutierrez、Y. Shu、Y. Gu、M. Yasunaga 和 Y. Su(2024)《HippoRAG:受神经生物学启发的 LLM 长期记忆》。载于《第三十八届神经信息处理系统年会》。外部链接:链接。被引用:引言。
- Y. Hu、J. Liu、J. Tan、Y. Zhu 和 Z. Dou(2026a)《记忆更重要:以事件为中心的智能体搜索与推理逻辑图谱》。外部链接:2601.04726,链接。被引用:相关工作、基线。
- Y. Hu、S. Liu、Y. Yue、G. Zhang、B. Liu、F. Zhu、J. Lin、H. Guo、S. Dou、Z. Xi、S. Jin、J. Tan、Y. Yin、J. Liu、Z. Zhang、Z. Sun、Y. Zhu、H. Sun、B. Peng、Z. Cheng、X. Fan、J. Guo、X. Yu、Z. Zhou、Z. Hu、J. Huo、J. Wang、Y. Niu、Y. Wang、Z. Yin、X. Hu、Y. Liao、Q. Li、K. Wang、W. Zhou、Y. Liu、D. Cheng、Q. Zhang、T. Gui、S. Pan、Y. Zhang、P. Torr、Z. Dou、J. Wen、X. Huang、Y. Jiang 和 S. Yan(2026b)《AI 智能体时代的记忆》。外部链接:2512.13564,链接。被引用:引言。
- J. Kang、M. Ji、Z. Zhao 和 T. Bai(2025)《AI 智能体的记忆操作系统》。收录于《2025 年自然语言处理实证方法会议论文集》,C. Christodoulopoulos、T. Chakraborty、C. Rose 和 V. Peng 主编,中国苏州,第 25961–25970 页。外部链接:Link、Document,ISBN 979-8-89176-332-6。被引用:相关工作、基线方法。
- J. Liu、Y. Su、P. Xia、S. Han、Z. Zheng、C. Xie、M. Ding 和 H. Yao(2026)《SimpleMem:面向 LLM 智能体的高效终身记忆》。收录于《第四十三届国际机器学习大会》,外部链接:Link。被引用:引言、相关工作、基线方法、实现细节。
- J. Luo、W. Zhang、Y. Yuan、Y. Zhao、J. Yang、Y. Gu、B. Wu、B. Chen、Z. Qiao、Q. Long、R. Tu、X. Luo、W. Ju、Z. Xiao、Y. Wang、M. Xiao、C. Liu、J. Yuan、S. Zhang、Y. Jin、F. Zhang、X. Wu、H. Zhao、D. Tao、P. S. Yu 和 M. Zhang(2025)《大语言模型智能体:方法、应用与挑战综述》。外部链接:2503.21460、Link。被引用:引言。
- A. Maharana、D. Lee、S. Tulyakov、M. Bansal、F. Barbieri 和 Y. Fang(2024)《评估 LLM 智能体的超长期对话记忆》。收录于《第 62 届计算语言学协会年会论文集(第 1 卷:长文)》,L. Ku、A. Martins 和 V. Srikumar 主编,泰国曼谷,第 13851–13870 页。外部链接:Link、Document。被引用:数据集。
- J. S. Park、J. O’Brien、C. J. Cai、M. R. Morris、P. Liang 和 M. S. Bernstein(2023)《生成式智能体:人类行为的交互式模拟》。收录于《第 36 届 ACM 用户界面软件与技术年度研讨会论文集》,UIST ’23,美国纽约州纽约市。外部链接:ISBN 9798400701320、Link、Document。被引用:相关工作。
- P. Rasmussen、P. Paliychuk、T. Beauvais、J. Ryan 和 D. Chalef(2025)《Zep:面向智能体记忆的时序知识图谱架构》。外部链接:2501.13956、Link。被引用:相关工作。
- R. Salama、J. Cai、M. Yuan、A. Currey、M. Sunkara、Y. Zhang 和 Y. Benajiba(2025)《MemInsight:面向 LLM 智能体的自主记忆增强》。载于《2025 年自然语言处理经验方法会议论文集》,C. Christodoulopoulos、T. Chakraborty、C. Rose 和 V. Peng 主编,中国苏州,第 33136–33152 页。外部链接:Link、Document,ISBN 979-8-89176-332-6。引用位置:引言。
- T. Schick、J. Dwivedi-Yu、R. Dessi、R. Raileanu、M. Lomeli、E. Hambro、L. Zettlemoyer、N. Cancedda 和 T. Scialom(2023)《Toolformer:语言模型可以自学使用工具》。载于《第三十七届神经信息处理系统会议》,外部链接:Link。引用位置:相关工作。
- N. Shinn、F. Cassano、A. Gopinath、K. Narasimhan 和 S. Yao(2023)《Reflexion:具备语言强化学习的语言智能体》。载于《第三十七届国际神经信息处理系统会议论文集》,NIPS '23,美国纽约州红钩。引用位置:相关工作。
- H. Sun、S. Zeng 和 B. Zhang(2026)《H-MEM:面向 LLM 智能体高效长期推理的分层记忆》。载于《第十九届欧洲计算语言学协会会议论文集(第一卷:长文)》,V. Demberg、K. Inui 和 L. Marquez 主编,摩洛哥拉巴特,第 341–350 页。外部链接:Link、Document,ISBN 979-8-89176-380-7。引用位置:引言。
- G. Wang、Y. Xie、Y. Jiang、A. Mandlekar、C. Xiao、Y. Zhu、L. Fan 和 A. Anandkumar(2024)《Voyager:基于大语言模型的开放式具身智能体》。《机器学习研究汇刊》。注:外部链接:ISSN 2835-8856,Link。引用位置:相关工作。
- Y. Wu、S. Liang、C. Zhang、Y. Wang、Y. Zhang、H. Guo、R. Tang 和 Y. Liu(2025)《从人类记忆到 AI 记忆:LLM 时代记忆机制综述》。外部链接:2504.15965,Link。引用位置:引言。
- Z. Xi、Y. Ding、W. Chen、B. Hong、H. Guo、J. Wang、X. Guo、D. Yang、C. Liao、W. He、S. Gao、L. Chen、R. Zheng、Y. Zou、T. Gui、Q. Zhang、X. Qiu、X. Huang、Z. Wu 和 Y. Jiang(2025)《AgentGym:在多样化环境中评估和训练基于大语言模型的智能体》。收录于第 63 届计算语言学协会年会论文集(第 1 卷:长文),W. Che、J. Nabende、E. Shutova 和 M. T. Pilehvar 主编,奥地利维也纳,第 27914–27961 页。外部链接:Link、Document,ISBN 979-8-89176-251-0。引用位置:引言。
- J. Xu、A. Szlam 和 J. Weston(2022)《超越金鱼记忆:长期开放域对话》。收录于第 60 届计算语言学协会年会论文集(第 1 卷:长文),S. Muresan、P. Nakov 和 A. Villavicencio 主编,爱尔兰都柏林,第 5180–5197 页。外部链接:Link、Document。引用位置:引言。
- W. Xu、Z. Liang、K. Mei、H. Gao、J. Tan 和 Y. Zhang(2025)《A-mem:面向 LLM 智能体的智能体记忆》。收录于第三十九届神经信息处理系统年会,外部链接:Link。引用位置:相关工作、基线。
- B. Y. Yan、C. Li、H. Qian、S. Lu 和 Z. Liu(2025)《通过深度研究实现通用智能体记忆》。外部链接:2511.18423、Link。引用位置:引言、相关工作、数据集、基线、实现细节。
- C. Yang、C. Zhou、Y. Xiao、S. Dong、L. Zhuang、Y. Zhang、Z. Wang、Z. Hong、Z. Yuan、Z. Xiang、S. Chen、H. Zhou、Q. Zhang、N. Liu、J. Su、X. Wang、Y. Chang 和 X. Huang(2026)《基于图的智能体记忆:分类体系、技术与应用》。外部链接:2602.05665、Link。引用位置:引言。
- Z. Yang、P. Qi、S. Zhang、Y. Bengio、W. Cohen、R. Salakhutdinov 和 C. D. Manning(2018)《HotpotQA:面向多样化、可解释多跳问答的数据集》。收录于 2018 年自然语言处理经验方法会议论文集,E. Riloff、D. Chiang、J. Hockenmaier 和 J. Tsujii 主编,比利时布鲁塞尔,第 2369–2380 页。外部链接:Link、Document。引用位置:数据集。
- S. Yao、J. Zhao、D. Yu、N. Du、I. Shafran、K. R. Narasimhan 和 Y. Cao(2023)《ReAct:在语言模型中协同推理与行动》。收录于第十一届国际学习表征会议,外部链接:Link,被引用:相关工作。
- H. Yu、T. Chen、J. Feng、J. Chen、W. Dai、Q. Yu、Y. Zhang、W. Ma、J. Liu、M. Wang 和 H. Zhou(2026)《MemAgent:基于多轮强化学习的记忆智能体重塑长上下文大语言模型》。收录于第十四届国际学习表征会议,外部链接:Link,被引用:数据集。
- G. Zhang、M. Fu、K. Wang、G. Wan、M. Yu 和 S. YAN(2025a)《G-memory:为多智能体系统追踪分层记忆》。收录于第三十九届神经信息处理系统年度会议,外部链接:Link,被引用:引言。
- Z. Zhang、Q. Dai、X. Bo、C. Ma、R. Li、X. Chen、J. Zhu、Z. Dong 和 J. Wen(2025b)《基于大语言模型的智能体记忆机制综述》。ACM 信息系统汇刊,第 43 卷第 6 期。外部链接:ISSN 1046-8188、Link、Document,被引用:引言。
- W. Zhong、L. Guo、Q. Gao、H. Ye 和 Y. Wang(2024)《MemoryBank:以长期记忆增强大语言模型》。收录于第三十八届 AAAI 人工智能会议暨第三十六届人工智能创新应用会议暨第十四届人工智能教育进展研讨会论文集,AAAI‘24/IAAI’24/EAAI‘24。外部链接:ISBN 978-1-57735-887-9、Link、Document,被引用:引言。