摘要
生产级 AI 智能体的失败,往往不是因为推理能力不足,更多是因为无法管理好自身推理上下文中的内容;它们必须在上下文中承载大量信息:对话历史、冗长的提示词、庞大的工具定义以及不断膨胀的工具输出。它们在自己不断累积的历史中挣扎,同时还要为每轮对话不断增长的 token 成本买单,结果导致在同一对话内以及跨对话之间出现记忆遗漏。现有的应对方案将其视为一个存储与检索问题。我们认为这种框架过于狭隘。我们提出,主动管理智能体所“记住”的内容是一个生命周期,而不仅仅是存储:它涵盖决定记住什么、提取并结构化信息、为不同数据类型选择恰当的存储方式、构建最优冗余、有意识地整合、遗忘过时信息同时保留溯源、判断当前轮次需要什么、预测下一步所需内容,以及在预算内压缩上下文而不丢失关键信息、不牺牲召回率等。在严肃的生产级智能体中,这一过程不仅作用于单个用户,还跨越组织层级范围。我们倾向于将这一学科命名为“智能体上下文管理”(Agentic Context Management,ACM)(过去也有其他人使用此名称),并将其分解为五个基本要素:架构设计、信息摄取、范围界定、预测预判、压缩与整合。接着,我们从经济角度论证为何管理型生命周期并非奢侈之举:朴素的上下文累积会导致 token 成本随对话长度呈二次方增长;粗放的摘要虽能实现线性成本,却以准确率断崖式下降为代价;只有经过验证的压缩才能在保持保真度的同时实现线性成本。我们描述了一个参考实现——Maximem Synap,它将这五个基本要素实现为多租户服务,并在第 6 节详述的配置下,在 LongMemEval 上达到 92%,在 LoCoMo 上达到 93.2%。最后,我们探讨了现有基准尚未覆盖的维度,即延迟、token 效率与上下文抗衰性,以及该方向指向的决策级和组织级上下文这一开放前沿;这些维度将继续决定智能体在严肃场景中效用的稳定性与可用性。
1 引言
过去两年间,大语言模型从聊天界面演变为智能体——即能够执行操作、调用工具、并在多轮对话与多会话中完成任务的一类系统。多份行业调查均指出,生产部署这一环节极为困难。截至2025年,大多数企业正在尝试使用AI智能体,但其中仅有约四分之一报告称已实现规模化,而将智能体扩展至任何单一业务职能的企业甚至不足10%。事实上,绝大多数智能体试点项目从未真正进入生产阶段(麦肯锡,2025)。制约这一规模化进程的最显著能力短板并非推理——因为前沿模型的推理能力已相当出色。它们真正缺乏的,是对每一步上下文窗口中应包含哪些内容进行严格管理。缺乏这种管理,已部署的智能体就会部分或完全遗忘用户在长对话早期告知的信息、在同一对话中从工具获取的数据、或上周提及的内容;在多智能体交接时自相矛盾;因上下文被塞满至超出有效范围而产生模型幻觉;并且每多一轮交互,成本就进一步攀升。
当前对这个问题的定义框架是“记忆”。围绕它已经形成了一个健康的记忆工具生态系统。我们认为,正是这个框架本身限制了这些系统。“记忆”指的是一个存储库,即一个存放事实并能取回它们的地方。围绕存储库构建的系统会优化两个确切的时刻,即写入和读取。但让我们考虑一下,一个生产级智能体平台必须逐轮次决定哪些事情:(a) 刚才所说的内容中,哪些值得保留;(b) 这些内容应以何种结构保留;(c) 在所有保留的内容中,哪一小部分属于本轮次的上下文;(d) 下一轮次可能需要什么;(e) 当相关上下文超出模型能有效使用的预算时,应该怎么办。这是在五个不同时刻做出的五个不同决策,而一个存储库一个也做不了。存储只是生命周期中的一个时刻,而非全部。一个可用的平台必须做出这全部五个决策,同时还要防止一个用户的上下文泄露给另一个用户,并遵守组织边界。
本文提出了四项贡献,旨在解决这些问题:
重新定义与分类:我们定义了智能体上下文管理,并将其分解为五个基本要素或概念:架构设计、摄取、范围界定、预判、压缩与整合;这些要素在从单个用户到组织的范围层级中运作(第2节)。
一个经济学论点:我们指出并证明,受管理的生命周期是必要的,而不仅仅是锦上添花。在对话过程中,完全追加的上下文会消耗大量模型 token。粗略的摘要则以准确性下降为代价来换取这一点。相反,经过验证且智能的压缩能够在保持保真度的同时,达到线性成本的高效边界(第3节)。我们通过一项跨越五个数据领域的检索原创研究,来支持该论点的检索方面。
参考实现:我们描述了 Maximem Synap,这是一个多租户服务,它在架构层面以及可观察行为层面都整合了这五个基本要素(第4-5节)。
证据与议程:我们报告了两个公开记忆基准测试的结果及其局限性(第 6 节),并阐述了决策级和组织级上下文管理的前沿方向(第 8 节)。
Maximem 的 Synap 产品在本文中作为该类别的参考实现出现。然而,论证的核心在于该类别本身。读完本引言部分后,若能以生命周期视角理解上下文管理,便已把握了要点。参考实现只是构建此类生命周期系统的一种方式。
2 从记忆到上下文管理
我们将智能体上下文管理定义为:决定智能体应在上下文中保留什么、何时保留、保留多久、以及以何种成本保留,涵盖从上下文获取到上下文退役的完整生命周期。它包含五个基本要素。
架构设计:在存储任何一条记忆之前,必须先决定给定智能体的记忆形态:哪些类别的信息是重要的、应如何提取、存储于何处、保留多久、以及如何检索和压缩。大多数系统通过固定的通用模式来回答这些问题。我们认为,架构本身是构建上下文管理系统的第一类基本要素。
数据摄入:原始信号,如对话轮次、多模态文档上传、工具调用及其响应,必须转化为结构化、可检索的记忆。先前工作已充分确立、并在实践中得到验证的关键观察是:检索质量受限于数据摄入质量。例如,一个存储了“用户提到了某个定价方案”的系统,永远无法在后续检索出“用户于 4 月 3 日从 Starter 升级到了 Pro”。
范围界定:在数据摄入和检索两个阶段,系统都必须判断其已知信息中哪些部分与未来相关,以及相关范围有多大。这是一个跨组织层级(定义见下文)的分层决策过程,且各层级严格隔离,确保一个用户的上下文绝不会出现在另一个用户的会话中,而同一组织内的信息则不断丰富,从而在 B2B 智能体环境中为所有用户创造由网络效应驱动的正向高效体验;但前提是,暴露给智能体的数据性质允许这种行为。
预判:智能体不知道自己不知道什么。如果智能体从不主动请求某类信息,它就不太可能检索到这些信息。推测性预取是计算机系统中一个由来已久的概念。我们将其应用到了智能体上下文中。这使得上下文管理系统能够原则上观察智能体的行为,并在显式请求到来之前准备好它可能需要的上下文,从而将检索过程移出关键路径。我们将预判视为一种与检索不同的基础操作:检索回答的是“什么与当前搜索查询或时刻相关”,而预判性检索回答的是“接下来什么会相关”。它还能帮助智能体获取那些它不知道自己需要知道的问题的答案,从而更准确地满足用户需求。
压缩与整合:当相关上下文超出下游模型能够有效利用的预算时,系统必须对其进行缩减,同时不能丢弃将来需要的信息。关键在于,压缩过程必须是可验证的:一个静默丢弃关键事实的压缩,比不做压缩更糟糕,因为它会产生自信的错误答案。我们提出,可验证、无损且带有明确倾向性的压缩在大规模生产环境中是可行且有价值的。
这五个基础操作是相互耦合的:第一个操作所选择的架构会改变其他操作应执行的内容(一个客服智能体与一个编程智能体需要不同的分类、保留策略和压缩方式)。这种耦合关系正是将上下文作为一个系统来管理,而非组装五个独立工具的核心论据。
作用域维度:每个原语不仅作用于单个用户,还作用于一个作用域层级结构。在本文中,我们使用三个术语来描述这个层级结构,从最窄到最广:用户(与智能体交互的个体人或智能体/子智能体)、客户(该用户所属的组织)以及平台运营方(智能体平台的运营者,其部署跨越多个客户组织)。数据摄取与检索都应遵循最窄优先的原则来解析此层级,即先用户,再客户,最后是平台运营方;并且要严格隔离。此外,应存在一个独立的全局知识层,用于共享通用知识(例如,公共实体的规范身份标识)。大多数记忆工具的作用域仅限于用户;将组织结构扁平化地归入单一存储桶,要么会丢失组织上下文,要么会将一个用户的数据泄露到另一个用户的会话中。将作用域视为一个一等维度:原语的作用域——正是让上下文管理能够服务于组织而不仅仅是个人。
我们提出,一个能良好处理单个原语的系统是记忆工具。一个能跨作用域、连贯地处理全部五个原语的系统,则是上下文管理平台。
该分类法基于观察到的实际故障:每个原语之所以有其存在的必要,是因为缺少它会导致一个已命名且被观察到的生产环境故障模式;其中一些记录在我们自己的部署笔记中(Maximem, 2026a),另一些则记录在已发表的文献中。表 1 明确了这种映射关系;第 3 节量化了主导成本和准确性的两种故障模式。
| 观察到的故障 | 在生产环境中的表现 | 缺失的原语 | 证据 |
|---|---|---|---|
| 垃圾信息累积 | 低价值或重复的条目不断累积,挤占了有用的记忆空间。对某个流行记忆库的审计发现,在32天内存储了10,134条记录,其中仅有38条可用,垃圾率高达99.6%(包括启动文件重复声明、定时任务噪音、配置转储)。 | 架构设计 + 数据摄入(先存储,后提取) | Maximem (2026a) |
| 细节丢失 | 提取过程只保留了一个模糊的转述,导致具体事实永远无法被检索到。当用户实际说过“用户于4月3日从Starter升级到Pro”时,系统却存储了“用户提到了一个计划”;没有任何检索方法能恢复被提取过程丢弃的细节。 | 数据摄入 | Maximem (2026a);第3.3节 |
| 身份碎片化 | 同一个真实实体被存储在多个互不关联的名称下,导致其历史记录被分割。“Sarah”、“Sarah Chen”和“SC”被存储为三个无关的字符串;检索时返回的是与查询嵌入向量匹配的那个,从而产生不完整或矛盾的答案。 | 数据摄入(实体解析) | Maximem (2026a) |
| 作用域泄漏 | 某个作用域的记忆出现在本应与之隔离的另一个作用域中。一个用户的偏好出现在另一个用户的会话中;或者智能体完全丢失了组织上下文。 | 作用域界定 | Maximem (2026a) |
| 跨会话遗忘(表现为交接重复) | 早期会话中的知识未被延续,因此必须重新建立。用户不得不向每个新会话或每个子智能体重复自己的信息。 | 作用域界定(缺少生命周期管理) | Maximem (2026a) |
| 检索处于关键路径上 | 在模型能够响应之前,每一轮交互都阻塞于一次同步检索的往返过程。每一轮交互都因检索往返而停滞。 | 预取 | 第5节 |
| 准确率悬崖 | 未经验证的压缩丢弃了后续所需的信息,导致准确率骤降。在一次未经验证的压缩步骤中,18,282个模型 token 被压缩至122个;准确率从66.7%降至57.1%,低于无上下文基线。 | 压缩与整合(缺少验证) | Zhang 等人 (2025) |
| 二次方成本增长 | 重新发送未经管理的、不断增长的上下文,导致模型 token 成本呈二次方增长。每次对话的模型 token 成本随其长度的平方增长。 | 压缩与整合 | 第3.1节 |
3 为什么“存储-检索”模式还不够
第2节中的重新框架是概念性的。本节将其量化,因为采用受管理生命周期的理由归根结底是经济层面和信息层面的,而这两者都是可衡量的。
3.1 不作为的成本呈二次方增长
考虑一个多轮智能体对话。假设每轮对话增加约 tokens(用户消息加助手回复),且对话持续 轮。在朴素的“全追加”模式(每轮重新发送整个历史记录,这是大多数手写智能体的做法)下,第 轮的输入上下文是到目前为止的整个历史记录,大约为 tokens。因此,整个对话过程中的累计输入 tokens 为
由于服务提供商按输入 token 计费,成本随对话长度呈二次方增长。(每次调用的注意力计算更糟糕,每轮与序列长度呈二次方关系,但计费结果更容易推理。)如果系统每轮将上下文控制在固定预算内,则累计 tokens 为 。两者的比率
随 线性增长:对话越长,全追加模式的惩罚就越严重。以示例值(, )计算,在 100 轮时倍数约为 ,在 200 轮时约为 ;完整推导和敏感性表见附录 A。
3.2 但简单地限制上下文会破坏准确性
限制预算是有必要的;但限制方式决定了能否保持准确性。粗粒度的摘要总结限制了 tokens,但会有信息丢失且未经验证,这种丢失可能是灾难性的:先前的研究记录了一个案例,其中将 18,282 个 token 的上下文单步压缩至 122 个 token,导致任务准确率从 66.7% 降至 57.1%,比完全不提供上下文还要差(Zhang 等人,2025)。摘要器丢弃了重要的信息,因为它无法知道下游需要什么。
这产生了三方对比:
| 方法 | Token 成本 | 保真度 | 失败模式 |
|---|---|---|---|
| 全追加 | 完整,直至上下文失效 | 成本激增;长上下文性能下降(“中间迷失”,Liu 等人,2024) | |
| 粗粒度摘要 | 有损、未经验证 | 准确率断崖式下跌 | |
| 经验证的压缩 | 保留 + 校验 | 无(目标状态) |
论点现已清晰。上下文管理系统应位于左上角,即线性成本与验证性保真度并存,而要实现这一点,必须将压缩视为一种经过验证的操作,而非一厢情愿的尝试。
3.3 检索不等于充分性
成本只是故事的一半。另一半在于检索到的上下文是否足以支撑推理。检索质量本身便是一连串瓶颈:
提取——这是数据摄入阶段的步骤,将原始信号转化为存储的结构化记忆。检索——这是查询阶段的步骤,将这些记忆取回。每一步都限制了最终答案的质量。如果存储的是垃圾信息,提取环节便成为瓶颈。表 1 中的垃圾率审计是一个极端案例:对未提取信号进行忠实存储,导致存储库实际上无法使用。检索到错误材料,检索环节便成为瓶颈;检索到部分相关材料,但缺少推理出可证明答案所需的全部上下文,则推理充分性成为瓶颈(Dadhich, 2026a)。最后一点最容易被忽视:大多数基准测试衡量的是检索命中率(相关文档是否出现?),几乎没有任何测试衡量推理所需的一切是否都已出现,更不用说检索到了多少无关项。
我们出于纯粹的好奇心,开展了一项激励性研究,考察了五个领域的检索效果:代码(CodeXGLUE)、网页(MS MARCO)、事实(SQuAD)、多跳推理(HotpotQA)和科学(SciQ)。每个语料库包含一万份文档,每个语料库有一千条查询,评分指标为 MRR@10(Dadhich, 2026a;数据和每个数据集的结果见 maximem-ai/file-vs-vector-study-results)。首先说明其局限性:(a) 单一操作者,一个关键词引擎对比一个向量存储;(b) 未进行分块;(c) 每个语料库规模较小。我们将其作为动机呈现,而非受控基准测试(完整方法和注意事项见附录 B)。但有两个发现与此相关。(a) 向量检索和关键词检索在不同场景下各有优势,且差距并不小。向量搜索在语义鸿沟最大时占据主导地位(自然语言到代码:MRR 0.91 对比 0.29,例如查询“排序一个列表”找到了 bubble_sort),而关键词搜索在查询词是特定实体而非模糊语义时胜出(科学问答:MRR 0.81 对比 0.61,“线粒体”是一个关键词,而非相似概念),事实性问答两者持平,多跳推理略偏向关键词(表 B1)。该研究还量化了向量代价:对同一万份文档语料库建立索引,使用嵌入向量生成所需的时间比关键词索引长 60 到 100 倍(表 B2),当智能体必须立即读取新材料并立即对其采取行动时,这是一个实际限制。
然而,更深层的发现是这项研究在设计上无法衡量的内容。与大多数检索评估一样,当单个标准文档出现在顶部结果中时,它就会计为命中——例如在 HotpotQA 上,它针对每个问题的一个支撑文档进行评分,尽管多跳问题需要两个或更多文档。以这种方式构建的评估无法检测出对智能体而言最重要的失败模式,即检索到了相关文档,却遗漏了完成推理链所需的桥梁文档。这也是我们在检查输出时定性观察到的效果,但由于采用单目标评分而无法量化,因此我们将其作为观察结果而非研究结论进行报告。这就是最纯粹形式的推理充分性差距:检索命中处处可测,而推理充分性几乎无处可量。我们得出的结论是,检索必须结合词汇信号和语义信号:即关键词搜索与向量搜索的混合方案,因为两者互为盲区。在构建 Maximem 的 Vity(一个跨应用的个人 AI 记忆库)的实验中,我们了解到纯向量实现有其自身局限性,需要与图结构结合使用,以便在查询中保留关系信息并管理来源追溯。因此,图结构也被加入了混合方案。但仅靠这种混合方法是不够的,它只是必要条件。要弥合充分性差距,还需要结构化摄入和范围感知组装——这就是为什么本文的其余部分将检索视为受管理生命周期中的一个原语,而非独立组件,也是为什么第 6.3 节认为该领域需要能够直接评估充分性的评测方法。
3.4 生命周期必须提供什么
这两个论点得出了相同的结论。缩小成本差距需要经过验证的压缩;缩小充分性差距则需要保留结构的摄取、组装足够上下文的范围界定,以及结合语义和关系信号的检索。没有任何单一的检索方法能够实现这一点,但一个受管理的、专门设计的生命周期可以。下一节将描述这样一个系统。
4 最大化记忆协同系统
最大化记忆协同是一个多租户、托管的上下文管理服务。在本节中,我们通过组件的功能及其原因来描述它们:它们的接口、可观察行为和保证,并且刻意不描述它们内部的工作方式;其机制内部是专有的。这一句话涵盖了整个章节;我们不会对单个组件进行注释。
客户端界面:最大化记忆协同暴露了一个异步优先的 SDK(Python 为标准;一个 JavaScript 桥接器),其内存写入调用会立即返回一个摄取标识符,并且从不阻塞调用应用程序;处理过程异步进行。该 SDK 提供了一个统一的、具有范围感知能力的检索调用、一个对话压缩调用,以及一个流式传输通道。租户隔离在存储层(按租户命名空间)和查询层(范围谓词)都得到强制执行,其身份源自存储的凭证,而非由客户端断言。
架构设计(按智能体进行内存设计):当一个智能体被连接时,最大化记忆协同会根据客户对该智能体用途的描述以及提供给它的任何参考材料,为该智能体生成一个定制化的内存架构,选择要捕获哪些内存类别,以及如何提取、存储、检索和压缩它们,然后激活该架构。这是一个自主的、由大语言模型推理驱动的设计步骤,并伴有多智能体检查和验证,而非从固定菜单中进行选择;由此产生的架构将支配每个下游原语的行为。
数据摄入:数据摄入是一个异步、基于队列的多阶段流水线。它接收一份文档,立即返回一个摄入 ID,并在后台对内容进行资格审核,提取记忆类别:事实、偏好、情节、情绪、时间事件,以及根据系统在该实例中所支持的智能体性质提取更多类别;同时提取实体、关系和时间有效性,然后解析实体,并将结果持久化到关系型、图结构和向量存储中。提取决策由设置步骤中每个智能体的架构决定,而非基于固定的通用模式。
实体解析:由于同一个人或事物会以多种表面形式出现(例如“Sarah”、“Sarah Chen”、“SC”;或者在组织层面,同一份文档可能被称为“PR FAQ”和“6-pager”),Maximem Synap 在数据摄入期间将提取的实体解析为规范标识。它运行一个按置信度排序的匹配策略级联,从精确标识符开始,逐步过渡到更宽松的词法、语义和上下文信号。公共实体会与全局知识层进行核对。任何之前未见过的实体都会在客户范围内注册。解析是尽力而为的,绝不会阻塞数据摄入;存在歧义的匹配项可以排队等待审核。
范围界定(检索):检索是一个感知范围的流水线,它按从窄到宽的层级进行解析:用户、客户、客户端,并返回带有来源标签、受 token 预算约束且经过排序的记忆项。它提供低延迟模式和高精度模式,后者会添加查询分解和 LLM 重排序。
图感知检索:除了向量相似性之外,Maximem Synap 还对知识图谱执行向量引导的多跳遍历:语义相似性用于确定从何处进入图谱以及哪些关系值得追踪,从而浮现出纯向量搜索会遗漏的相关记忆(第 3.3 节的桥梁文档问题)。图增强检索已有公开的先例(Edge 等人,2024;Gutiérrez 等人,2024;Hu 等人,2025),我们将在第 7 节讨论这些内容;Maximem Synap 具体的遍历和评分方法在此不作描述。
前瞻:Maximem Synap 额外实现了一条前瞻性检索路径:智能体可能需要的上下文可以在显式请求之前准备好,其设计意图是既告知智能体它需要但不知道存在于记忆中的信息,又将检索延迟移出智能体的关键路径,并且前瞻性检索与显式检索由相同的决策逻辑控制。这不是查询结果缓存,因为缓存会重放对重复查询的答案。而前瞻则是根据智能体不断变化的行为进行预测;它预测并预取尚未被请求的上下文,在请求到达之前将其准备好。其价值在于降低延迟而非去重,因为检索位于智能体的关键路径上(第 5 节)。将预期的获取操作移出该路径,可将阻塞性的往返过程转变为在需要时的缓存读取,代价是预测失败时丢弃的推测性工作。我们描述了这一概念,但未涉及预测机制本身,该机制是专有的,我们花费了一段时间才实现高命中率,同时最小化系统需要执行的浪费性工作,以减少计算和智能开销,并且这仍是一项进行中的工作(目前我们在各客户端上持续实现 60% 以上的命中率)。
压缩与整合:对于长对话,Maximem Synap 将压缩视为一种经过验证的操作:每次压缩都会检查信息损失。系统会测试原始对话中的关键信息是否仍能从压缩结果中恢复,并输出明确的验证分数和压缩率,当验证结果低于阈值时,会自动以较低压缩率重试。压缩是类别感知的:哪些内容必须逐字保留、哪些可以抽象概括,由智能体生成的架构决定。这就是第 3.2 节中描述的经过验证的压缩;验证机制本身在此处不作说明。
存储:Maximem Synap 采用了一种多语言、按租户命名空间划分的存储栈:一个用于嵌入向量的向量存储,一个用于实体-关系图的图存储,一个作为数据真实来源并用于短期上下文的关系型存储,一个用于原始内容和每个智能体配置的对象存储,一个用于使用遥测数据的时间序列存储,以及一个用于队列、缓存和协调的内存存储。每个存储背后的具体引擎是具体实现的选择,可能会更改或合并;在此层面重要的是每个存储所扮演的角色。向量存储和图存储共同使得检索能够结合语义和关系信号,这是第 3.3 节论证过的必要混合方式:向量存储弥合了语义鸿沟,而图存储则提供了纯相似性搜索所缺失的关系链接。默认情况下,嵌入向量是使用本地托管的 sentence-transformer 模型计算的。
集成模式:从应用程序的角度来看,生命周期简化为围绕每次模型调用的三步调用模式:对过往上下文的范围限定检索、对当前对话的验证性压缩,以及对新轮次的无阻塞摄入(列表 1,伪代码;具体签名见公开 SDK 文档)。该列表的重点在于其中缺失的内容:没有模式设计,没有嵌入模型选择,没有索引管理,没有隔离逻辑。这些是生命周期的工作。
列表 1 —— 生产集成模式(伪代码),每轮执行:检索 FETCH(query=user_message, scope={user, customer}) 范围限定检索 压缩 COMPACT(current_conversation) 验证性压缩 回复 MODEL(assemble(retrieved, compacted, recent_turns)) 摄入 INGEST(turn, scope) 异步执行;立即返回一个摄入 ID
一个示例追踪:考虑一个为 SaaS 产品提供支持的智能体,它收到一条消息:“嗨,Sarah 说让我问你。我们上周升级到了 Pro 版,但仪表盘仍然显示的是 Starter 版。”在连接时,架构设计已经生成了该智能体的记忆架构(与计费相关的类别、客户范围的组织实体、针对账户事实的保守压缩)。摄取阶段提取出一个具有时间有效性的信息(上周从 Starter 升级到 Pro)、一个事件片段(仪表盘显示过时的套餐)以及一个实体提及(“Sarah”),实体解析将其链接到该客户范围内之前提及“Sarah Chen”和“SC”时已知的规范身份。不同客户处的相同名字则解析为不同的人。在下一轮交互中,范围化检索会组装用户级上下文(此人的未结工单)、客户级上下文(该组织的套餐历史和团队)以及客户端的模式(一个已知的套餐传播延迟),每个项目都带有来源标签,并适配 token 预算。随着对话变长,压缩会减少其内容,并在下一次模型调用前报告一个验证分数。整个过程中的应用代码均为清单 1;本段中的每一个行为都可以通过 SDK 和仪表盘观察到。
关于分解的说明:我们将 Maximem Synap 呈现为五种原语,即具有已定义契约的能力,而非五个独立的运行时组件。从原语到进程的映射是一种实现选择,并且在该系统的生命周期中已经发生过变化。契约是稳定的表面。
5 设计选择
我们重点介绍那些将上下文管理系统与记忆工具区分开来的选择,每一个选择都与第 3 节中的一种失败模式相关联。
架构是综合定制而成的,而非固定通用的:一套通用模式无法同时完美适配金融科技客服智能体和编程助手;它们在类别划分、信息留存和压缩需求上各有不同。为每个智能体生成专属架构,才能让后续的生命周期环节贴合实际用例,这也是对提取质量影响最大的选择(即第3.3节链条中的第一环)。同时,这一选择也让第2节中关于耦合性的论述变得具体可感:生成的架构正是那个构件,通过它,架构设计原语得以配置其他四个环节。
压缩承载着质量契约:由于未经验证的压缩会产生自信满满的错误答案(第3.2节),Maximem Synap 会在每次压缩时返回明确的验证分数和压缩比,并在验证失败时自动重试。该系统会确认压缩是否生效,而不是压缩完就指望它自动做好。
验证并非免费:压缩上下文并对其进行检查会消耗 token。但压缩并非一次性事件;它会定期执行,每次操作的对象是已压缩的上下文加上最近的对话轮次,而非完整对话记录。因此,每次压缩处理的都是有界上下文,而压缩次数仅随对话长度线性增长,所以开销是线性的而非二次方的。如果上下文保持在预算附近,压缩每经过若干轮触发一次,每次开销为有界上下文的固定倍数,那么经过 轮对话后的总 token 开销为:第3.1节中的线性成本乘以一个固定系数。与完整追加的基线方案相比,节省量随对话长度增长而非缩小;在每轮 token 数为 、、、(固定开销)的条件下,净 token 节省量在 100 轮时约为 80%,200 轮时约为 90%,500 轮时约为 96%。这种反复重新压缩之所以安全,完全是因为每一轮都经过了验证:如果没有信息丢失检查,迭代压缩就会滑向第3.2节所述的上下文崩溃故障。
数据摄取是异步且非阻塞的:立即返回一个摄取 ID 可保持调用智能体的响应性;繁重的工作(提取、解析、多存储持久化)在关键路径之外进行。这种用即时一致性换取低延迟的做法是经过深思熟虑的。它之所以有效,是因为记忆的读取频率远高于写入频率。这并不会牺牲会话内的写后读一致性:最近的几轮对话会原样保留在工作上下文中(即清单 1 中的 recent_turns),因此智能体刚刚产生或接收到的信息在下一轮对话中即可使用,无需等待摄取完成。异步机制仅延迟了该信息的持久化、结构化、长期可用性,而非其即时使用。
作用域是一等公民,隔离是强制执行的,而非建议:多租户隔离在存储层和查询层实现,其身份标识源自凭证,因此组织上下文可用,且一个用户的数据不会出现在另一个用户的会话中——这是扁平化、用户级作用域记忆容易引发的故障。作用域策略由 Maximem 建议,但由客户端管控:Maximem 提出智能体应使用的作用域,客户端则负责批准和把关,从而让客户保留对哪些信息可在用户和组织间共享、哪些信息应保持隔离的控制权。
检索结合了语义和关系信号:纯向量检索会遗漏桥接上下文(见第 3.3 节)。纯图遍历则代价高昂且脆弱。将两者结合旨在实现推理的充分性,而不仅仅是检索命中率。
延迟是围绕系统设计的,而不仅仅是优化对象:检索位于智能体的关键路径上,因此系统提供了一种显式的低延迟检索模式;此外,第 4 节中描述的预判路径旨在当上下文可以提前准备时,将检索完全移出关键路径。
6 评估
6.1 实验设置
我们在两个公开的第三方对话记忆基准上评估了 Maximem Synap:LongMemEval(Wu 等人,2024),包含 500 个由人工策划的、基于长篇幅多轮对话历史的问题,涵盖六项能力类别;以及 LoCoMo(Maharana 等人,2024),针对超长对话(平均 300 轮)进行问答。这两个基准均非我们设计;两者均使用其官方公开发布版本,未使用自定义子集,也未重新标注。
表 2 详细说明了每项报告结果的具体配置。我们认为,只有当完整配置被明确陈述时,评估数字才具有可解释性,并且我们以此标准要求自身数据。有一项范围决策值得强调:LoCoMo 的第 5 类是对抗性类别:问题设计为不可回答,用于衡量模型拒答能力而非记忆能力,是否包含该类别会导致整体分数相差十分或更多,这也是 LoCoMo 分数无法直接比较的最常见原因。我们报告的是第 1–4 类,排除了第 5 类,这与原始论文、Mem0 和 Zep 的惯例一致(Maximem,2026d)。
| LongMemEval | LoCoMo | |
|---|---|---|
| 结果(总体) | 92.0%(460 / 500) | 93.2%(第 1–4 类) |
| 数据集 | LongMemEval_S,完整 500 题集,全部 6 个类别,官方发布版本 | locomo10,官方发布版本;第 1–4 类(按惯例排除对抗性的第 5 类) |
| 回答模型 | gpt-5-mini | gpt-5-mini |
| 评判器 | gpt-5-mini,与标准答案进行二元 CORRECT/WRONG 判定 | gpt-5-mini,与标准答案进行二元 CORRECT/WRONG 判定 |
| 检索配置 | 对已摄入记忆进行范围感知检索;完整每次运行配置见已发布方法论 | 同上 |
| 测试框架 | maximem-ai/memory_and_context_eval_harness(Maximem,2026e)(开源) | 同上 |
| 产物 | 方法论 + 按类别统计计数已公开(Maximem,2026d);每次运行产物(答案、检索到的上下文、评判器判定结果)可申请获取 | 同上 |
| 运行日期 / 仓库标签 | 已标记在结果仓库中(maximem-ai/eval_benchmark_runs_output) | 同上 |
6.2 结果
在表2的配置下,Maximem Synap 在 LongMemEval 上达到 92.0% 的整体得分(460/500),在 LoCoMo 类别 1–4 上达到 93.2%,这与我们的公开记录(Maximem, 2026c; 2026d)一致。以下是各类别的具体结果;我们如实报告了弱项类别,与强项类别一视同仁。
各类别结果(官方类别分布;计数见 Maximem, 2026d) LongMemEval 类别 得分(正确数/总数) LoCoMo 类别 得分 单会话用户 100.0%(70/70) 多跳 97.3% 单会话偏好 100.0%(30/30) 开放域 93.4% 知识更新 100.0%(78/78) 时序 90.8% 时序推理 100.0%(133/133) 单跳 88.8% 单会话助手 87.5%(49/56) 整体(类别 1–4) 93.2% 多会话 75.2%(100/133) 整体 92.0%(460/500)
残余错误主要集中在 LongMemEval 的多会话类别(75.2%):这类推理需要将跨不同会话的信息关联起来,其次是单会话助手类别(87.5%)。我们如实报告:多会话推理是我们所知的每个系统都面临的最难的公开类别,而这正是第 3.3 节所讨论的推理充分性范畴。
相比之下,LoCoMo 尤其成为了供应商之间公开方法论争议的主题,而记忆基准测试的分数对答案模型、评判模型、信息摄入粒度以及对抗性类别处理高度敏感;同一系统仅因答案模型不同就可能波动数个百分点的分数(SuperMemory 自身公布的扫描结果在答案模型间为 81.6%–85.2%)。因此,我们遵循两条规则。第一,我们自己的配置已完整说明(表 2)。第二,我们绝不将不同方法论得出的数字进行直接对比:表 3 复现了每家供应商自行报告的最佳 LongMemEval 分数及其所使用的答案模型,仅作为已发布的现状呈现;各行之间不具有可比性。我们注意到该表确实支持的一个事实:Maximem Synap 的分数是使用比最强竞争对手配置更小的答案模型(gpt-5-mini)得出的,这是最明确的迹象,表明性能提升来自上下文层,而非答案模型。
| 系统 | LongMemEval(自行报告) | 答案模型 | 评判模型 | 来源 |
|---|---|---|---|---|
| Maximem Synap | 92.0% | gpt-5-mini | gpt-5-mini | Maximem (2026d) |
| SuperMemory | 85.2% / 84.6% / 81.6% | Gemini-3 Pro / gpt-5 / gpt-4o | gpt-4o | SuperMemory (2026) 研究页面 |
| Zep | 71.2% | gpt-4o | gpt-4o | Rasmussen 等人 (2025) |
| Mem0 | 未发布 | — | — | — |
| Letta (MemGPT) | 未发布 | — | — | — |
6.3 本次评估的范围与局限性
我们希望明确说明这些结果以及该系统所证实和未证实的内容。首先,两个基准测试衡量的都是对话式记忆以及基于回忆内容的推理能力。然而,它们并未衡量生产负载下的延迟,也未衡量随着检索上下文增长(“上下文衰减”)时,代表精确性或鲁棒性的每任务 token 成本。其中一些维度是生产团队非常看重的,而本文针对这些维度提出的是设计论点(第 3 节),而非基准测试声明。我们在此有意不报告任何延迟数据,将其留待后续论文中提出,届时我们将提出一个新的基准测试,旨在填补现有基准测试的空白。其次,第 3.3 节中作为动机的研究的局限性已在该节中明确指出。第三,基准测试分数反映的是配置与系统的组合,而非抽象意义上的单一系统。表 2 是结果的一部分。第四,每次运行的工件目前可应要求提供,而非公开发布;测试工具和数据集是公开的。
由于现有基准测试仅能部分捕捉生产团队所关心的维度,因此,一项针对生产环境上下文管理的、全面且可复现的基准测试(同时衡量准确性、延迟、token 效率以及抗上下文衰减能力)将成为后续工作的主题。
7 相关工作
我们将本文定位在一个我们进行综述而非批判的领域内,将先前的工作映射到第 2 节的五个原语上。对已命名系统的描述均摘自各系统自身的出版物或文档。
基础:将记忆内容与其使用分离,在神经系统中是一个古老的概念:可微分神经计算机将控制器网络与外部可寻址记忆耦合(Graves 等人,2016)。受认知科学启发的综述将人类记忆系统(感觉记忆、工作记忆、情景记忆、语义记忆、程序记忆)映射到 AI 对应物,并强调存储、检索和遗忘同等重要(Zihong He 等人,2024)。将遗忘和保留视为测试时记忆化(而非删除)方面的研究(Behrouz 等人,2025),为如何推理保留机制提供了依据。上下文学习文献确立了这样一个观点:上下文的形态(而不仅仅是其存在)驱动着模型行为(Dong 等人,2024)。
记忆系统(研究):MemGPT 将大语言模型视为一个操作系统,管理着类似虚拟内存的上下文内存储与外部存储层级结构,模型自身负责将信息分页调入和调出(Packer 等人,2024);它主要解决生命周期中的范围界定和存储环节,并已产品化为 Letta,其文档描述了具有开发者定义记忆块的有状态智能体、旧消息的自动压缩,以及在交互之间后台处理记忆的实验性“休眠时间”智能体——这是与预期原语最接近的已发表同类工作(Letta 文档,2026)。MIRIX 将智能体记忆结构化为六种类型组件,由一个多智能体框架协调,该框架负责路由更新和检索(Wang & Chen,2025),解决了吸收和范围界定问题。Dynamic Cheatsheet 维护一个在测试时自适应更新的外部操作手册(Suzgun 等人,2025),而智能体上下文工程(ACE)则通过结构化增量更新扩展了操作手册的概念,避免了重写带来的简洁性偏差,并在此过程中记录了第 3.2 节核心的上下文崩溃故障(Zhang 等人,2025);两者都处于吸收和压缩的交汇点。CAMELoT 表明,一个免训练的联想记忆模块可以替代暴力扩展上下文的方法(Zexue He 等人,2024),这是一种偏向整合的压缩思路。
记忆系统(商业产品):多个商业系统将记忆作为可集成的层提供;我们依据各系统当前的官方文档对其进行描述(文档访问日期:2026年6月12日)。Mem0 自称是“用于大语言模型应用的通用、自我改进的记忆层”,能够动态提取并整合对话中的关键信息,其开源配置中提供了图数据库后端(Chhikara 等人,2025;Mem0 文档,2026);其公开的侧重点在于数据摄入这一基础功能。Zep 定位为企业级智能体记忆系统,通过 Graphiti 构建时间维度的“上下文图”,并从中组装出 token 高效的上下文块(Zep/Graphiti 文档,2026);时间维度的事实有效性是其数据摄入与存储方面的贡献,而其上下文组装功能则解决了作用域问题。SuperMemory 自称是面向 AI 智能体的记忆与上下文基础设施,结合了事实图记忆、预计算用户画像以及托管式检索(SuperMemory 文档,2026)。Cognee 是一个开源 AI 记忆平台,通过“记住/回忆/遗忘/改进”接口,从异构数据中构建知识图谱(Cognee 文档,2026)。消费级助手原生提供用户作用域内的记忆功能(例如 ChatGPT 记忆),我们将其视为大多数终端用户所接触的基线方案。对照第 2 节的分析,这些系统主要集中于记忆的摄入与存储,并具备部分作用域功能;根据其各自的公开资料,没有任何系统声称具备生成式、按智能体定制的记忆架构设计能力、作为产品功能的预测性预取能力,或经过损失验证的压缩能力;我们认为,生命周期框架在组织级作用域方面能带来最大的增量价值。
| 系统 | 架构设计 | 数据摄入 | 作用域 | 预测 | 压缩与整合 |
|---|---|---|---|---|---|
| MemGPT / Letta | —a | ◐ | ●b | ◐c | ● |
| MIRIX | ● | ◐ | ◐ | ||
| ACE / Dynamic Cheatsheet | ◐d | ◐e | |||
| Mem0 | ● | ◐ | ◐ | ||
| Zep / Graphiti | —a | ● | ● | ◐ | |
| SuperMemory | ● | ◐ | ◐f | ◐ | |
| Cognee | —a | ● | ◐ | ◐ | |
| Maximem Synap(本文) | ● | ● | ● | ● | ● |
a 部分系统支持开发者定义或数据涌现的结构(Letta 的开发者定义记忆块;Graphiti 的“学习本体”;Cognee 的本体支持)。我们仅在系统根据智能体目的描述生成每个智能体专属记忆架构时,才将其标记为“架构设计”;手工定义或事后从摄入数据中涌现的结构属于不同的能力范畴。b 从 token 预算的角度看:上下文窗口管理是 MemGPT 的创始论点,Letta 则记录了具有大小预算的显式上下文层级。层级化的组织范围划分(用户 vs. 组织 vs. 平台)并非其明确关注的焦点。c Letta 的休眠期智能体在交互间隙于后台处理记忆;其官方文档将该功能标记为实验性。后台预计算与查询预测性预取相近,但并非同一概念。d ACE 和 Dynamic Cheatsheet 从智能体自身的执行经验中提取策略,而非从对话或文档中提取。e ACE 通过避免压缩(增量式结构化更新)来解决上下文重写中的信息丢失问题;它不执行经过验证的摘要生成。f SuperMemory 的用户配置文件是预计算的常驻上下文(“无需搜索”),而非查询预测性预取。g 源帖声称 97.8%;但 10,134 条中仅有 38 条可用,其正确算术结果为 99.6% 的无效率。我们报告原始计数和修正后的百分比。
检索:检索增强生成是基础(Lewis 等人,2020)。图感知变体将其扩展到关系型和多文档推理:GraphRAG 构建社区摘要实体图以处理语料库级别的问题(Edge 等人,2024),而 HippoRAG 使用受海马体启发的索引,在知识图谱上进行多跳检索(Gutiérrez 等人,2024)。RAPTOR 在递归摘要树上进行检索(Sarthi 等人,2024)。ReMindRAG 将大语言模型的遍历决策记忆在知识图谱的边嵌入中,以便相似查询可以重放路径,而无需每次逐跳调用大语言模型(Hu 等人,2025)。它与 GraphRAG 和 HippoRAG 一起,是与第 4 节中图感知检索最接近的已发表现有技术,我们将其作为此类技术引用。
长上下文:一条互补的研究路线表明,扩大上下文窗口并非没有代价:模型在处理长上下文中间部分的信息时性能会下降(Liu 等人,2024),而流式注意力(Xiao 等人,2024)和 KV 缓存压缩(Li 等人,2024)则从注意力层面着手解决长上下文的服务成本问题。ACM 是正交的;它决定的是首先应该将什么内容放入窗口,无论窗口大小如何。
8 未来方向:决策层面与组织规模的上下文
第 2 节描述的生命周期目前管理着对话和组织层面的上下文。前沿领域是决策层面的上下文:不仅捕捉发生了什么,还要捕捉组织为何做出其决策,以便智能体能够依据机构判断而非仅仅机构事实进行推理。这就是如今在投资界引起关注的“上下文图谱”机遇,其更广泛的机遇据估计可达数万亿美元(Gupta & Garg, 2025),并且我们已经发表了关于此主题的详细论述(Dadhich, 2026b)。
我们对此持审慎态度,因为真正的难题是现实存在且大多尚未解决的。大多数决策是隐性的,从未被记录;记录下来的理由往往是事后合理化解释,而非真实的决策轨迹;将决策与结果关联起来需要因果归因,而这连人类都难以做到;此外,判断过去的决策何时已被取代本身就是一个问题。同样棘手的技术难题还包括:跨组织系统提取决策轨迹、组织内部规范化(同一个文档,一个团队称之为“PR 常见问题”,另一个团队称之为“六页纸”)、时间锚定、存储什么内容及存储位置,以及将原本隔离的知识集中存放在一个逻辑系统中所带来的安全后果。我们提出这些挑战,并非因为我们已全部解决(尽管我们在参考系统中已解决了大部分),而是因为列出这些问题,才能让整个领域共同尝试解决它们,并推动该领域走向成熟。一个如今能够跨用户和跨组织管理事实的上下文管理生命周期,正是最终构建决策级上下文所必需的基础。
9 结论
智能体未能兑现其承诺,主要原因并非缺乏智能,而是缺乏受管理的上下文。将其仅仅视为一个内存存储问题,是对问题的低估。我们认为,这是一个生命周期(架构设计、摄入、范围界定、预判、压缩与整合),它在组织范围层级结构中运作,而将其作为一个系统来管理是经济上的必然要求,而非便利之举。这是二次成本与线性成本之间的差距,也是自信的错误答案与经过验证的答案之间的差距。下一代智能体上下文基础设施将不仅仅提供一个存储历史记录的位置,而是一个管理完整上下文生命周期的系统。我们描述了一个这样的系统,并指出了该领域正迈向的决策级前沿。未来的竞争不在于谁存储的数据最多,而在于谁对上下文的管理最好。
致谢
作者感谢 Maximem 团队的 Shreyansh Singh Gautam 和 Anish Yadav 在 Maximem Synap 实现方面所做的工作,以及对本论文的审阅反馈。作者还感谢 Varun Gupta 和其他审稿人,他们提供了非常详细且高质量的审阅反馈,这些反馈实质性地改进了本论文。
参考文献
Behrouz, A., Razaviyayn, M., Zhong, P., & Mirrokni, V. (2025). It’s All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization (Miras). arXiv:2504.13173v1. ICLR 2026 (海报展示).
Chhikara, P., Khant, D., Aryan, S., Singh, T., & Yadav, D. (2025). Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory. arXiv:2504.19413v1.
Cognee (2026). Cognee 文档, docs.cognee.ai; GitHub: topoteretes/cognee. 访问日期:2026年6月12日.
Dadhich, G. (2026a). File vs Vector for RAG. Maximem 博客, 2026年1月15日. https://www.maximem.ai/blog/file-rag-vs-vector-rag (数据来源: github.com/maximem-ai/file-vs-vector-study-results)
Dadhich, G. (2026b). Context Graphs: The Trillion Dollar Elephant. Medium, 2026年1月22日.
Dong, Q., 等. (2024). A Survey on In-context Learning. arXiv:2301.00234v6. EMNLP 2024.
Edge, D., Trinh, H., Cheng, N., 等. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization. arXiv:2404.16130v2.
Graves, A., 等. (2016). Hybrid computing using a neural network with dynamic external memory. Nature, 538:471–476.
Gupta, J., & Garg, A. (2025). AI’s trillion-dollar opportunity: Context graphs. Foundation Capital, 2025年12月22日. https://foundationcapital.com/ideas/context-graphs-ais-trillion-dollar-opportunity
Gutiérrez, B. J., 等. (2024). HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models. arXiv:2405.14831v3. NeurIPS 2024.
He, Zexue, Karlinsky, L., Kim, D., McAuley, J., Krotov, D., & Feris, R. (2024). CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory. arXiv:2402.13449v1.
He, Zihong, Lin, W., Zheng, H., 等. (2024). Human-inspired Perspectives: A Survey on AI Long-term Memory. arXiv:2411.00489v2.
胡宇、朱俊、唐磊、黄超(2025)。《ReMindRAG:低成本大语言模型引导的知识图谱遍历实现高效 RAG》。arXiv:2510.13193v2。NeurIPS 2025。
Letta(2026)。Letta 文档,docs.letta.com。访问日期:2026 年 6 月 12 日。
Lewis, P. 等人(2020)。《面向知识密集型 NLP 任务的检索增强生成》。NeurIPS 2020。arXiv:2005.11401。
李宇、黄毅、杨波等人(2024)。《SnapKV:大语言模型在生成前已知晓你的需求》。arXiv:2404.14469v2。NeurIPS 2024。
Liu, N. F. 等人(2024)。《迷失在中间:语言模型如何使用长上下文》。TACL 12:157–173。arXiv:2307.03172v3。
Maharana, A.、Lee, D.-H.、Tulyakov, S.、Bansal, M.、Barbieri, F.、方宇(2024)。《评估大语言模型智能体的超长期对话记忆(LoCoMo)》。ACL 2024,第 13851–13870 页。arXiv:2402.17753v1。
Maximem(2026a)。《Synap 底层工作原理》。maximem.ai 博客,2026 年 4 月 11 日。https://www.maximem.ai/blog/how-maximem-synap-works
Maximem(2026c)。《Maximem Synap 更新:更高分数、17 项集成及在线体验平台》。maximem.ai 博客,2026 年 5 月 27 日。https://www.maximem.ai/blog/maximem-synap-updates-higher-benchmark-scores-and-more
Maximem(2026d)。《Synap:智能体记忆基准测试结果》。GitHub:maximem-ai/eval_benchmark_runs_output(README、RESULTS.md、METHODOLOGY.md;CITATION.cff;CC BY 4.0)。访问日期:2026 年 7 月 9 日。
Maximem(2026e)。《记忆与上下文评估框架》。GitHub:maximem-ai/memory_and_context_eval_harness。
麦肯锡公司(2025)。《2025 年人工智能现状:智能体、创新与转型》。QuantumBlack by McKinsey,2025 年 11 月。https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Mem0(2026)。Mem0 文档,docs.mem0.ai。访问日期:2026 年 6 月 12 日。
Packer, C. 等人(2024)。《MemGPT:迈向作为操作系统的大语言模型》。arXiv:2310.08560v2。
Rasmussen, P. 等人(2025)。《Zep:一种面向智能体记忆的时间知识图谱架构》。arXiv:2501.13956。
Sarthi, P. 等人(2024)。《RAPTOR:面向树状组织的递归抽象处理检索》。ICLR 2024。arXiv:2401.18059v1。
SuperMemory(2026)。SuperMemory 文档,supermemory.ai/docs。访问日期:2026 年 6 月 12 日。
SuperMemory (2026)。研究:LongMemEval 结果。supermemory.ai/research。访问日期:2026 年 7 月 9 日(来源:Maximem, 2026d)。
Suzgun, M., Yuksekgonul, M., Bianchi, F., Jurafsky, D., & Zou, J. (2025)。《动态速查表:基于自适应记忆的测试时学习》。arXiv:2504.07952v1。
Wang, Y., & Chen, X. (2025)。《MIRIX:面向基于大语言模型智能体的多智能体记忆系统》。arXiv:2507.07957v1。
Wu, D., Wang, H., Yu, W., Zhang, Y., Chang, K.-W., & Yu, D. (2024)。《LongMemEval:在长期交互记忆上对聊天助手进行基准测试》。arXiv:2410.10813v2。ICLR 2025。
Xiao, G., 等 (2024)。《具有注意力汇聚点的高效流式语言模型》。arXiv:2309.17453v4。ICLR 2024。
Zep / Graphiti (2026)。Zep 文档,help.getzep.com;Graphiti GitHub:getzep/graphiti。访问日期:2026 年 6 月 12 日。
Zhang, Q., Hu, C., Upasani, S., 等 (2025)。《智能体上下文工程:为自我改进语言模型演化上下文》。arXiv:2510.04618v3。ICLR 2026。
附录 A 成本模型推导
假设每轮对话增加一定数量的 token,且对话共进行 轮。完全追加方式每轮都会重新发送整个历史记录,因此第 轮的输入 token 数为 ,累计总数为
有界预算系统将每轮输入 token 数限制为 :。成本倍数为
与 呈线性关系。示例数值(,):
| 轮数 | 完全追加(token 数) | 有界(token 数) | 倍数 |
|---|---|---|---|
| 50 | 637,500 | 200,000 | 3.2 |
| 100 | 2,525,000 | 400,000 | 6.3 |
| 200 | 10,050,000 | 800,000 | 12.6 |
| 500 | 62,625,000 | 2,000,000 | 31.3 |
这些是示例数值,并非实测结果;它们假设每轮增加的 token 数恒定,且忽略了缓存折扣,缓存折扣会改变常数项,但不会改变渐近趋势。每次调用的注意力计算量随每轮序列长度呈二次方增长,这使得完全追加方式的累计计算量大致与 的三次方成正比;我们以计费结果作为主要依据,因为这是更清晰的论断。
第 3.2 节的前沿论证如下:完全追加方式以二次方成本换取保真度;粗粒度摘要以线性成本换取保真度,但会牺牲准确性(Zhang 等人,2025 年记录显示,单步压缩将 18,282 个 token 压缩至 122 个 token,准确率从 66.7% 降至 57.1%,低于无上下文基线);经过验证的压缩技术则以线性成本实现受检的保真度。
附录 B 检索研究方法论(动机研究,第 3.3 节)
实验设置。五个公开数据集,覆盖不同的检索场景:CodeXGLUE(自然语言代码)、MS MARCO(网页段落)、SQuAD(事实性问答)、HotpotQA(多跳推理)、SciQ(科学问答)。五个独立的语料库:每个数据集包含 10,000 篇文档(总计 50,000 篇,按数据集分别建立索引,而非合并为一个语料库),每个数据集有 1,000 条查询(总计 5,000 条),使用 MRR@10 指标对照各数据集的黄金标注进行评分。检索工具:Tantivy 0.22.0(默认文本分析器)和 ChromaDB(0.4.0,默认索引),搭配 all-MiniLM-L6-v2 嵌入向量(384 维)。未进行分块处理:文档以完整形式建立索引。硬件环境:Apple M4 MacBook Pro(10 核,16 GB 内存)。实验于 2026 年 1 月 14 日执行。公开报告(Dadhich, 2026a)定性描述了这些发现;下表中的数据为首次公开。各数据集的得分和配置已发布在 maximem-ai/file-vs-vector-study-results。
| 数据集(场景) | 关键词检索(Tantivy) | 向量检索(Chroma) | 胜出方 |
|---|---|---|---|
| CodeXGLUE(自然语言代码) | 0.290 | 0.914 | 向量检索,显著胜出 |
| MS MARCO(网页查询) | 0.404 | 0.523 | 向量检索 |
| SQuAD(事实性问答) | 0.605 | 0.614 | 持平 |
| HotpotQA(多跳推理) | 0.549 | 0.495 | 关键词检索,微弱胜出 |
| SciQ(科学问答) | 0.815 | 0.614 | 关键词检索,显著胜出 |
| 语料库 | 关键词索引 | 嵌入向量 + 向量索引 | 倍数 |
|---|---|---|---|
| CodeXGLUE | 0.45 秒 | 43.1 秒 | 97 |
| MS MARCO | 0.42 秒 | 26.3 秒 | 63 |
| SQuAD | 0.41 秒 | 35.9 秒 | 88 |
| HotpotQA | 0.39 秒 | 29.5 秒 | 75 |
| SciQ | 0.44 秒 | 26.7 秒 | 60 |
局限性(完整陈述;正因如此,第 3.3 节将该研究作为动机而非基准来呈现):
- 1.
单一检索工具;仅使用一种关键词引擎与一种向量存储进行对比。结果仅表征此特定配置,而非抽象的检索方法。
- 2.
无分块处理。all-MiniLM-L6-v2 模型会对超出其最大序列长度的输入进行截断,因此在长文档上,向量索引实际上只嵌入了每篇文档的开头部分。这导致长文本比较对向量侧不利;如果采用分块处理,向量结果在这些语料库上的表现很可能会提升。相比之下,CodeXGLUE 的自然语言转代码片段足够短,能够适配模型的上下文窗口,因此截断不会影响该语料库,其 0.914 的结果保持不变。
- 3.
每个语料库的规模较小。10,000 篇文档的索引规模无法模拟生产环境下的向量搜索约束条件。
- 4.
单一正确答案评分。HotpotQA 的评分是针对每个问题对应的一篇支撑文档进行的;该评估设计无法衡量多文档的充分性。第 3.3 节讨论了为何这一局限性本身具有信息价值。
- 5.
评估运行程序未保留每次查询的追踪记录;随附发布的材料包含每个数据集的得分和评估代码,而非每次查询的输出结果。
- 6.
MS MARCO 的许可协议限制了段落文本的再分发;发布内容中排除了该语料库的底层段落。
- 7.
该研究仅对两种检索基底进行了独立比较;它没有评估融合后的混合流水线(例如,对词法结果和语义结果进行倒数排名融合),也没有评估第二阶段的交叉编码器重排序器,而这两种方法预计都会提升向量和混合检索的数值。其论点在于组合信号的必要性,而非衡量最佳可实现的组合系统的性能。
第 3.3 节得出的结论——检索方法的体制依赖性(B1)、索引时的非对称性(B2)以及基于命中的评分对充分性的结构性忽视——均不受注意事项 1-3 的影响,而注意事项 4 是充分性论证的基础,而非对其构成威胁。
附录 C 可复现性声明
对于第 6 节中的每一项结果,我们都明确说明:所使用的数据集及其划分与问题数量、答案模型与评判模型、完整的检索配置、测试框架的提交哈希值、运行日期,以及我们公开发布的内容(测试框架代码、配置文件和每个问题的原始输出)。如果某项结果在发布时无法由第三方重新运行,我们会直接说明,而非暗示可以。任何竞争对手的数据均遵循第 6.2 节的两条规则:要么采用完全相同的协议,要么明确标注为自行报告,且绝不在同一张表格中混合使用。
附录 D 数据使用与隐私
Maximem Synap 会处理可能包含个人信息的对话数据。在策略层面:记忆功能在架构上按租户隔离(存储层与查询层均强制执行,详见第 4 节);客户可通过生成架构的护栏控制数据保留期限;个人身份信息则受制于按智能体配置的提取时处理策略。本文未报告任何客户数据;基准测试结果均使用公开数据集。