正文 · AI 翻译
摘要:长期记忆系统将用户说过的话存储于外部存储器中,并在相关查询到来时进行检索。这一交互界面基于一个看似理所当然、以至于很少被明确陈述的假设:所需的记忆必然与需要它的查询相似。世界知识打破了这一假设。对坚果过敏这一事实,应当通过杏仁粉这一成分来改变对马卡龙请求的回答,然而这两段文本之间并不存在任何检索器能够识别的线索。我们将这种失败模式称为“隐式关联盲点”,并提出了 InMind——一个包含 125 项任务、经专家验证的基准测试,涵盖十个生活领域,其中 113 项任务基于可引用的公开来源。其配对控制实验将现有评估中混淆的三种解释区分开来:事实从未被存储、模型缺乏桥接知识、或者事实已被存储但从未被呈现。结论是清晰的。当决定性的记忆被置于上下文中时,骨干模型能回答 84.0% 的间接查询;而当同样的记忆需要被检索时,六种向量、图及智能体记忆系统最多只能达到 14.4%,尽管它们在按需回忆相同事实时准确率高达 100%。将嵌入向量的维度提升八倍,虽然提高了每个系统在答案盲测中的目标召回率,但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针,能够恢复大部分差距,从而将失败定位在查询条件化的交互界面本身,并指出路由——即决定哪些事实必须保持可见——是 InMind 旨在评分的开放性问题。
| 学科分类: | 计算与语言(cs.CL) |
| 引用方式: | arXiv:2607.24368 [cs.CL] |
| (或本版本:arXiv:2607.24368v1 [cs.CL]) | |
| https://doi.org/10.48550/arXiv.2607.24368 arXiv 发布的 DOI 通过 DataCite 获取(注册中) |
提交历史
来自:Ruizhe Li [
2026 年 7 月 27 日星期一 12:42:12 UTC(1,196 KB)