# InMind 基准揭示智能体记忆系统的隐式关联盲点

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-27 08:00
- AIHOT 分数：76
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms5hnvv70015ros543ypf7it
- 原文链接：https://arxiv.org/abs/2607.24368

## 精选理由

这个基准把agent记忆系统的一个盲点钉死了：需要联想才能提取的常识，当前检索几乎必漏。它指向一个结构性问题，做记忆的该认真看。

## AI 摘要

研究团队发布 InMind 基准，包含 125 个专家验证任务，测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时，骨干模型能回答 84.0% 的间接查询；但通过六种记忆系统检索时，命中率最高仅 14.4%，尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身，将“路由——决定哪些事实必须保持可见”确立为核心开放问题。

## 正文

摘要：长期记忆系统将用户说过的话存储于外部存储器中，并在相关查询到来时进行检索。这一交互界面基于一个看似理所当然、以至于很少被明确陈述的假设：所需的记忆必然与需要它的查询相似。世界知识打破了这一假设。对坚果过敏这一事实，应当通过杏仁粉这一成分来改变对马卡龙请求的回答，然而这两段文本之间并不存在任何检索器能够识别的线索。我们将这种失败模式称为“隐式关联盲点”，并提出了 InMind——一个包含 125 项任务、经专家验证的基准测试，涵盖十个生活领域，其中 113 项任务基于可引用的公开来源。其配对控制实验将现有评估中混淆的三种解释区分开来：事实从未被存储、模型缺乏桥接知识、或者事实已被存储但从未被呈现。结论是清晰的。当决定性的记忆被置于上下文中时，骨干模型能回答 84.0% 的间接查询；而当同样的记忆需要被检索时，六种向量、图及智能体记忆系统最多只能达到 14.4%，尽管它们在按需回忆相同事实时准确率高达 100%。将嵌入向量的维度提升八倍，虽然提高了每个系统在答案盲测中的目标召回率，但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针，能够恢复大部分差距，从而将失败定位在查询条件化的交互界面本身，并指出路由——即决定哪些事实必须保持可见——是 InMind 旨在评分的开放性问题。

学科分类： 计算与语言（cs.CL）

引用方式： arXiv:2607.24368 [cs.CL]

（或本版本：arXiv:2607.24368v1 [cs.CL]）

https://doi.org/10.48550/arXiv.2607.24368

arXiv 发布的 DOI 通过 DataCite 获取（注册中）

提交历史

来自：Ruizhe Li [

2026 年 7 月 27 日星期一 12:42:12 UTC（1,196 KB）

访问论文：

当前浏览上下文：

参考文献与引用

书签

书目与引用工具

与本文相关的代码、数据与媒体

演示

推荐与搜索工具

arXivLabs：与社区合作者的实验项目
