内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
原文
HuggingFace Daily Papers(社区热门论文)
精选76

InMind 基准揭示智能体记忆系统的隐式关联盲点

2026-07-27 08:00· 2天前
跳到正文
精选理由

这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。

AI 摘要

研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。

正文 · AI 翻译
摘要:长期记忆系统将用户说过的话存储于外部存储器中,并在相关查询到来时进行检索。这一交互界面基于一个看似理所当然、以至于很少被明确陈述的假设:所需的记忆必然与需要它的查询相似。世界知识打破了这一假设。对坚果过敏这一事实,应当通过杏仁粉这一成分来改变对马卡龙请求的回答,然而这两段文本之间并不存在任何检索器能够识别的线索。我们将这种失败模式称为“隐式关联盲点”,并提出了 InMind——一个包含 125 项任务、经专家验证的基准测试,涵盖十个生活领域,其中 113 项任务基于可引用的公开来源。其配对控制实验将现有评估中混淆的三种解释区分开来:事实从未被存储、模型缺乏桥接知识、或者事实已被存储但从未被呈现。结论是清晰的。当决定性的记忆被置于上下文中时,骨干模型能回答 84.0% 的间接查询;而当同样的记忆需要被检索时,六种向量、图及智能体记忆系统最多只能达到 14.4%,尽管它们在按需回忆相同事实时准确率高达 100%。将嵌入向量的维度提升八倍,虽然提高了每个系统在答案盲测中的目标召回率,但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针,能够恢复大部分差距,从而将失败定位在查询条件化的交互界面本身,并指出路由——即决定哪些事实必须保持可见——是 InMind 旨在评分的开放性问题。
学科分类: 计算与语言(cs.CL)
引用方式: arXiv:2607.24368 [cs.CL]
  (或本版本:arXiv:2607.24368v1 [cs.CL])
  https://doi.org/10.48550/arXiv.2607.24368
arXiv 发布的 DOI 通过 DataCite 获取(注册中)

提交历史

来自:Ruizhe Li [

2026 年 7 月 27 日星期一 12:42:12 UTC(1,196 KB)

访问论文:

license icon

当前浏览上下文:

参考文献与引用

书签

BibSonomy Reddit

书目与引用工具

与本文相关的代码、数据与媒体

演示

推荐与搜索工具

arXivLabs:与社区合作者的实验项目

HuggingFace Daily Papers(社区热门论文)
精选76导出 Markdown

InMind 基准揭示智能体记忆系统的隐式关联盲点

2026-07-27 08:00·2天前
阅读原文· arxiv.org
精选理由

这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。

AI 摘要

研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。

正文 · AI 翻译
摘要:长期记忆系统将用户说过的话存储于外部存储器中,并在相关查询到来时进行检索。这一交互界面基于一个看似理所当然、以至于很少被明确陈述的假设:所需的记忆必然与需要它的查询相似。世界知识打破了这一假设。对坚果过敏这一事实,应当通过杏仁粉这一成分来改变对马卡龙请求的回答,然而这两段文本之间并不存在任何检索器能够识别的线索。我们将这种失败模式称为“隐式关联盲点”,并提出了 InMind——一个包含 125 项任务、经专家验证的基准测试,涵盖十个生活领域,其中 113 项任务基于可引用的公开来源。其配对控制实验将现有评估中混淆的三种解释区分开来:事实从未被存储、模型缺乏桥接知识、或者事实已被存储但从未被呈现。结论是清晰的。当决定性的记忆被置于上下文中时,骨干模型能回答 84.0% 的间接查询;而当同样的记忆需要被检索时,六种向量、图及智能体记忆系统最多只能达到 14.4%,尽管它们在按需回忆相同事实时准确率高达 100%。将嵌入向量的维度提升八倍,虽然提高了每个系统在答案盲测中的目标召回率,但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针,能够恢复大部分差距,从而将失败定位在查询条件化的交互界面本身,并指出路由——即决定哪些事实必须保持可见——是 InMind 旨在评分的开放性问题。
学科分类: 计算与语言(cs.CL)
引用方式: arXiv:2607.24368 [cs.CL]
  (或本版本:arXiv:2607.24368v1 [cs.CL])
  https://doi.org/10.48550/arXiv.2607.24368
arXiv 发布的 DOI 通过 DataCite 获取(注册中)

提交历史

来自:Ruizhe Li [

2026 年 7 月 27 日星期一 12:42:12 UTC(1,196 KB)

访问论文:

license icon

当前浏览上下文:

参考文献与引用

书签

BibSonomy Reddit

书目与引用工具

与本文相关的代码、数据与媒体

演示

推荐与搜索工具

arXivLabs:与社区合作者的实验项目

智能体arXiv检索增强论文/研究
阅读原文导出 Markdown
智能体arXiv检索增强论文/研究
阅读原文arxiv.org