# Mistral 推出 Agentic Search：多步检索提升 AI 系统复杂文档查询准确率

- 来源：Mistral AI：News（网页）
- 发布时间：2026-08-21 00:02
- AIHOT 分数：67
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmt1pkwbj04bxroovzkfca5c7
- 原文链接：https://mistral.ai/news/agentic-search

## 精选理由

相比一次性 RAG，五个检索工具让模型按需查证、打开和阅读原文，精度从 26.7% 升到 86%，说明检索质量开始取决于模型推理而非分块策略。

## AI 摘要

Mistral 发布 Agentic Search，通过 search、open、navigate、read、grep 五工具的多步检索循环，让模型在长文档与多来源中查找、定位并验证信息。

## 正文

Mistral Agentic Search 帮助企业从其 AI 系统中获得更好的结果，它让模型能够搜索并浏览企业最复杂的数据和文档。Agentic Search 引入了一个多步骤检索循环，用于跨数据源查找、检查和验证信息，无论数据存储在哪里。Agentic Search 通过 Mistral Search Toolkit 提供，内置于 Studio 和 Vibe 的 Libraries 中，并为你提供：

对敏感领域特定数据的支持。Mistral 的可移植、开放工具帮助你在不跨越隔离边界的情况下释放数据价值，无论是在云端还是本地部署。

**改进的搜索结果。** 你的模型可以搜索和浏览数据，而不仅仅是检索片段——无论是长篇密集文档内部，还是跨多个数据源。

访问现有索引。Agentic Search 基于你现有的搜索索引构建，使用五个工具：search、open、navigate、read 和 grep。

更高的准确性。Agentic Search 在金融申报文件上实现了高达 3 倍的准确性提升，从 26.7% 提升到 86%（基于 FinanceBench）。在 OfficeQA Pro 基准测试中，针对表格密集、多文档问题，我们测得 +45.6 个百分点的提升（从 6.3% 提升到 51.9%）。

更低的延迟和 token 消耗。定向导航使 Agentic Search 能够将 p90 延迟降低高达 39.6%。更少的重复搜索可将 token 消耗减少多达三分之一。

数据创造竞争优势

竞争优势建立在多年的实际运营之上——你的数据、你的流程、你的领域专长。专有知识既对你的成功至关重要，又高度机密，因此它存在于隔离边界、分段部署和自托管平台之后。它积累在金融申报文件、法律合同、内部资源和政府记录中——这些长篇密集文档是传统搜索方法无法有效浏览的。

能够持续学习和改进的智能体可以帮助你累积竞争优势，但这些智能体往往出于安全原因与机密数据和专有知识隔离。要从 AI 中获得真正的影响力，需要将前沿推理与能够安全触达你最敏感材料的检索工具相结合。

传统 RAG 的不足

传统的一次性 RAG 会检索一组固定的文本块，并要求模型一次性完成回答。当答案恰好出现在排名靠前的结果中时，这种方式是有效的；但当模型需要浏览长篇报告、追踪引用、对比多份文档或核实底层证据时，它就会力不从心。

在数据密集、结构复杂的文档上，这一局限更加明显。回答问题所需的信息可能分散在多份文档中，或深藏于某个表格、脚注或条款里。基于一次性 RAG 的搜索之所以无法充分发挥前沿 AI 的全部能力、无法提供可靠答案，原因有三：

**只检索、不推理：** 模型必须根据初次检索选中的文本块来作答，即使这些文本块不完整或并不相关。它无法在作答前自行判断需要换一份文档、看另一个章节或获取更多上下文，这限制了模型推理能力的发挥空间。

**受限于文本块粒度：** 关键数据往往存在于复杂的多模态文档中。当被问到“该公司第三季度的实际税率是多少？”时，索引系统或许能找到正确的文档，但无法打开它、定位到表格、阅读周边上下文或核实答案。

**无法迭代：** 许多问题需要不止一轮检索才能得到正确答案。模型可能需要优化搜索策略、查看一份有希望的文档、追踪引用、对比多个来源、记录已看过的内容，并在初次结果不足时尝试新的路径。一次性 RAG 无法支持这些后续步骤。

无 Agentic Search（一次性检索）

仅使用 1953 年所有单个日历月报告的数值，美国国防及相关活动支出（以百万名义美元计）的这些数值总和是多少？

轨迹 1 tool_call（仅搜索）

search("national defense expenditures monthly 1953") → 10 条结果：零散的月度公报（表 3），均按财年口径编制，仅覆盖 1953 年的一部分。

我找到了 1953 年 1 月至 6 月的数据。但要计算出答案，我还需要 1953 年 7 月至 12 月的月度数值。

使用 Agentic Search

仅使用1953年所有单个日历月份的已报告数值，美国国防及相关活动支出的这些数值总和是多少（以百万名义美元计）？

轨迹3 工具调用（2次搜索 → 读取）

搜索（“1953年国防支出月度数据”）→ 逐月公报（部分年份）

搜索（“…1953年11月12月 1954年至今”）→ 找到 treasury_bulletin_1954_02.pdf 第15页（表3，包含1953年全部12个月）

读取（treasury_bulletin_1954_02.pdf，第15页）→ 提取完整表3

1953年月度数值

表3，单位：百万美元

1月 2月 3月 4月 5月 6月 7月 8月 9月 10月 11月 12月

3,632 3,501 3,789 3,891 3,746 4,056 3,890 3,519 3,787 3,647 3,540 3,465

总和 = 44,463。

智能体搜索（Agentic Search）的工作原理

Mistral 搜索工具包提供开放模块，用于在云端或本地摄取、嵌入和索引关键且复杂的数据。智能体搜索在此索引基础上，为模型提供五个类似于常见文件系统操作的工具：

搜索（search）使用现有索引在整个语料库中查找相关文档。

打开（open）打开特定文档。

导航（navigate）移动到文档中的某一页、某一节或某一区域。

读取（read）检索该位置的内容。

grep 在已打开的文档中查找特定模式。

模型不是仅根据初始 top-k 结果作答，而是可以检查找到的内容、优化搜索、打开相关文档、导航到特定章节，并在回答前阅读原始材料。索引负责识别可能的来源；智能体搜索决定在来源内部及跨来源检查哪些内容。

一次性 RAG

智能体搜索

这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面变得更好，检索质量也会随之提升，而无需更改基础设施。这是一个关键特性：检索质量随模型能力扩展，而不是受限于你的分块策略。

智能体搜索适用于

长文档。申报文件、合同、手册、技术规范和报告中，答案可能出现在某一特定页面或某个特定表格、条款、图表或脚注中。

跨多个来源的问题。需要模型在得出答案之前，从多份文档中查找、比较或核对证据的研究任务。

必须经过核实的答案。财务数据、法律条款、监管引用和运营数据，这些内容的回答需要能够定位到稳定且具体的文档位置进行引用。

表格和结构化文档。财务报表、政府记录和扫描版 PDF，这些内容的含义取决于行、列、页面位置或周围上下文——而不仅仅是叙述性文本。

索引检索是以下场景的正确起点：

直接查找。简短、清晰的文档，答案很可能出现在最先检索到的几个片段之一中。

高量级搜索。需要返回相关段落而无需对其推理或浏览的关键词或语义查找。

简单、可预测的问题。答案的可能来源和位置事先已知，额外的检索步骤不太可能改善结果的用例。

一次性 RAG 通常足以应对这些搜索。当问题要求模型超越初始结果、深入调查源材料时，再添加智能体搜索。在两种情况下，配置良好的索引仍然是正确的基础。

更相关的结果，更快的速度

我们使用开箱即用的 Mistral 搜索工具包（默认分块、默认排序、无调优），在两个行业标准评测上对智能体搜索进行了基准测试。这些结果是下限而非上限，意味着你可以通过针对特定用例的调优进一步提升结果质量。

在这些基准测试中，我们使用 Mistral 搜索工具包测试了两个模型：Mistral Medium 3.5（MM 3.5）和 Z.ai GLM-5.2（GLM-5.2），展示了较小模型（MM 3.5）和较大模型（GLM-5.2）的性能表现。

基准测试结果一致：智能体循环带来了实质性的质量提升，导航工具在减少浪费的 token、轮次和延迟的同时提高了准确性。我们在第一方和第三方模型上观察到相同的性能模式，这表明智能体搜索与模型无关，搜索质量应随新模型的推出而提升。

FinanceBench：368 份 SEC 文件，150 个问题

FinanceBench（Islam 等人，2023）测试基于 368 份 SEC 文件（10-K / 10-Q / 8-K）的金融问答能力，每份文件平均约 147 页，总计约 53,900 页：这些是篇幅长、表格密集的金融文档。答案由经过人工标注校准的 LLM 评判器评分。

Mistral Medium 3.5

GLM 5.2

我们发现：

仅搜索的智能体循环是最大的质量杠杆。从一次性 RAG 转向仅搜索循环，MM 3.5 的准确率提升 +47.3 个百分点，GLM-5.2 提升 +52.6 个百分点——两个模型均提升约 3 倍。由于模型可以迭代搜索，它们能从较弱的首次结果中恢复，优化查询，并将索引作为主动工具使用。

导航功能提升准确率。加入 open、navigate、read 和 grep 后准确率再次提升（MM 3.5 提升 +8.7 个百分点，GLM-5.2 提升 +6.7 个百分点）。这意味着在复杂文档中，有针对性的下钻搜索优于重复的宽泛搜索。

更好的检索工具能提升 token 和性能效率。带导航功能的完整循环在回答更多问题正确的同时，比仅搜索循环使用更少的 token（MM 3.5：token 使用量减少 -23.9%，GLM-5.2 减少 -33.7%）。检索工具并非额外开销——它们用精准导航取代了浪费的搜索重试。

延迟在关键环节显著下降。在整个 FinanceBench 上，加入导航检索工具改善了延迟：p90 从 255 秒降至 154 秒，平均延迟从 108 秒降至 71 秒。总体来看，我们看到仅搜索循环会进行重复的宽泛搜索，而导航帮助模型更快地定位证据。

OfficeQA Pro：696 份财政部公报，133 个问题

OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准：扫描版、表格密集的政府金融 PDF，语料库包含 696 份文档、约 89,000 页。我们报告了 133 个问题的“专业版”子集的首次测试结果。

Mistral Medium 3.5

GLM 5.2

我们发现：

智能体搜索以及智能体循环 + 导航在更难、可验证的基准上表现成功。OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查询。即使在这样的场景下，完整的智能体循环也能显著提升一次性 RAG 的准确率，GLM-5.2 达到 51.9%（+45.6 个百分点），MM 3.5 提升 +27.1 个百分点。

导航功能在降低资源消耗的同时提升了质量。使用完整闭环（智能体闭环 + 导航）可将准确率提升高达 35.6%（**+7.5 个百分点，**MM 3.5；+8.3 个百分点，19.0% GLM-5.2），同时减少 token 消耗。轮次最多可减少 7.0%（MM 3.5，GLM-5.2 为 2.3%）。

基准测试难度越高，检索闭环就越重要。OfficeQA Pro 围绕扫描件和表格密集型文档中的数字答案构建。单次 RAG 几乎无法启动，而智能体闭环则允许模型迭代搜索、检查证据，并带来显著的准确率提升。

**工具链栈对文档智能和搜索性能产生重大影响。**根据 Kimi 的研究，GLM-5.2 在 Claude Code 工具链下于 OfficeQA Pro 上得分 41.4%，而在 Mistral 工具链下得分 51.9%——同一底层模型上相差 +10.5 个百分点。

快速上手

在文档中了解更多关于 Agentic Search 的信息。您可以通过以下任一方式在云端和本地部署中开始使用：

Mistral Search Toolkit。将 Agentic Search 集成到您自己的智能体、工作流和客户部署中。

库。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search，无需自行构建检索系统。

测试 Search Toolkit 最快的方式是使用 Search Starter App。它使用默认配置为您的自有语料库创建本地索引，因此您无需成为搜索专家即可试用 Agentic Search。当您准备好配置自己的用例时，您可以：

设置数据摄取。为您的数据和文件类型选择解析器、分块策略、嵌入向量模型和提取器。

调优索引和排序。管理 Vespa schema、索引行为和相关性配置。

扩展检索。在搜索管道中添加查询重写、重排序或混合检索。
