# BM25 在大规模语料中胜出：检索增强生成范式的规模扩展研究

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-30 08:00
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms8epxbt0auqrot06452whxb
- 原文链接：https://arxiv.org/abs/2607.26497

## 精选理由

这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比，发现数据规模越大，BM25越强，这很反直觉，做RAG应用的选型逻辑可能要变。

## AI 摘要

一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式，发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先，但约1000万语料token时BM25反超并在所有更大层级保持领先，全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

## 正文

检索增强生成（RAG）涵盖词法检索与稠密检索、基于图的索引以及智能体搜索，但这些范式通常是在单一语料库规模下、基于不同基准进行评测的，导致其准确率与成本之间的权衡关系尚不清晰。为弥合这一空白，我们开展了一项受控研究：在保持问题不变、并固定一组相关文档与对抗性文档作为基石语料的前提下，将语料库规模沿 28 个严格嵌套的层级进行变化，跨度约为 450 倍。在统一的阅读器模型与统一的评判协议下，我们测算了官方准确率、构建与查询 token 数以及延迟。结果表明，存在一个随规模变化的交叉点，而非某个无条件胜出的方案。文件系统智能体（File-System Agent）在最小的共享层级上领先，但其顺序式探索在基石语料上消耗的查询 token 多达 39 倍，且随着搜索空间扩大，其效果逐渐下降。当语料库 token 数达到约 1000 万时，BM25 反超并在此后所有更大的共享层级上保持领先，在完整规模下优势接近 20 个百分点。BM25 还锚定了帕累托前沿的低成本端，且无需基于 LLM 的构建过程。稠密检索依然高效但准确率较低；基于图的 RAG 在部署规模之前便遭遇构建瓶颈，其可扩展变体在共享层级上仍低于 BM25。总体而言，语料库规模的增长越来越有利于全局候选排序：词法检索是最强的可扩展默认方案，而智能体推理在排序发现之后发挥作用效果最佳，而非取代排序发现。
