大多数搜索智能体都是基于不断增长的对话记录作为策略进行训练的。模型需要决定如何搜索,还必须记住自己看到了什么、哪些证据是重要的、以及哪些主张已经核实过。来自伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校和 Chroma 的研究团队认为,这要求过高。强化学习最终会同时优化搜索决策和常规记录管理。
他们的答案是 Harness-1,一个基于 gpt-oss-20b 构建的 200 亿参数检索子智能体。它在一个有状态的搜索框架内通过强化学习进行训练。该框架负责记录管理,而策略则保留语义决策。模型权重和框架代码均已公开发布。

Harness-1 究竟是什么
Harness-1 为下游的答案生成模型生成一组排序后的文档。它本身不回答问题。它运行在一个基于每次任务 WORKINGMEMORY(工作记忆)的状态机框架内。
每一轮都以循环方式工作。框架会呈现紧凑的搜索状态以及最近的操作。模型输出一个结构化操作。框架执行该操作,更新状态,并呈现下一个观测结果。
有状态框架:从策略中移出的内容
研究团队将其原则称为有状态认知卸载。策略决定搜索什么、整理什么、验证什么,以及何时停止。框架则维护围绕这些决策的可恢复状态。
该状态包含几个部分。一个候选池存放压缩并去重后的文档。一个带有重要性标签的整理集是最终输出,上限为 30 个文档。标签有四个取值:very_high(非常高)、high(高)、fair(一般)或 low(低)。一个全文存储库将每个检索到的文本块保存在提示词之外。
一个证据图增加了结构。一个正则表达式提取器扫描每个文本块,提取专有名词、年份和日期。然后,框架会呈现频繁出现的实体、桥梁文档和孤立文档。桥梁文档包含两个或更多频繁出现的实体。孤立文档仅出现在一篇文档中,暗示了后续的追踪线索。
该策略通过八个工具实现,分别是:fan_out_search、search_corpus、grep_corpus、read_document、review_docs、curate、verify 和 end_search。搜索结果通过 sentence-BM25 进行压缩,保留得分最高的四个句子。两级去重机制根据分块 ID 和内容指纹去除重复项。
一个设计思路解决了冷启动问题。首次成功搜索会自动将八个经重排序的结果以公平重要性权重注入精选集。随后,策略会提升优质文档并移除低质文档。这便将任务从"从零构建"转变为"优化调整"。
研究团队提出了可训练框架的三个必要条件:热启动精选、紧凑的派生状态渲染,以及保持多样性的激励机制。Harness-1 实现了全部三个条件。
训练方法
训练过程与框架采用相同的划分方式。监督微调教会模型操作接口,强化学习则优化模型在维护状态下的搜索决策。
单个教师模型 GPT-5.4 在完整框架内实时运行。经过筛选后,共保留 899 条轨迹用于 SFT。模型使用秩为 32 的 LoRA 训练三个周期。第 550 步的检查点用于初始化 RL。
强化学习采用基于策略的 CISPO 算法,设置 40 轮上限且仅在终止时给予奖励。训练仅针对 SEC 查询进行。奖励相同的分组会从梯度计算中剔除。训练在 Tinker 平台上完成。
奖励机制将发现与选择分开评估,并额外增加了工具多样性奖励。如果没有该奖励,智能体会陷入重复搜索,精选召回率将停滞在 0.53 附近。加入奖励后,多样性趋于稳定,召回率提升至约 0.60。
基准测试案例
Harness-1 在涵盖网络、金融、专利和多跳问答的八个基准上进行了评估。主要指标是精选召回率:最终集合中相关文档的覆盖率。轨迹召回率则统计整个回合中任何位置出现的证据。
| 模型 | 类型 | 平均精选召回率 | 平均轨迹召回率 |
|---|---|---|---|
| Harness-1 (20B) | 开源小模型 | 0.730 | 0.807 |
| 通义千问 DeepResearch 30B | 开源小模型 | 0.616 | 0.673 |
| Context-1 (20B) | 开源小模型 | 0.603 | 0.756 |
| Search-R1 (32B) | 开源小模型 | 0.289 | 0.289 |
| GPT-OSS-20B | 开源小模型 | 0.262 | 0.590 |
| Qwen3 (32B) | 开源小模型 | 0.216 | 0.446 |
| Opus-4.6 | 前沿模型 | 0.764 | 0.794 |
| GPT-5.4 | 前沿模型 | 0.709 | 0.752 |
| Sonnet-4.6 | 前沿 | 0.688 | 0.725 |
| Kimi-K2.5 | 前沿 | 0.647 | 0.794 |
| GPT-OSS-120B | 前沿 | 0.496 | 0.769 |
Harness-1 达到了 0.730 的平均精选召回率。这比下一个领先的开源子智能体——通义千问 DeepResearch 30B——高出 11.4 个点。在测试过的前沿搜索器中,只有 Opus-4.6 的平均得分更高。
迁移模式是该机制最清晰的信号。SFT 使用了四个基准测试族;RL 仅使用了 SEC。在这些源族任务上,Harness-1 比最接近的开源基线高出 7.9 个点。在四个保留基准测试上,它高出 17.0 个点。这意味着在距离训练数据最远的任务上,性能提升幅度是前者的 2.2 倍。
消融实验支持了该框架的有效性。在 BrowseComp+ 上,禁用所有框架机制会导致召回率相对下降 12.2%。经过训练的策略仍然会进行搜索,但无法对其看到的内容进行排序。

使用场景
该方法针对的是需要文档来支撑答案的证据检索场景。以下几种工作流程符合这种形态。
其一是文献与专利审查。证据图和精选集有助于组织大量来源。其二是财务申报文件分析。SEC 案例研究展示了如何在多份 8-K 表格中恢复出准确的高管交接日期。
其三是多跳事实核查。fan_out_search 和 verify 工具能在最终确认前解析模糊的实体。其四是模块化 RAG。精选集为冻结的生成器提供输入,更好的精选集能带来更高的答案准确率。
优势与不足
优势
- 在测试过的开源模型中,平均精选召回率最高,总体仅次于 Opus-4.6。
- 在保留基准测试上性能依然保持领先,表明其具备领域通用的搜索操作能力。
- 仅使用 4,352 个独立项目进行训练,远少于多个基线模型。
- 提供开源模型检查点和框架代码,可使用常见运行时进行服务部署。
不足
- 证据图使用正则表达式提取,而非完整的实体链接。
- verify 工具是一个大语言模型代理,在处理模糊声明时可能出错。
- Sentence-BM25 压缩可能会丢失与语篇结构相关的上下文信息。
- 研究团队报告的是点估计值,未提供完整的置信区间。
关键要点
- Harness-1 是一个 200 亿参数的搜索智能体,它将搜索记账工作转移到环境中,让策略层专注于语义决策。
- 它在八个基准测试上达到了 0.730 的平均精选召回率,比排名第二的开源子智能体高出 11.4 个百分点。
- 在所有被测试的搜索器中,只有 Opus-4.6 在平均精选召回率上得分更高。
- 在保留基准测试上的提升最为显著(+17.0 对比 +7.9 个百分点),这表明学到的搜索操作具有迁移能力。
- 模型权重和 Harness 代码均已公开,可通过 vLLM、SGLang 或 Transformers 提供服务。
Marktechpost 的可视化讲解
有状态搜索智能体
研究指南
Harness-1:一个配备有状态 Harness 的 200 亿参数搜索智能体
一个在搜索 Harness 内部通过强化学习训练的检索子智能体,该 Harness 负责持有记账信息。
200 亿参数 · gpt-oss-20b 基座模型
伊利诺伊大学厄巴纳-香槟分校 · 加州大学伯克利分校 · Chroma
arXiv:2606.02373
开放权重与代码
核心思想
将工作拆分给策略层和 Harness
大多数搜索智能体将搜索决策和常规记账工作打包进一个不断增长的对话记录中。Harness-1 将两者分离。论文将此称为有状态认知卸载。
策略层决定
- 搜索什么
- 保留哪些文档
- 验证哪些主张
- 何时停止
Harness 维护
- 候选池
- 精选证据
- 验证记录
- 上下文预算
Harness 内部
环境端工作记忆
- 候选池——经过压缩和去重的文档
- 精选集——带有重要性标签,上限为 30 个(非常高 / 高 / 一般 / 低)
- 证据图——通过正则表达式提取的实体、桥梁和孤立点
- 验证缓存——从主张到文档再到是/否判定
- 全文存储——每个检索到的片段都保存在提示词之外
- 压缩——sentence-BM25 保留得分最高的四个句子
策略动作
八个工具用于编辑状态
fan_out_search
search_corpus
grep_corpus
read_document
review_docs
curate
verify
end_search
首次成功搜索会自动将八个重排序后的文档以“一般”重要性种子化到精选集中。随后,策略层会提升强文档的优先级并移除弱文档。
训练
通过监督微调学习操作界面,通过强化学习学习搜索
监督微调:
使用 Harness 内部的 GPT-5.4 教师模型 · 899 条轨迹 · LoRA 秩为 32 · 第 550 步检查点
强化学习:
在策略 CISPO · 仅使用 SEC 查询 · 40 轮上限 · 终端奖励 · 在 Tinker 上训练
数据规模:
4,352 个独立训练项(899 个 SFT + 3,453 个 RL)
三项可训练性要求:热启动策展、紧凑的派生状态渲染,以及保持多样性的激励机制。
结果
数据所揭示的
平均策展召回率
在八个基准测试上
+11.4 个百分点
超过排名第二的开源子智能体——通义千问 DeepResearch 30B
在测试过的搜索器中,只有
Opus-4.6
平均得分更高
迁移能力:
在保留数据集上 vs
在源模型族上(2.2 倍差距)
消融实验:移除所有调控机制后,召回率
相对下降
自行运行
服务部署:
vLLM、SGLang 或 Transformers
模型检查点:
pat-jj/harness-1(Hugging Face,210 亿参数,BF16)
代码:
github.com/pat-jj/harness-1
论文:
arXiv:2606.02373
Harness-1 为下游的问答模型返回一组经过策展的文档。它本身不回答问题。
由以下机构策展
— 面向工程师的、以实践者优先的 AI/ML 研究、新闻及开发工具。