HuggingFace Daily Papers(社区热门论文)
精选
76AI 编辑部评分,满分 100

OpenSeeker-v2:利用高信息量、高难度轨迹突破搜索智能体的极限

2026-05-05 08:00· 92天前
AI 导读

本研究提出了一种仅通过监督微调(SFT)训练前沿搜索智能体的高效方法。该方法基于三项关键数据合成改进:扩展知识图谱规模、增加工具集以及进行严格的低步数过滤。仅使用1.06万条数据训练的OpenSeeker-v2,在四个基准测试中均取得了领先性能,全面超越了采用复杂CPT+SFT+RL流程训练的同类模型。这是首个由纯学术团队仅通过SFT实现的、在同等模型规模与范式下的顶尖搜索智能体,其模型权重将开源以促进社区研究。

推荐理由

纯学术团队仅靠SFT和一万条数据,就在多个搜索基准上反超工业级管线,并且开源模型。这证明高质量数据比烧钱RL更关键,做Agent的朋友值得认真看。

正文 · AI 翻译

杜宇文

叶睿

唐硕

黄科端

朱新宇

蔡宇柱

陈思衡

上海交通大学,

同等核心贡献,

项目负责人

通讯作者:yr991129@sjtu.edu.cn,sihengc@sjtu.edu.cn

摘要

深度搜索能力已成为前沿大语言模型智能体不可或缺的技能,但其开发仍由行业巨头主导。典型的行业方案涉及一个资源高度密集的流程,涵盖预训练、持续预训练、监督微调和强化学习。在本报告中,我们表明,当使用信息丰富且高难度的轨迹数据时,简单的监督微调方法在训练前沿搜索智能体方面可能出人意料地强大。通过引入三种简单的数据合成改进:扩展知识图谱规模以实现更丰富的探索、扩大工具集规模以实现更广泛的功能,以及严格的低步数过滤,我们建立了一个更强的基线。我们的 OpenSeeker-v2 仅使用 10600 个数据点进行训练,就在 4 个基准测试(采用 ReAct 范式的 300 亿参数规模智能体)上取得了最先进的性能:在 BrowseComp 上达到 46.0%,在 BrowseComp-ZH 上达到 58.1%,在 Humanity’s Last Exam 上达到 34.6%,在 xbench 上达到 78.0%,甚至超越了使用大量持续预训练、监督微调和强化学习流程训练的 Tongyi DeepResearch,后者分别取得了 43.4%、46.7%、32.9% 和 75.0% 的成绩。值得注意的是,OpenSeeker-v2 代表了在其模型规模和范式下,首个由纯学术团队仅使用监督微调开发的最先进搜索智能体。我们很高兴能够开源 OpenSeeker-v2 模型权重,并分享我们简单而有效的发现,使前沿搜索智能体研究对社区更加可及。

代码 https://github.com/PolarSeeker/OpenSeeker
模型 https://huggingface.co/PolarSeeker/OpenSeeker-v2-30B-SFT
Refer to caption
图 1:OpenSeeker-v2 在四个代表性基准测试中,在其模型规模和范式内取得了最先进的性能,值得注意的是,这是通过简单的监督微调实现的,并且优于通过大量持续预训练、监督微调和强化学习训练的 Tongyi DeepResearch。

1 引言

在信息爆炸的时代,深度搜索已成为前沿大语言模型智能体不可或缺的核心能力(OpenAI,2025a)。然而,这些高性能智能体的开发长期以来一直是资金充裕的企业实体近乎垄断的“闭门游戏”(OpenAI,2025b;Anthropic,2025)。行业实现最先进性能的典型方案高度依赖资源投入,通常包括在海量语料上进行持续预训练(Team 等,2025b,2026;Chu 等,2026),随后进行监督微调(Ye 等,2025),最后进入复杂的强化学习阶段(Li 等,2025)。这种对庞大算力和专有数据管线的严重依赖,筑起了一道巨大的壁垒,从根本上阻碍了学术界和开源社区在该领域的创新。

我们挑战这种普遍依赖复杂多阶段训练管线的做法。基于我们在 OpenSeeker(Du 等,2026)中的初步探索,我们将关注点完全重新聚焦于训练轨迹本身的质量,并提出一个关键问题:我们能否仅通过一种直接的监督微调方法,来突破搜索智能体的性能极限,并媲美重工业级管线的表现?

在本报告中,我们介绍了 OpenSeeker-v2,一款升级版搜索智能体。它证明了一个简单的 SFT 方法,只要以高质量、高难度且丰富的数据为燃料,就能展现出足够强大的能力。具体而言,我们为数据合成流程引入了两项简单但高效的改进:(1) 扩展图规模以丰富探索路径:我们在数据生成过程中显著扩大了拓扑图的规模。这一扩展为上下文注入了更丰富、更多样化的源信息,从而能够合成结构上要求进行深度、多跳探索才能解决的复杂任务。(2) 扩充工具集以拓展功能范围:我们增加了可用工具的数量,使智能体能够学习更多样化的策略,并处理更广泛的查询。(3) 严格低步数过滤:我们过滤掉任何只需极少工具调用步骤就能解决的轨迹。通过有意剔除这些简单查询,我们确保了训练集具有严格的最低难度门槛,迫使智能体学习在长程任务中进行持续的推理和信息搜寻。

通过应用这两项策略,我们精心整理了一个高度浓缩的数据集,仅包含 1 万条高难度轨迹。引人注目的是,仅通过一次 SFT 训练,在这个小数据集上训练一个 300 亿参数的模型就取得了惊人的结果。OpenSeeker-v2 在四个具有代表性的智能体基准测试中达到了新的 SOTA¹:在 BrowseComp 上为 46.0%,在 BrowseComp-ZH 上为 58.1%,在 Humanity’s Last Exam 上为 34.6%,在 xbench 上为 78.0%。值得注意的是,这个简单的 SFT 基线明确超越了诸如通义千问深度研究(Tongyi DeepResearch)等知名工业模型,后者依赖于复杂的 CPT+SFT+RL 流程,在这四项基准上的成绩分别为 43.4%、46.7%、32.9% 和 75.0%。

最终,OpenSeeker-v2 代表了在其模型规模和范式(ReAct)下,首个完全由纯学术团队仅使用 SFT 开发的最先进搜索智能体。为了推动前沿搜索智能体研究的普及,并为社区提供一个易于复现的基线,我们很高兴完全开源 OpenSeeker-v2 的模型权重。

2 方法与结果

2.1 方法

我们介绍 OpenSeeker-v2,一个基于监督微调(SFT)的升级版搜索智能体训练框架。我们的核心假设是,给定足够困难且信息丰富的训练数据,一个直接的 SFT 目标就足以激发强大的长程搜索和推理能力。

扩展图规模以实现更丰富的探索。设 为用于任务合成的源图。对于每个种子节点 ,原始流程会在 周围构建一个局部子图。在 OpenSeeker-v2 中,我们将扩展预算从 增加到 ,其中 ,从而获得一个更大的证据子图:

扩大的子图包含更丰富的拓扑相关来源集,这增加了可行推理路径的数量和多样性。随后,基于这个扩展的上下文生成一个合成查询:

通过扩展 ,生成的问题更可能需要跨多个节点进行证据聚合,而不是依赖少数几个来源。

扩展工具集以实现更广泛的功能。给定一个生成的问题 ,我们为搜索智能体配备一个比 OpenSeeker-v1(Du 等人,2026)中使用的更大的扩展工具集(遵循 Team 等人,2026),并让它生成一个多步骤的 ReAct 风格轨迹:

其中每个动作 对应一个从扩展工具集中选择的工具调用, 表示被调用工具返回的观察结果。 表示每个动作之前的推理轨迹。该轨迹由 个工具调用步骤组成,随后是一个最终推理步骤和答案 。通过扩展 ,智能体被鼓励学习更多样化的交互模式并利用互补工具,从而产生更灵活、功能更丰富的问题解决行为。

严格低步数过滤。为移除过于简单的实例,我们应用了严格的低步数过滤规则:

此处, 是预定义的最小工具调用阈值。轨迹中 的实例会被丢弃,因为它们通常可通过直接查找或浅层关键词匹配解决。

最后,OpenSeeker-v2 在过滤后的数据集上,使用标准 SFT 目标训练搜索智能体。

扩展后的图结构增加了上下文丰富度和多跳依赖关系,而低步数过滤则设定了最低难度门槛。这两项修改共同产生了高质量的 SFT 数据,促使智能体学习持续推理、稳健的信息提取以及长周期搜索行为。

2.2 实验设置

实现。我们基于 Qwen3-30B-A3B-Thinking-2507 (Team, 2025) 实例化 OpenSeeker-v2,该模型总参数量为 30B,推理时激活参数量为 3B。智能体使用 256k 上下文窗口,并允许每条轨迹最多进行 200 次工具调用。OpenSeeker-v2 通过 SFT 训练,未使用 RL 或额外的超参数调优。

评测基准。我们在五个具有挑战性的智能体评测基准上评估 OpenSeeker-v2:BrowseComp (Wei et al., 2025)、BrowseComp-ZH (Zhou et al., 2025)、Humanity’s Last Exam (HLE) (Phan et al., 2025) 和 xbench-DeepSearch (Xbench-Team, 2025)。这些基准涵盖了多样化的深度研究任务。在调用网络搜索工具时,我们会屏蔽与 HuggingFace 相关的链接以避免潜在的数据泄露。

基线模型。我们在表 1 中将 OpenSeeker-v2 与代表性系统进行比较,主要关注同等规模的基于 ReAct 的搜索智能体。通义千问 DeepResearch (Team et al., 2025b) 和 RedSearcher (Chu et al., 2026) 是强大的 30B 规模搜索智能体,通过更重的 CPT+SFT+RL 流程训练。它们为评估我们仅使用 SFT 的方法能否与资源更密集的训练方案相抗衡提供了直接参考。为完整起见,我们还包括闭源专有模型 (Anthropic, 2025; OpenAI, 2025b, a; Singh et al., 2025) 和大型开源模型 (DeepSeek-AI et al., 2025; Team et al., 2025a; MiniMax AI Team, 2025) 作为更广泛的参考点。基线结果取自其技术报告或公开排行榜。

2.3 主要结果

媒体内容 · 前往原文查看
表 1:我们的 OpenSeeker 与其他基于 ReAct 的搜索智能体之间的比较。‘# Samples’ 表示总训练数据样本数量;‘Training’ 表示训练技术(CPT:持续预训练,SFT:监督微调,RL:强化学习);‘Academic’ 表示是否由纯学术团队完成(:是,:否);‘BC-ZH’ 表示 BrowseComp-ZH。值得注意的是,仅通过简单的 SFT,OpenSeeker-v2-30B-SFT 就持续优于那些使用包含 CPT、SFT 和 RL 的更复杂流程训练的同等规模模型。OpenSeeker-v2 全面优于同等规模的纯 ReAct 模型。
模型名称 # 样本数 训练方式 学术团队 BrowseComp BC-ZH HLE xbench
闭源专有模型
Claude-4-Opus ? ? 18.8 37.4 - -
Claude-4.5-Sonnet ? ? 24.1 42.4 32.0 -
Gemini-3-pro ? ? 37.8 66.8 45.8 -
OpenAI-o3 ? ? 49.1 68.7 20.2 65.0
OpenAI Deep Research ? ? 51.5 42.9 26.6 -
GPT-5-High ? ? 54.9 63.0 41.7 -
开源模型 > 30B
DeepSeek-V3.1-671B ? ? 30.0 49.2 29.8 71.2
DeepSeek-V3.2-671B ? ? 51.4 65.0 40.8 -
GLM-4.6-357B ? ? 45.1 49.5 30.4 -
GLM-4.7-357B ? ? 52.0 66.6 42.8 -
Minimax-M2-230B ? ? 44.0 48.5 - -
30B 模型
WebSailor-V2-30B-SFT ? SFT 24.4 28.3 23.9 61.7
WebSailor-V2-30B-RL ? SFT + RL 35.3 44.1 30.6 73.7
WebLeaper-30B-SFT 15 k SFT 27.7 - - 66.0
WebLeaper-30B-RL ? RL 38.8 - - 72.0
通义千问 DeepResearch ? CPT + SFT + RL 43.4 46.7 32.9 75.0
RedSearcher-30B ? CPT + SFT + RL 42.1 49.8 34.3 -
OpenSeeker-v1-30B-SFT 11.7 k SFT 29.5 48.4 - 74.0
OpenSeeker-v2-30B-SFT 10.6 k SFT 46.0 58.1 34.6 78.0

超越采用更重管线训练的同规模智能体。OpenSeeker-v2 背后的核心问题是,简单的 SFT 能否突破搜索智能体的极限,并与更重的工业级管线相抗衡。如表 1 所示,OpenSeeker-v2-30B-SFT 在仅使用 SFT 的情况下,在所有基于 ReAct 的 30B 搜索智能体中取得了最强的综合性能。OpenSeeker-v2 在 BrowseComp 上达到 46.0%,在 BrowseComp-ZH 上达到 58.1%,在 Humanity’s Last Exam 上达到 34.6%,在 xbench 上达到 78.0%。(1) 值得注意的是,通过简单的 SFT,OpenSeeker-v2 的性能超过了由阿里巴巴通义实验室开发的通义深度搜索(Team et al., 2025b)以及由小红书开发的 RedSearcher,而后者是通过广泛的 CPT+SFT+RL 管线训练的。具体来说,在具有挑战性的基准测试 BrowseComp 和 HLE 上,OpenSeeker-v2 分别至少领先这两个模型 2.6% 和 0.3%;而在 BrowseComp-ZH 和 xbench 上,OpenSeeker-v2 分别显著领先通义深度搜索 11.4% 和 3%。(2) 与更大的模型相比,OpenSeeker-v2 也超越了 DeepSeek-V3.1-671B、GLM-4.6-357B、Minimax-M2-230B、Claude-4.5-Sonnet,展示了其强大的能力。这些结果表明,当由高质量、高难度且丰富的数据驱动时,一个直接的 SFT 方法可以足够强大,这暗示数据质量可能是训练智能的长期搜索智能体的关键路径。

展示 OpenSeeker 的扩展潜力。在相同的模型规模和仅使用 SFT 的训练方案下,OpenSeeker-v2 相比 OpenSeeker-v1(Du et al., 2026)有了显著提升,突显了通过更高质量的数据构建来开发 OpenSeeker 框架的潜力。OpenSeeker-v2 将 BrowseComp 从 29.5 提升至 46.0,BrowseComp-ZH 从 48.4 提升至 58.1,xbench 从 74.0 提升至 78.0。这些提升表明,在当前 SFT 设置下,OpenSeeker 尚未达到饱和。更重要的是,它们表明,增加合成问答任务的难度和丰富度,并提升合成轨迹的整体质量,可以带来显著的能力提升,这表明可扩展的高质量数据合成是进一步推进搜索智能体的一条有前景的路径。

Refer to caption
图 2:搜索智能体训练数据中平均工具调用次数对比。

OpenSeeker-v2 展现出的数据难度高于此前同类模型。OpenSeeker-v2 基于更长的搜索轨迹构建,每条轨迹平均包含 64.67 步,而 OpenSeeker-v1 为 46.97 步,RedSearcher 为 36.01 步。这表明 OpenSeeker-v2 的训练数据需要更复杂的多步推理和更长周期的信息搜寻。我们推测,这种长且复杂的合成轨迹对于让模型获得更强的长周期检索与搜索能力至关重要,这也进一步解释了 OpenSeeker-v2 在具有挑战性的深度研究基准测试上表现更优的原因。

3 结论

在本报告中,我们分享了一个发现:当使用高质量、高难度且丰富的数据时,仅通过简单 SFT 训练的搜索智能体,其性能可与使用大量资源训练的智能体相媲美。具体而言,我们分享了在数据采集流程上的三项简单而有效的改进:扩展图规模、扩充工具集以及低步数过滤,并据此训练了最终的搜索智能体 OpenSeeker-v2。尽管仅使用 10.6k 样本进行训练,OpenSeeker-v2 在四个代表性基准测试上均取得了新的 SOTA 成绩:BrowseComp 上 46.0%,BrowseComp-ZH 上 58.1%,Humanity’s Last Exam 上 34.6%,以及 xbench 上 78.0%,显著优于通过 CPT、SFT 和 RL 进行大量训练的通义千问深度搜索和 RedSearcher。我们的报告强调了数据质量的关键作用,表明仅凭精心设计的数据就能释放出显著的性能提升。

下一步计划。我们的内部观察表明,高质量合成数据具有强大的扩展潜力。未来,我们将继续沿着这一方向推进,通过扩大数据数量、提升数据质量和增加数据多样性,旨在进一步突破搜索智能体的性能极限。

参考文献

  • Anthropic (2025) 推出 Claude 4。外部链接:链接 被引用自:§1, §2.2
  • Z. Chu, X. Wang, J. Hong, H. Fan, Y. Huang, Y. Yang, G. Xu, C. Zhao, C. Xiang, S. Hu 等人 (2026) 《REDSearcher:一种可扩展且成本高效的长期搜索智能体框架》。arXiv 预印本 arXiv:2602.14234。引用自:§1, §2.2。
  • DeepSeek-AI, A. Liu, A. Mei, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, C. Lu, C. Zhao, C. Deng, C. Xu, C. Ruan, D. Dai, D. Guo, D. Yang, D. Chen, E. Li, F. Zhou, F. Lin, F. Dai, G. Hao, G. Chen, G. Li, H. Zhang, H. Xu, H. Li, H. Liang, H. Wei, H. Zhang, H. Luo, H. Ji, H. Ding, H. Tang, H. Cao, H. Gao, H. Qu, H. Zeng 等人 (2025) 《DeepSeek-v3.2:推动开源大语言模型的前沿》。arXiv 预印本 arXiv:2512.02556。外部链接:链接,文献引用。引用自:§2.2。
  • Y. Du, R. Ye, S. Tang, X. Zhu, Y. Lu, Y. Cai 和 S. Chen (2026) 《OpenSeeker:通过完全开源训练数据实现前沿搜索智能体的民主化》。arXiv 预印本 arXiv:2603.15594。引用自:§1, §2.1, §2.3。
  • K. Li, Z. Zhang, H. Yin, R. Ye, Y. Zhao, L. Zhang, L. Ou, D. Zhang, X. Wu, J. Wu 等人 (2025) 《WebSailor-v2:通过合成数据与可扩展强化学习弥合与专有智能体之间的鸿沟》。arXiv 预印本 arXiv:2509.13305。引用自:§1。
  • MiniMax AI 团队 (2025) 《MiniMax M2 与智能体:简约中的精巧》。说明:在 Hugging Face 上开源模型权重:https://huggingface.co/MiniMaxAI/MiniMax-M2。外部链接:链接。引用自:§2.2。
  • OpenAI (2025a) 《深度研究系统卡》。外部链接:链接。引用自:§1, §2.2。
  • OpenAI (2025b) 《推出 OpenAI o3 和 o4-mini》。外部链接:链接。引用自:§1, §2.2。
  • L. Phan, A. Gatti, Z. Han, N. Li, J. Hu, H. Zhang, C. B. C. Zhang, M. Shaaban, J. Ling, S. Shi 等人 (2025) 《人类的最后考试》。arXiv 预印本 arXiv:2501.14249。引用自:§2.2。
  • A. Singh, A. Fry, A. Perelman, A. Tart, A. Ganesh, A. El-Kishky, A. McLaughlin, A. Low, A. Ostrow, A. Ananthram, A. Nathan, A. Luo, A. Helyar, A. Madry, A. Efremov, A. Spyra, A. Baker-Whitcomb, A. Beutel, A. Karpenko, A. Makelov, A. Neitz 等人 (2025) 《OpenAI GPT-5 系统卡》。arXiv 预印本 arXiv:2601.03267。外部链接:链接,文献引用。引用自:§2.2。
  • G. Team, A. Zeng, X. Lv, Q. Zheng, Z. Hou, B. Chen, C. Xie, C. Wang, D. Yin, H. Zeng, J. Zhang, K. Wang, L. Zhong, M. Liu, R. Lu, S. Cao, X. Zhang, X. Huang, Y. Wei, Y. Cheng, Y. An, Y. Niu, Y. Wen, Y. Bai, Z. Du, Z. Wang, Z. Zhu, B. Zhang, B. Wen, B. Wu, B. Xu, C. Huang, C. Zhao, C. Cai, C. Yu, C. Li, C. Ge, C. Huang, C. Zhang, C. Xu, C. Zhu, C. Li, C. Yin, D. Lin, D. Yang, D. Jiang, D. Ai, E. Zhu, F. Wang, G. Pan, G. Wang, H. Sun, H. Li, H. Li, H. Hu, H. Zhang, H. Peng, H. Tai, H. Zhang, H. Wang, H. Yang, H. Liu, H. Zhao, H. Liu, H. Yan, H. Liu, H. Chen, J. Li, J. Zhao, J. Ren, J. Jiao, J. Zhao, J. Yan, J. Wang, J. Gui, J. Zhao, J. Liu, J. Li, J. Li, J. Lu, J. Wang, J. Yuan, J. Li, J. Du, J. Du, J. Liu, J. Zhi, J. Gao, K. Wang, L. Yang, L. Xu, L. Fan, L. Wu, L. Ding, L. Wang, M. Zhang, M. Li, M. Xu, M. Zhao, M. Zhai, P. Du, Q. Dong, S. Lei, S. Tu, S. Yang, S. Lu, S. Li, S. Li, Shuang-Li, S. Yang, S. Yi, T. Yu, W. Tian, W. Wang, W. Yu, W. L. Tam, W. Liang, W. Liu, X. Wang, X. Jia, X. Gu, X. Ling, X. Wang, X. Fan, X. Pan, X. Zhang, X. Zhang, X. Fu, X. Zhang, Y. Xu, Y. Wu, Y. Lu, Y. Wang, Y. Zhou, Y. Pan, Y. Zhang, Y. Wang, Y. Li, Y. Su, Y. Geng, Y. Zhu, Y. Yang, Y. Li, Y. Wu, Y. Li, Y. Liu, Y. Wang, Y. Li, Y. Zhang, Z. Liu, Z. Yang, Z. Zhou, Z. Qiao, Z. Feng, Z. Liu, Z. Zhang, Z. Wang, Z. Yao, Z. Wang, Z. Liu, Z. Chai, Z. Li, Z. Zhao, W. Chen, J. Zhai, B. Xu, M. Huang, H. Wang, J. Li, Y. Dong, and J. Tang (2025a) GLM-4.5:智能体、推理与编码(ARC)基础模型。外部链接:2508.06471,链接。引自第2.2节。
  • M. Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, 等 (2026) Mirothinker-1.7 & h1:迈向基于验证的重型研究智能体。arXiv预印本 arXiv:2603.15726。引自第1节、第2.1节、脚注1。
  • Q. Team (2025) Qwen3-30b-a3b-thinking-2507。外部链接:链接。引自第2.2节。
  • T. D. Team, B. Li, B. Zhang, D. Zhang, F. Huang, G. Li, G. Chen, H. Yin, J. Wu, J. Zhou, 等 (2025b) 通义深度研究技术报告。arXiv预印本 arXiv:2510.24701。引自第1节、第2.2节、第2.3节。
  • J. Wei, Z. Sun, S. Papay, S. McKinney, J. Han, I. Fulford, H. W. Chung, A. T. Passos, W. Fedus 和 A. Glaese(2025)《Browsecomp:一个简单但富有挑战性的浏览智能体基准》。arXiv 预印本 arXiv:2504.12516。引用于 §2.2。
  • Xbench-Team(2025)《Xbench-deepsearch》。外部链接:链接。引用于 §2.2。
  • R. Ye, Z. Zhang, K. Li, H. Yin, Z. Tao, Y. Zhao, L. Su, L. Zhang, Z. Qiao, X. Wang 等人(2025)《AgentFold:具有主动上下文管理的长周期网络智能体》。arXiv 预印本 arXiv:2510.24699。引用于 §1,脚注 1。
  • P. Zhou, B. Leon, X. Ying, C. Zhang, Y. Shao, Q. Ye, D. Chong, Z. Jin, C. Xie, M. Cao 等人(2025)《Browsecomp-zh:大语言模型中文网络浏览能力基准测试》。arXiv 预印本 arXiv:2504.19314。引用于 §2.2。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

OpenSeeker-v2:利用高信息量、高难度轨迹突破搜索智能体的极限

HuggingFace Daily Papers(社区热门论文)·2026-05-05 08:00·92天前
AI 导读

本研究提出了一种仅通过监督微调(SFT)训练前沿搜索智能体的高效方法。该方法基于三项关键数据合成改进:扩展知识图谱规模、增加工具集以及进行严格的低步数过滤。仅使用1.06万条数据训练的OpenSeeker-v2,在四个基准测试中均取得了领先性能,全面超越了采用复杂CPT+SFT+RL流程训练的同类模型。这是首个由纯学术团队仅通过SFT实现的、在同等模型规模与范式下的顶尖搜索智能体,其模型权重将开源以促进社区研究。

正文 · AI 翻译

杜宇文

叶睿

唐硕

黄科端

朱新宇

蔡宇柱

陈思衡

上海交通大学,

同等核心贡献,

项目负责人

通讯作者:yr991129@sjtu.edu.cn,sihengc@sjtu.edu.cn

摘要

深度搜索能力已成为前沿大语言模型智能体不可或缺的技能,但其开发仍由行业巨头主导。典型的行业方案涉及一个资源高度密集的流程,涵盖预训练、持续预训练、监督微调和强化学习。在本报告中,我们表明,当使用信息丰富且高难度的轨迹数据时,简单的监督微调方法在训练前沿搜索智能体方面可能出人意料地强大。通过引入三种简单的数据合成改进:扩展知识图谱规模以实现更丰富的探索、扩大工具集规模以实现更广泛的功能,以及严格的低步数过滤,我们建立了一个更强的基线。我们的 OpenSeeker-v2 仅使用 10600 个数据点进行训练,就在 4 个基准测试(采用 ReAct 范式的 300 亿参数规模智能体)上取得了最先进的性能:在 BrowseComp 上达到 46.0%,在 BrowseComp-ZH 上达到 58.1%,在 Humanity’s Last Exam 上达到 34.6%,在 xbench 上达到 78.0%,甚至超越了使用大量持续预训练、监督微调和强化学习流程训练的 Tongyi DeepResearch,后者分别取得了 43.4%、46.7%、32.9% 和 75.0% 的成绩。值得注意的是,OpenSeeker-v2 代表了在其模型规模和范式下,首个由纯学术团队仅使用监督微调开发的最先进搜索智能体。我们很高兴能够开源 OpenSeeker-v2 模型权重,并分享我们简单而有效的发现,使前沿搜索智能体研究对社区更加可及。

代码 https://github.com/PolarSeeker/OpenSeeker
模型 https://huggingface.co/PolarSeeker/OpenSeeker-v2-30B-SFT
Refer to caption
图 1:OpenSeeker-v2 在四个代表性基准测试中,在其模型规模和范式内取得了最先进的性能,值得注意的是,这是通过简单的监督微调实现的,并且优于通过大量持续预训练、监督微调和强化学习训练的 Tongyi DeepResearch。

1 引言

在信息爆炸的时代,深度搜索已成为前沿大语言模型智能体不可或缺的核心能力(OpenAI,2025a)。然而,这些高性能智能体的开发长期以来一直是资金充裕的企业实体近乎垄断的“闭门游戏”(OpenAI,2025b;Anthropic,2025)。行业实现最先进性能的典型方案高度依赖资源投入,通常包括在海量语料上进行持续预训练(Team 等,2025b,2026;Chu 等,2026),随后进行监督微调(Ye 等,2025),最后进入复杂的强化学习阶段(Li 等,2025)。这种对庞大算力和专有数据管线的严重依赖,筑起了一道巨大的壁垒,从根本上阻碍了学术界和开源社区在该领域的创新。

我们挑战这种普遍依赖复杂多阶段训练管线的做法。基于我们在 OpenSeeker(Du 等,2026)中的初步探索,我们将关注点完全重新聚焦于训练轨迹本身的质量,并提出一个关键问题:我们能否仅通过一种直接的监督微调方法,来突破搜索智能体的性能极限,并媲美重工业级管线的表现?

在本报告中,我们介绍了 OpenSeeker-v2,一款升级版搜索智能体。它证明了一个简单的 SFT 方法,只要以高质量、高难度且丰富的数据为燃料,就能展现出足够强大的能力。具体而言,我们为数据合成流程引入了两项简单但高效的改进:(1) 扩展图规模以丰富探索路径:我们在数据生成过程中显著扩大了拓扑图的规模。这一扩展为上下文注入了更丰富、更多样化的源信息,从而能够合成结构上要求进行深度、多跳探索才能解决的复杂任务。(2) 扩充工具集以拓展功能范围:我们增加了可用工具的数量,使智能体能够学习更多样化的策略,并处理更广泛的查询。(3) 严格低步数过滤:我们过滤掉任何只需极少工具调用步骤就能解决的轨迹。通过有意剔除这些简单查询,我们确保了训练集具有严格的最低难度门槛,迫使智能体学习在长程任务中进行持续的推理和信息搜寻。

通过应用这两项策略,我们精心整理了一个高度浓缩的数据集,仅包含 1 万条高难度轨迹。引人注目的是,仅通过一次 SFT 训练,在这个小数据集上训练一个 300 亿参数的模型就取得了惊人的结果。OpenSeeker-v2 在四个具有代表性的智能体基准测试中达到了新的 SOTA¹:在 BrowseComp 上为 46.0%,在 BrowseComp-ZH 上为 58.1%,在 Humanity’s Last Exam 上为 34.6%,在 xbench 上为 78.0%。值得注意的是,这个简单的 SFT 基线明确超越了诸如通义千问深度研究(Tongyi DeepResearch)等知名工业模型,后者依赖于复杂的 CPT+SFT+RL 流程,在这四项基准上的成绩分别为 43.4%、46.7%、32.9% 和 75.0%。

最终,OpenSeeker-v2 代表了在其模型规模和范式(ReAct)下,首个完全由纯学术团队仅使用 SFT 开发的最先进搜索智能体。为了推动前沿搜索智能体研究的普及,并为社区提供一个易于复现的基线,我们很高兴完全开源 OpenSeeker-v2 的模型权重。

2 方法与结果

2.1 方法

我们介绍 OpenSeeker-v2,一个基于监督微调(SFT)的升级版搜索智能体训练框架。我们的核心假设是,给定足够困难且信息丰富的训练数据,一个直接的 SFT 目标就足以激发强大的长程搜索和推理能力。

扩展图规模以实现更丰富的探索。设 为用于任务合成的源图。对于每个种子节点 ,原始流程会在 周围构建一个局部子图。在 OpenSeeker-v2 中,我们将扩展预算从 增加到 ,其中 ,从而获得一个更大的证据子图:

扩大的子图包含更丰富的拓扑相关来源集,这增加了可行推理路径的数量和多样性。随后,基于这个扩展的上下文生成一个合成查询:

通过扩展 ,生成的问题更可能需要跨多个节点进行证据聚合,而不是依赖少数几个来源。

扩展工具集以实现更广泛的功能。给定一个生成的问题 ,我们为搜索智能体配备一个比 OpenSeeker-v1(Du 等人,2026)中使用的更大的扩展工具集(遵循 Team 等人,2026),并让它生成一个多步骤的 ReAct 风格轨迹:

其中每个动作 对应一个从扩展工具集中选择的工具调用, 表示被调用工具返回的观察结果。 表示每个动作之前的推理轨迹。该轨迹由 个工具调用步骤组成,随后是一个最终推理步骤和答案 。通过扩展 ,智能体被鼓励学习更多样化的交互模式并利用互补工具,从而产生更灵活、功能更丰富的问题解决行为。

严格低步数过滤。为移除过于简单的实例,我们应用了严格的低步数过滤规则:

此处, 是预定义的最小工具调用阈值。轨迹中 的实例会被丢弃,因为它们通常可通过直接查找或浅层关键词匹配解决。

最后,OpenSeeker-v2 在过滤后的数据集上,使用标准 SFT 目标训练搜索智能体。

扩展后的图结构增加了上下文丰富度和多跳依赖关系,而低步数过滤则设定了最低难度门槛。这两项修改共同产生了高质量的 SFT 数据,促使智能体学习持续推理、稳健的信息提取以及长周期搜索行为。

2.2 实验设置

实现。我们基于 Qwen3-30B-A3B-Thinking-2507 (Team, 2025) 实例化 OpenSeeker-v2,该模型总参数量为 30B,推理时激活参数量为 3B。智能体使用 256k 上下文窗口,并允许每条轨迹最多进行 200 次工具调用。OpenSeeker-v2 通过 SFT 训练,未使用 RL 或额外的超参数调优。

评测基准。我们在五个具有挑战性的智能体评测基准上评估 OpenSeeker-v2:BrowseComp (Wei et al., 2025)、BrowseComp-ZH (Zhou et al., 2025)、Humanity’s Last Exam (HLE) (Phan et al., 2025) 和 xbench-DeepSearch (Xbench-Team, 2025)。这些基准涵盖了多样化的深度研究任务。在调用网络搜索工具时,我们会屏蔽与 HuggingFace 相关的链接以避免潜在的数据泄露。

基线模型。我们在表 1 中将 OpenSeeker-v2 与代表性系统进行比较,主要关注同等规模的基于 ReAct 的搜索智能体。通义千问 DeepResearch (Team et al., 2025b) 和 RedSearcher (Chu et al., 2026) 是强大的 30B 规模搜索智能体,通过更重的 CPT+SFT+RL 流程训练。它们为评估我们仅使用 SFT 的方法能否与资源更密集的训练方案相抗衡提供了直接参考。为完整起见,我们还包括闭源专有模型 (Anthropic, 2025; OpenAI, 2025b, a; Singh et al., 2025) 和大型开源模型 (DeepSeek-AI et al., 2025; Team et al., 2025a; MiniMax AI Team, 2025) 作为更广泛的参考点。基线结果取自其技术报告或公开排行榜。

2.3 主要结果

媒体内容 · 前往原文查看
表 1:我们的 OpenSeeker 与其他基于 ReAct 的搜索智能体之间的比较。‘# Samples’ 表示总训练数据样本数量;‘Training’ 表示训练技术(CPT:持续预训练,SFT:监督微调,RL:强化学习);‘Academic’ 表示是否由纯学术团队完成(:是,:否);‘BC-ZH’ 表示 BrowseComp-ZH。值得注意的是,仅通过简单的 SFT,OpenSeeker-v2-30B-SFT 就持续优于那些使用包含 CPT、SFT 和 RL 的更复杂流程训练的同等规模模型。OpenSeeker-v2 全面优于同等规模的纯 ReAct 模型。
模型名称 # 样本数 训练方式 学术团队 BrowseComp BC-ZH HLE xbench
闭源专有模型
Claude-4-Opus ? ? 18.8 37.4 - -
Claude-4.5-Sonnet ? ? 24.1 42.4 32.0 -
Gemini-3-pro ? ? 37.8 66.8 45.8 -
OpenAI-o3 ? ? 49.1 68.7 20.2 65.0
OpenAI Deep Research ? ? 51.5 42.9 26.6 -
GPT-5-High ? ? 54.9 63.0 41.7 -
开源模型 > 30B
DeepSeek-V3.1-671B ? ? 30.0 49.2 29.8 71.2
DeepSeek-V3.2-671B ? ? 51.4 65.0 40.8 -
GLM-4.6-357B ? ? 45.1 49.5 30.4 -
GLM-4.7-357B ? ? 52.0 66.6 42.8 -
Minimax-M2-230B ? ? 44.0 48.5 - -
30B 模型
WebSailor-V2-30B-SFT ? SFT 24.4 28.3 23.9 61.7
WebSailor-V2-30B-RL ? SFT + RL 35.3 44.1 30.6 73.7
WebLeaper-30B-SFT 15 k SFT 27.7 - - 66.0
WebLeaper-30B-RL ? RL 38.8 - - 72.0
通义千问 DeepResearch ? CPT + SFT + RL 43.4 46.7 32.9 75.0
RedSearcher-30B ? CPT + SFT + RL 42.1 49.8 34.3 -
OpenSeeker-v1-30B-SFT 11.7 k SFT 29.5 48.4 - 74.0
OpenSeeker-v2-30B-SFT 10.6 k SFT 46.0 58.1 34.6 78.0

超越采用更重管线训练的同规模智能体。OpenSeeker-v2 背后的核心问题是,简单的 SFT 能否突破搜索智能体的极限,并与更重的工业级管线相抗衡。如表 1 所示,OpenSeeker-v2-30B-SFT 在仅使用 SFT 的情况下,在所有基于 ReAct 的 30B 搜索智能体中取得了最强的综合性能。OpenSeeker-v2 在 BrowseComp 上达到 46.0%,在 BrowseComp-ZH 上达到 58.1%,在 Humanity’s Last Exam 上达到 34.6%,在 xbench 上达到 78.0%。(1) 值得注意的是,通过简单的 SFT,OpenSeeker-v2 的性能超过了由阿里巴巴通义实验室开发的通义深度搜索(Team et al., 2025b)以及由小红书开发的 RedSearcher,而后者是通过广泛的 CPT+SFT+RL 管线训练的。具体来说,在具有挑战性的基准测试 BrowseComp 和 HLE 上,OpenSeeker-v2 分别至少领先这两个模型 2.6% 和 0.3%;而在 BrowseComp-ZH 和 xbench 上,OpenSeeker-v2 分别显著领先通义深度搜索 11.4% 和 3%。(2) 与更大的模型相比,OpenSeeker-v2 也超越了 DeepSeek-V3.1-671B、GLM-4.6-357B、Minimax-M2-230B、Claude-4.5-Sonnet,展示了其强大的能力。这些结果表明,当由高质量、高难度且丰富的数据驱动时,一个直接的 SFT 方法可以足够强大,这暗示数据质量可能是训练智能的长期搜索智能体的关键路径。

展示 OpenSeeker 的扩展潜力。在相同的模型规模和仅使用 SFT 的训练方案下,OpenSeeker-v2 相比 OpenSeeker-v1(Du et al., 2026)有了显著提升,突显了通过更高质量的数据构建来开发 OpenSeeker 框架的潜力。OpenSeeker-v2 将 BrowseComp 从 29.5 提升至 46.0,BrowseComp-ZH 从 48.4 提升至 58.1,xbench 从 74.0 提升至 78.0。这些提升表明,在当前 SFT 设置下,OpenSeeker 尚未达到饱和。更重要的是,它们表明,增加合成问答任务的难度和丰富度,并提升合成轨迹的整体质量,可以带来显著的能力提升,这表明可扩展的高质量数据合成是进一步推进搜索智能体的一条有前景的路径。

Refer to caption
图 2:搜索智能体训练数据中平均工具调用次数对比。

OpenSeeker-v2 展现出的数据难度高于此前同类模型。OpenSeeker-v2 基于更长的搜索轨迹构建,每条轨迹平均包含 64.67 步,而 OpenSeeker-v1 为 46.97 步,RedSearcher 为 36.01 步。这表明 OpenSeeker-v2 的训练数据需要更复杂的多步推理和更长周期的信息搜寻。我们推测,这种长且复杂的合成轨迹对于让模型获得更强的长周期检索与搜索能力至关重要,这也进一步解释了 OpenSeeker-v2 在具有挑战性的深度研究基准测试上表现更优的原因。

3 结论

在本报告中,我们分享了一个发现:当使用高质量、高难度且丰富的数据时,仅通过简单 SFT 训练的搜索智能体,其性能可与使用大量资源训练的智能体相媲美。具体而言,我们分享了在数据采集流程上的三项简单而有效的改进:扩展图规模、扩充工具集以及低步数过滤,并据此训练了最终的搜索智能体 OpenSeeker-v2。尽管仅使用 10.6k 样本进行训练,OpenSeeker-v2 在四个代表性基准测试上均取得了新的 SOTA 成绩:BrowseComp 上 46.0%,BrowseComp-ZH 上 58.1%,Humanity’s Last Exam 上 34.6%,以及 xbench 上 78.0%,显著优于通过 CPT、SFT 和 RL 进行大量训练的通义千问深度搜索和 RedSearcher。我们的报告强调了数据质量的关键作用,表明仅凭精心设计的数据就能释放出显著的性能提升。

下一步计划。我们的内部观察表明,高质量合成数据具有强大的扩展潜力。未来,我们将继续沿着这一方向推进,通过扩大数据数量、提升数据质量和增加数据多样性,旨在进一步突破搜索智能体的性能极限。

参考文献

  • Anthropic (2025) 推出 Claude 4。外部链接:链接 被引用自:§1, §2.2
  • Z. Chu, X. Wang, J. Hong, H. Fan, Y. Huang, Y. Yang, G. Xu, C. Zhao, C. Xiang, S. Hu 等人 (2026) 《REDSearcher:一种可扩展且成本高效的长期搜索智能体框架》。arXiv 预印本 arXiv:2602.14234。引用自:§1, §2.2。
  • DeepSeek-AI, A. Liu, A. Mei, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, C. Lu, C. Zhao, C. Deng, C. Xu, C. Ruan, D. Dai, D. Guo, D. Yang, D. Chen, E. Li, F. Zhou, F. Lin, F. Dai, G. Hao, G. Chen, G. Li, H. Zhang, H. Xu, H. Li, H. Liang, H. Wei, H. Zhang, H. Luo, H. Ji, H. Ding, H. Tang, H. Cao, H. Gao, H. Qu, H. Zeng 等人 (2025) 《DeepSeek-v3.2:推动开源大语言模型的前沿》。arXiv 预印本 arXiv:2512.02556。外部链接:链接,文献引用。引用自:§2.2。
  • Y. Du, R. Ye, S. Tang, X. Zhu, Y. Lu, Y. Cai 和 S. Chen (2026) 《OpenSeeker:通过完全开源训练数据实现前沿搜索智能体的民主化》。arXiv 预印本 arXiv:2603.15594。引用自:§1, §2.1, §2.3。
  • K. Li, Z. Zhang, H. Yin, R. Ye, Y. Zhao, L. Zhang, L. Ou, D. Zhang, X. Wu, J. Wu 等人 (2025) 《WebSailor-v2:通过合成数据与可扩展强化学习弥合与专有智能体之间的鸿沟》。arXiv 预印本 arXiv:2509.13305。引用自:§1。
  • MiniMax AI 团队 (2025) 《MiniMax M2 与智能体:简约中的精巧》。说明:在 Hugging Face 上开源模型权重:https://huggingface.co/MiniMaxAI/MiniMax-M2。外部链接:链接。引用自:§2.2。
  • OpenAI (2025a) 《深度研究系统卡》。外部链接:链接。引用自:§1, §2.2。
  • OpenAI (2025b) 《推出 OpenAI o3 和 o4-mini》。外部链接:链接。引用自:§1, §2.2。
  • L. Phan, A. Gatti, Z. Han, N. Li, J. Hu, H. Zhang, C. B. C. Zhang, M. Shaaban, J. Ling, S. Shi 等人 (2025) 《人类的最后考试》。arXiv 预印本 arXiv:2501.14249。引用自:§2.2。
  • A. Singh, A. Fry, A. Perelman, A. Tart, A. Ganesh, A. El-Kishky, A. McLaughlin, A. Low, A. Ostrow, A. Ananthram, A. Nathan, A. Luo, A. Helyar, A. Madry, A. Efremov, A. Spyra, A. Baker-Whitcomb, A. Beutel, A. Karpenko, A. Makelov, A. Neitz 等人 (2025) 《OpenAI GPT-5 系统卡》。arXiv 预印本 arXiv:2601.03267。外部链接:链接,文献引用。引用自:§2.2。
  • G. Team, A. Zeng, X. Lv, Q. Zheng, Z. Hou, B. Chen, C. Xie, C. Wang, D. Yin, H. Zeng, J. Zhang, K. Wang, L. Zhong, M. Liu, R. Lu, S. Cao, X. Zhang, X. Huang, Y. Wei, Y. Cheng, Y. An, Y. Niu, Y. Wen, Y. Bai, Z. Du, Z. Wang, Z. Zhu, B. Zhang, B. Wen, B. Wu, B. Xu, C. Huang, C. Zhao, C. Cai, C. Yu, C. Li, C. Ge, C. Huang, C. Zhang, C. Xu, C. Zhu, C. Li, C. Yin, D. Lin, D. Yang, D. Jiang, D. Ai, E. Zhu, F. Wang, G. Pan, G. Wang, H. Sun, H. Li, H. Li, H. Hu, H. Zhang, H. Peng, H. Tai, H. Zhang, H. Wang, H. Yang, H. Liu, H. Zhao, H. Liu, H. Yan, H. Liu, H. Chen, J. Li, J. Zhao, J. Ren, J. Jiao, J. Zhao, J. Yan, J. Wang, J. Gui, J. Zhao, J. Liu, J. Li, J. Li, J. Lu, J. Wang, J. Yuan, J. Li, J. Du, J. Du, J. Liu, J. Zhi, J. Gao, K. Wang, L. Yang, L. Xu, L. Fan, L. Wu, L. Ding, L. Wang, M. Zhang, M. Li, M. Xu, M. Zhao, M. Zhai, P. Du, Q. Dong, S. Lei, S. Tu, S. Yang, S. Lu, S. Li, S. Li, Shuang-Li, S. Yang, S. Yi, T. Yu, W. Tian, W. Wang, W. Yu, W. L. Tam, W. Liang, W. Liu, X. Wang, X. Jia, X. Gu, X. Ling, X. Wang, X. Fan, X. Pan, X. Zhang, X. Zhang, X. Fu, X. Zhang, Y. Xu, Y. Wu, Y. Lu, Y. Wang, Y. Zhou, Y. Pan, Y. Zhang, Y. Wang, Y. Li, Y. Su, Y. Geng, Y. Zhu, Y. Yang, Y. Li, Y. Wu, Y. Li, Y. Liu, Y. Wang, Y. Li, Y. Zhang, Z. Liu, Z. Yang, Z. Zhou, Z. Qiao, Z. Feng, Z. Liu, Z. Zhang, Z. Wang, Z. Yao, Z. Wang, Z. Liu, Z. Chai, Z. Li, Z. Zhao, W. Chen, J. Zhai, B. Xu, M. Huang, H. Wang, J. Li, Y. Dong, and J. Tang (2025a) GLM-4.5:智能体、推理与编码(ARC)基础模型。外部链接:2508.06471,链接。引自第2.2节。
  • M. Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, 等 (2026) Mirothinker-1.7 & h1:迈向基于验证的重型研究智能体。arXiv预印本 arXiv:2603.15726。引自第1节、第2.1节、脚注1。
  • Q. Team (2025) Qwen3-30b-a3b-thinking-2507。外部链接:链接。引自第2.2节。
  • T. D. Team, B. Li, B. Zhang, D. Zhang, F. Huang, G. Li, G. Chen, H. Yin, J. Wu, J. Zhou, 等 (2025b) 通义深度研究技术报告。arXiv预印本 arXiv:2510.24701。引自第1节、第2.2节、第2.3节。
  • J. Wei, Z. Sun, S. Papay, S. McKinney, J. Han, I. Fulford, H. W. Chung, A. T. Passos, W. Fedus 和 A. Glaese(2025)《Browsecomp:一个简单但富有挑战性的浏览智能体基准》。arXiv 预印本 arXiv:2504.12516。引用于 §2.2。
  • Xbench-Team(2025)《Xbench-deepsearch》。外部链接:链接。引用于 §2.2。
  • R. Ye, Z. Zhang, K. Li, H. Yin, Z. Tao, Y. Zhao, L. Su, L. Zhang, Z. Qiao, X. Wang 等人(2025)《AgentFold:具有主动上下文管理的长周期网络智能体》。arXiv 预印本 arXiv:2510.24699。引用于 §1,脚注 1。
  • P. Zhou, B. Leon, X. Ying, C. Zhang, Y. Shao, Q. Ye, D. Chong, Z. Jin, C. Xie, M. Cao 等人(2025)《Browsecomp-zh:大语言模型中文网络浏览能力基准测试》。arXiv 预印本 arXiv:2504.19314。引用于 §2.2。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org