摘要
深度研究要求智能体找到能同时满足多重约束的答案。发现此类答案成本高昂,而验证候选答案通常可以分解为易于处理的逐约束检查。这种发现与验证之间的不对称性表明,研究智能体不应仅仅延长搜索时间:它应通过验证中间结果,并利用部分验证的状态来指导后续改进,从而递归地优化当前答案。我们提出了 AREX,一系列递归自我改进(RSI)的深度研究智能体。AREX 交替运行一个内部研究循环(收集证据并构建初步答案)和一个外部自我改进循环(逐约束审计答案、识别未解决的声明,并启动针对性的后续研究)。为了在长时间跨度内维持 RSI,AREX 学习了一个自主上下文更新工具,该工具将不断增长的交互历史压缩成一个紧凑的改进状态,保留已验证的证据和未解决的约束,而无需依赖外部模型。我们通过智能体中期训练和长跨度强化学习,在已验证的合成任务和高质量轨迹上训练 AREX。为了缓解长跨度学习过程中最终奖励稀疏的问题,我们强调了获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个密集的 4B 模型和一个 122B-A10B 的混合专家模型。在 BrowseComp、WideSearch、DeepSearchQA、人类最后的考试(HLE)以及其他推理和工具使用基准测试中,AREX 大幅优于同等规模的基线模型,并与使用更多激活参数的模型保持竞争力。
[应用]https://arex-research.com \元数据[主页]https://vectorspacelab.github.io/arex-model/ \元数据[模型]https://huggingface.co/collections/BAAI/arex![]()
![]()
1 引言
深度研究之所以具有挑战性,不仅在于相关证据难以定位,更在于一个有效的答案往往需要同时满足多个相互耦合的约束条件。智能体必须发现可行的候选方案,整合分散且可能相互矛盾的证据,并验证每一项必要条件是否都得到了充分支持(react; webgpt; deepresearch_survey)。许多现有系统通过扩展单次搜索轨迹,增加额外的推理、工具交互或上下文来应对这一挑战(deepresearch; searchr1; webdancer; beyond_ten_turns)。虽然增加推理阶段的计算量可以拓宽探索范围,但这并不能保证取得系统性进展:早期错误可能持续存在,已穷尽的搜索方向可能被重复探索,而部分有效的候选方案也可能被过早接受。因此,关键挑战不仅仅在于搜索更长时间,而在于识别哪些约束条件仍未解决,并利用这一诊断结果来制定更具针对性的下一个研究问题。
我们观察到,深度研究任务呈现出一种根本性的发现-验证不对称性。发现一个能同时满足所有约束条件的答案成本高昂,因为这需要在一个信息稀疏且庞大的搜索空间中导航;而评估一个提出的候选方案,则通常可以分解为针对各个约束条件的、简单得多的检查。这种验证不仅能揭示当前答案是否正确,还能指出哪些主张得到了支持、哪些仍未解决,以及现有证据在何处存在矛盾。现有工作利用验证来对已完成的候选轨迹进行排序,或在正在进行的轨迹中优化决策(zeng2025pushing; team2026mirothinker)。我们的关键洞察在于,验证还可以定义研究轮次之间的过渡。通过将一个暂定答案转换为部分验证的状态,智能体可以保留已取得的进展,隔离剩余的不确定性,并制定出更具针对性的下一个研究问题。
我们提出 AREX,这是一系列递归自改进(RSI)深度研究智能体,能够反复将部分验证的解决方案转化为更具针对性的研究问题。AREX 在内部研究循环与外部自我改进循环之间交替运行:内部循环负责收集证据、评估候选方案并构建初步答案;外部循环则逐条约束地审计该答案,并将后续研究引导至尚未解决或证据薄弱的论断上。已验证的进展会在各轮次间保留,而基于约束层面的置信度估计同时控制着继续与终止:不确定的条件会触发针对性的后续研究,一旦所需论断获得充分支持,流程即告终止。通过这种方式,验证不再仅仅是搜索结束后的一道最终过滤工序,而是成为一种主动的控制信号,递归地优化智能体的研究状态与解决方案。
要在长时间跨度内维持这种递归,智能体必须保持简洁且可操作的研究状态。在内部研究循环中,交互历史会不断累积已验证的证据、失败的查询、推测性假设、重复的观察以及过时的计划。保留全部历史会干扰后续推理,而不加区分地截断则可能丢弃后续验证所需的证据(memgpt; hiagent; mem1; resum; supo; memory_as_action)。因此,AREX 学会在研究过程中自主调用专门的上下文更新工具,将其自身的交互历史转化为紧凑的改进状态。该状态保留已验证的证据与引用,记录约束满足情况,突出未解决的信息缺口,并明确下一步研究计划。与由外部模型执行的通用摘要或压缩不同,这一更新由 AREX 自身生成,并围绕其当前研究目标进行组织。这种自主上下文管理使得压缩后的状态始终与智能体不断演化的信念及未来行动保持一致。
我们在经过验证的合成任务与高质量轨迹上训练 AREX,通过监督式能力获取、智能体中期训练以及面向长程研究的强化学习,逐步教会模型搜索、使用工具、构建临时答案、验证单个约束条件、更新上下文,并决定何时继续或终止。长轨迹还带来了稀疏的信用分配问题:最终奖励无法揭示哪些中间步骤取得了决定性进展。因此,我们识别并增加对关键步骤的训练暴露,例如获取关键证据、解决矛盾或纠正错误研究方向的步骤(lets_verify; math_shepherd; ragen; turn_credit)。
我们将 AREX 实例化为一个密集 4B 参数模型(Turbo)和一个总参数量 122B、激活参数量 10B 的混合专家模型(Base)。我们在涵盖深度搜索、广度搜索、多约束信息检索以及工具辅助推理的多个基准上对其进行评估,包括 BrowseComp(browsecomp)、WideSearch(widesearch)、DeepSearchQA(deepsearchqa)、人类最后考试(带工具版)(hle)、GAIA(gaia)以及 xbench-DeepSearch-2510(xbench_deepsearch_2510)。在这些场景中,AREX 大幅优于同等规模的基线模型,并与使用更多激活参数的模型保持竞争力,表明递归式改进研究状态为实现能力强且高效的深度研究智能体提供了一条有效路径。
- •
我们将多约束深度研究形式化为一个递归式自我改进过程,其动机源于发现与验证的不对称性:部分验证的解决方案被递归地转化为更具针对性的研究问题。
- •
我们提出 AREX,它将一个研究循环与一个约束级自我改进循环相结合。信念估计指导着定向延续和基于证据的终止,而一个经过学习的上下文更新工具则在长程任务中维护一个紧凑的改进状态。
- •
我们基于经过验证的合成任务与高质量轨迹,开发了一个多阶段训练框架,并结合关键区间暴露机制,以改善长研究轨迹中的信用分配问题。
- •
我们开发了密集型的 4B 和 122B-A10B MoE 变体,并在深度研究、广泛搜索、推理和工具使用等基准测试中,展示了相较于同等规模基线的持续性能提升。
2 递归自我改进
2.1 整体框架
我们采用 Qwen3.5-4B (qwen35) 作为 AREX-Turbo 的骨干模型,采用 Qwen3.5-122B-A10B (qwen35) 作为 AREX-Base 的骨干模型。如图 2 所示,AREX 通过一个分层的、双层递归自我改进过程来实现深度研究,该过程包含一个内部研究循环和一个外部自我改进循环。给定一个输入查询,它首先推导出一个研究目标。内部研究循环执行研究行动,整合检索到的证据,并更新当前答案,直到目标得到充分解决。然后,它会输出一个临时答案,同时附带支持证据和一个答案级别的置信度分数。
外部自我改进循环利用其置信度分数来评估临时结果。如果分数超过预设阈值,则接受该答案。否则,循环会评估当前的研究轨迹是否可恢复:有用的发现会被保留并转化为一个有针对性的优化目标,而嘈杂或无信息的轨迹则会触发从原始问题重新开始。
2.2 内部研究循环
内部研究循环通过分析当前研究目标、调用搜索或浏览工具、整合返回的证据并确定下一步研究步骤,来逐步构建答案。在第一个递归轮次中,目标源自原始问题。在后续轮次中,外部循环可能会提供一个有针对性的目标,例如验证一个不受支持的约束条件、解决相互矛盾的证据、检查时间有效性,或在某个候选方案被否定后探索替代方案。
在递归轮次的步骤中,交互轨迹被定义为
| (1) |
其中 表示模型的中间分析, 表示一个研究动作, 表示相应的观察结果。
该轨迹作为模型在递归轮次中的工作研究状态。基于原始问题、当前研究目标和累积的轨迹,模型识别出未解决的约束条件,并生成中间分析以及相应的研究动作:
| (2) |
其中 表示由 参数化的研究策略, 表示外部研究环境,包括搜索和浏览工具。产生的交互被追加到轨迹中:
| (3) |
其中 表示按时间顺序拼接。
随着新证据在轨迹中累积,研究策略会自适应调整。支持性观察结果引导模型走向剩余约束条件,而矛盾性观察结果则可能使当前候选方案失效,并将调查转向替代方案。当来源相互冲突时,模型会寻找权威性更强、来源更直接或时间相关性更高的证据。如果没有合理的候选方案留存,它可能会扩大搜索空间、分解目标或重新制定搜索查询。
在长周期研究过程中,模型可能会调用 update_context 来将累积的轨迹整合为更紧凑的研究状态,从而使后续步骤能够在刷新后的上下文中运行,同时保留关键证据和未解决的约束条件。当当前目标已被充分研究,或进一步搜索不太可能带来实质性收益时,循环即终止。随后,模型调用 finish 来输出一个临时答案、其支撑证据以及答案级别的置信度分数。以下两种机制分别描述了执行过程中轨迹如何被刷新,以及终端轨迹如何被转换为答案级别的表示以供外层循环评估。
2.2.1 自主上下文更新
随着研究的推进,轨迹中会累积搜索结果、中间结论、被排除的候选方案、相互矛盾的发现以及不断演变的计划。保留完整的轨迹会引入冗余,并可能掩盖与后续决策相关的信息。
现有方法通常采用固定启发式规则来管理上下文,例如根据预定义规则丢弃工具响应(team2026mirothinker),或在达到固定 token 阈值时触发摘要(liu2025deepseek)。虽然这些策略缩短了上下文长度,但它们主要将上下文管理视为预算控制问题,而非研究状态维护问题。因此,它们可能会移除或弱化与决策相关的信息,包括来源出处、负面证据、未解决的约束、相互矛盾的发现,以及某些候选方案被排除的原因。
这一局限性在长周期研究中变得更为严重,因为下一步有用行动取决于语义进展,而非消息位置或 token 数量。模型必须追踪哪些约束已满足、哪些假设仍可行、以及哪些不确定性应指导进一步搜索。固定启发式规则与这些研究状态的转换并不对齐,因此可能导致模型重新访问已被排除的候选方案、重新发现先前结论,或丢失后续优化所需的信息。
为解决这一问题,AREX 提供了一个显式的 `update_context` 工具。给定累积的轨迹后,该工具会构建一个刷新后的研究状态:
| (4) |
刷新后的状态保留了已验证的发现及其来源标识符、当前候选方案、未解决的约束条件、有效性疑虑、被否决的候选方案以及下一步计划。冗余的观察、已被取代的结论以及过时的计划则被移除。
在调用 `update_context` 之后,模型不再需要以整个轨迹为条件。我们将模型在第 `t` 步可用的有效上下文记为 `h_t`。如果最近一次 `update_context` 调用发生在第 `τ` 步,那么
| (5) |
如果没有发生上下文更新,有效上下文就是完整的轨迹:
| (6) |
后续动作由有效上下文生成:
| (7) |
模型自主决定何时调用 `update_context`,例如在解决了一个有意义的子问题、排除了一个主要候选方案、调和了相互矛盾的证据或更改了研究计划之后。因此,该工具可以在内循环中被多次调用,或者完全不调用。
自主上下文更新并非进行通用摘要,而是执行轨迹整合与研究状态刷新。它使得模型无需从完整的交互历史中反复重建进展,即可实现长周期研究,并允许有用的发现和未解决的约束条件在递归轮次之间被重复利用。
2.2.2 结构化答案外化
自主上下文更新在研究过程中维护轨迹,但最终的状态本身并非答案。一旦当前目标得到充分研究,模型便会调用一个结构化的结束接口。
设 `h_T` 表示内循环产生的最终有效上下文,其中 `T` 是递归轮次 `r` 的最后研究步骤。在递归轮次 `r` 中,内循环的输出为
| (8) |
其中 `T` 是最后一步,`a_r` 是对原始问题的临时答案,`E_r` 包含支持性证据和文档标识符,`c_r` 是一个答案级别的置信度分数。
置信度分数反映了答案在估计完整性、一致性、来源可靠性和时间有效性方面的评估。与可能包含被舍弃的方向、过时的计划以及原始工具响应的完整轨迹不同,该分数仅保留外层循环评估所需的答案层级信息。
调用 finish 会终止当前内层循环,而非整个递归过程。外层循环根据原始问题对临时答案、证据和置信度分数进行评估,要么接受该答案,要么为下一轮研究制定有针对性的目标。
2.3 外层自我改进循环
在递归轮次 中,外层自我改进循环接收结构化结果以及有效的终端上下文 。随后,它决定是终止递归过程、优化当前轨迹,还是重新开始调查。
外层循环将置信度分数作为内层循环所构建的、基于证据的信念状态的紧凑摘要,其中包含已验证的发现、相互矛盾的证据以及未解决的约束条件。设 为置信度阈值。如果 ,则当前答案被接受并作为最终答案返回。否则,模型会评估当前研究轨迹是否包含可用于支持进一步改进的有用信息。
对于低置信度的结果,轨迹评估定义为
| (9) |
其中 指示该轨迹是否可恢复、是否包含应保留的信息、是否包含需要进一步调查或修订的问题,以及 是下一递归轮次的研究目标。
完整的决策规则为
| (10) |
当选择“优化”时,当前轨迹被认为包含有意义的进展。外层循环将可靠的发现和可复用的证据保留在 中,识别 中剩余的问题,并将其转化为有针对性的目标 。下一递归轮次从一个刷新后的状态开始初始化:
| (11) |
这使得下一轮次能够复用已有的有效进展,同时专注于答案中仍不确定或不完整的部分。
当选择“重启”时,模型判定当前轨迹过于嘈杂、具有误导性或信息量不足,无法支持进一步优化。因此,累积的轨迹被丢弃,下一轮递归仅从原始问题重新开始:
| (12) |
随后,内循环开始新一轮调查,不会继承上一轮轨迹中的信息。
每轮递归结束后,外循环重复相同的基于置信度的决策流程。该过程受预设的最大轮数限制。如果没有任何答案达到置信度阈值,系统将返回置信度得分最高的已完成答案。
3 训练数据构建
为了让 AREX 能够执行递归研究,我们构建了一个专门的训练数据集,其中包含具有挑战性的研究任务、多步骤调查轨迹以及基于证据的解决方案。该流程包含两个阶段:递归研究任务合成,以及带质量控制的教师轨迹收集。第一阶段生成需要深度研究的可验证问题,第二阶段则从与 AREX 处于相同研究环境中的强教师模型中收集高质量轨迹。
3.1 递归研究任务合成
任务合成的目标是构建需要迭代信息收集、多源证据整合、中间假设验证以及自适应研究规划的问题。我们考虑了三种任务类别:需要跨来源综合信息的浏览密集型问题、涉及多步骤规划或推理的推理密集型问题,以及需要整合学术论文的科学文献问题。
针对每个类别,人类专家定义模板,指定答案格式、可用来源、推理要求和验证标准。随后,从真实世界来源(包括网页、科学文献、结构化知识库和公共代码仓库)生成具体实例。
我们首先提取一个目标实体或解决方案作为潜在答案,并确定一组相关约束条件:
| (13) |
其中每个约束代表一个可验证的研究目标。这些约束可以描述时间关系、数值属性、实体关系、技术属性或证据要求。它们的组合迫使模型从多个来源收集信息并进行推理,而非依赖关键词匹配。
为避免简单的检索任务,我们将这些约束抽象并转化为需要多跳搜索与推理的间接描述。最终查询生成如下:
| (14) |
其中 表示转化后的约束。一个有效的任务必须满足三个条件:答案不能直接从查询中推断出来,每个约束都能从现有证据中得到验证,且所有约束共同唯一地确定答案。
随后,我们自动验证正确性、唯一性、证据可用性和难度。答案模糊、约束不一致或证据不足的任务将被剔除。此外,通过独立的研究试运行,进一步排除那些可通过浅层检索解决或经过大量调查仍无法解决的任务。
最终生成的任务数据集为:
| (15) |
其中每个实例包含一个研究问题及其对应的答案。
3.2 教师轨迹收集与质量控制
对于每个合成任务,强大的教师模型会与 AREX 所使用的相同工具和研究环境进行交互。给定一个任务 ,教师模型会采样一条研究轨迹:
| (16) |
每条轨迹记录了模型的动作、工具调用、检索到的观察结果、中间分析以及最终的结构化答案。与标准的输入-输出监督相比,这些轨迹揭示了长周期研究所必需的中间行为。
由于原始轨迹可能包含无效探索、推理错误或未经支持的结论,我们应用了多项质量控制流程。首先,我们仅保留那些展现出有意义的迭代调查、连贯的研究状态维护以及对新获取证据进行适应的轨迹。直接猜测答案、忽略观察结果或未能修正错误假设的轨迹将被剔除。
第二,我们验证工具交互的有效性。包含无效或不可靠工具执行、忽略观察结果或存在无依据引用的轨迹将被丢弃。
第三,我们应用基于证据的答案过滤。最终答案必须能够从收集到的证据中重建。我们移除那些在收集到足够证据之前就给出答案、包含无依据主张、与检索信息相矛盾或依赖不合理假设的轨迹。
最后,每条轨迹都以一个答案、支持性证据以及一个答案级别的置信度分数结束。满足以下条件的轨迹
| (17) |
将被移除,其中 是一个预定义的置信度阈值。
经过过滤后,最终的轨迹数据集为
| (18) |
其中 表示整体有效性标准。由此产生的数据用于监督迭代式证据获取、研究状态维护、基于证据的答案构建以及自适应延续,从而使 AREX 能够在其递归双循环框架内有效运作。
4 训练流程
4.1 多阶段智能体中期训练
长周期深度研究需要多种异构能力的组合,包括工具调用、网页导航、证据获取、专家级推理、上下文跟踪以及答案综合。直接在单一混合分布上训练模型可能导致学习动态不稳定以及不同能力类型之间的相互干扰。因此,我们采用一种多阶段智能体中期训练方案,逐步提升模型的研究能力。
智能体中端训练过程包含两个主要阶段。首先,我们训练模型处理浏览密集型研究任务,以建立基础的工具使用和证据获取能力;随后训练模型处理专家级推理任务,以强化长程思考、假设比较和难题解决能力。其次,我们通过回放浏览密集型长程轨迹中的精选关键步骤,并纳入能力扩展任务(包括复杂学术论文研究和具有挑战性的知识密集型推理任务),进行混合能力整合。此阶段还让模型接触验证驱动的研究转换过程:即根据任务约束对临时答案进行审核,将已验证的证据保留在研究状态中,识别未解决的条件,并制定下一个针对性的研究问题。该阶段在强化模型核心深度研究能力的同时,将其推理和研究覆盖范围扩展至更具挑战性的领域。
渐进式多轮能力训练
第一阶段逐步建立长程研究所必需的互补能力。我们首先训练模型处理浏览密集型多轮轨迹,涉及迭代搜索、网页阅读、证据获取、查询重构和最终答案综合。此阶段奠定模型基础的工具使用和网页导航能力。随后引入专家级推理数据,更侧重于长程思考、多步演绎、假设验证和审慎的答案选择。此阶段强化模型解决难题的能力,以及在扩展推理过程中保持连贯中间结论的能力。这两个阶段共同使模型以渐进方式同时获得迭代式智能体行为和强大的推理能力。
尽管密集推理阶段增强了模型的问题解决能力,但我们观察到,过度专注于专家级推理数据可能会削弱模型先前习得的浏览和工具使用行为。为缓解这种能力干扰,我们引入了一个混合能力巩固阶段。在此阶段,我们将能力扩展任务(包括复杂学术论文研究和专家级知识密集型推理)与来自浏览密集型长程轨迹的选择性重放相结合。我们并非均匀地重放完整轨迹,而是将重放目标集中在困难且信息量大的中间决策上。这些步骤的识别与针对性优化将在下一段中描述。
关键步骤聚焦的混合能力巩固。
长程研究训练中的一个关键挑战在于,轨迹各步骤间的监督信号极不均匀。大多数步骤是常规过渡,而少数步骤则对应关键的研究决策,例如发现与答案相关的证据、在否定错误假设后重新引导搜索方向,或将分散的证据与目标问题联系起来。这些步骤往往决定了轨迹的成败。
完整轨迹训练会对成功轨迹中的所有助手 token 施加监督,这可能会稀释来自高价值决策点的学习信号。为解决此问题,我们引入了关键步骤聚焦监督。我们首先使用高精度、基于规则的检测器来识别候选关键步骤,这些检测器针对具有语义意义的研究事件,例如:
- •
在多次探索步骤之后,首次工具调用,其结果或网页观察为与答案相关的实体或约束提供了证据;
- •
模型否定先前探索过的错误实体或假设,并将搜索转向更有希望方向的第一个步骤;
- •
关键上下文更新步骤,即模型调用上下文更新工具,将已验证的证据保留在改进状态中,记录未解决的条件,并准备下一个有针对性的研究计划。
这些标注基于可验证的任务结构,而非模型自我报告的推理过程。只有当有效的工具观测结果引入了与答案相关的证据、支持了向解决方案的可验证过渡、或在证据积累后产生了可操作的改进状态时,该步骤才被标记为关键步骤。我们仅对通过最终答案验证的轨迹保留关键步骤标注;因此,仅提及与答案相关的实体、重复工具调用或声称取得进展,若缺乏外部可验证的证据及验证成功的最终结果,均不足以构成关键步骤。所有标注均在离线状态下,针对具有可验证参考答案的训练任务构建,在评估或推理过程中不予使用。
为验证这些检测到的步骤是否确实难以被模型学习,我们在完整轨迹训练后进行了步骤级损失分析。对于轨迹中的每个助手步骤,我们计算其平均 token 损失:
其中 表示步骤 中的第 个助手 token, 为其前文上下文。我们发现,检测到的关键步骤的损失始终显著高于普通轨迹步骤。这表明,即使在完整轨迹监督下,模型仍然对轨迹中信息最丰富、决策最关键的部分欠拟合。
基于这一观察,我们构建了一个关键步骤训练集。对于每个选定的关键步骤,我们保留其完整的前文上下文,使模型在正确的轨迹状态下进行训练。然而,损失仅应用于关键步骤本身,而前缀 token、用户消息和工具观测结果均被掩码处理。关键步骤的目标函数为:
其中 表示选定的关键步骤集合。
该设计保留了选定步骤的条件上下文,同时将优化信号集中在高价值的研究决策上。实验表明,在完整轨迹训练后增加关键步骤聚焦监督,能进一步提升模型在长周期深度研究任务上的表现,这表明对信息性决策点进行选择性监督,可以提高选择性智能体中期训练的有效性。
4.2 步骤感知强化学习
步骤感知组策略优化
我们的中期训练分析表明,长周期研究轨迹具有高度异质性:常规的工具使用或过渡步骤通常易于模仿,而少数关键步骤则困难得多,且对最终任务成功更为重要。这一观察结果也启发了我们的强化学习设计。在深度研究任务中,一条轨迹可能包含多轮搜索、浏览、假设更新和证据验证。由于外部工具可能返回带有噪声或部分相关的观测结果,因此成功轨迹中的并非每个动作都应获得相同的学习信号。
标准的组相对策略优化方法会计算一个序列级别的奖励,并将由此产生的优势传播给轨迹中所有生成的 token。然而,对于长周期的工具使用轨迹而言,序列级别的优势提供的信用分配较为粗糙,因为不同的助手步骤可能扮演着截然不同的角色。我们采用了一种轮次级别的策略优化公式,并通过分层步骤平衡归一化以及与中期训练阶段共享的关键步骤塑形信号,将其适配到长周期深度研究场景中。
对于每个提示词,我们从旧策略中采样多条轨迹。设 表示第 条轨迹中助手步骤的数量,并设 表示其第 个步骤中生成的 token 数量。我们为每个助手步骤构建一个步骤特定的塑形优势。同一轨迹中的所有步骤共享组相对结果优势,而标注的关键步骤则会获得额外的辅助奖励。
对于 token ,我们将 token 级别的概率比定义为
其中 是 token 之前的上下文。然后,我们使用几何平均将 token 级别的比率聚合为长度归一化的步骤级策略比率:
长度归一化使得不同长度的助手步骤之间的策略比率尺度保持可比。随后,我们对步骤和轨迹应用分层平均,以防止较长的轨迹主导训练目标。
我们采用分层归一化方法,先对每条轨迹内的助手步骤进行平均,再对 rollout 组内的各条轨迹进行平均:
这可以防止交互步骤更多的轨迹仅因其长度而主导目标函数,并能更好地反映长周期研究轨迹的异构结构。
我们针对参考策略添加了 KL 惩罚项:
步骤奖励塑形
除结果奖励外,我们还引入了步骤级奖励塑形,以强调信息量丰富的中间决策。这一设计遵循了中期训练中的关键观察:在一条长研究轨迹中,某些步骤比其他步骤更具决定性。第 4.1 节描述的关键步骤标注被复用为有界的辅助塑形信号。
设 表示轨迹级的结果奖励。我们首先计算组内相对结果优势:
其中 和 分别是采样组内奖励的均值与标准差。
对于每个助手步骤 ,我们基于第 4.1 节描述的关键步骤标注定义一个关键步骤指示器 。为避免奖励虚假的中间行为,关键步骤奖励仅在轨迹级结果有效时施加:
我们直接向成功轨迹中标注的关键步骤添加一个有界的辅助奖励。最终的步骤级优势定义为:
其中 控制步骤级塑形的强度。
该公式将最终答案奖励作为主要优化信号,同时为决策关键步骤添加少量辅助偏好。塑形项并非旨在解决所有可能中间动作的通用信用分配问题,而是为那些既可识别又在经验上重要的研究步骤子集提供高精度监督。我们将这种轻量级塑形信号作为最终 AREX 强化学习方案的一部分,同时保留最终答案正确性作为主要优化目标。
5 实验
5.1 实验设置
评测基准。
我们在六个基准测试上评估了 AREX,这些测试覆盖了搜索增强推理的四个互补领域。BrowseComp 和 DeepSearchQA 强调深度研究,需要多步检索、查询重构、证据聚合和答案综合。GAIA 和 xbench-2510 则额外强调智能体任务完成,其中信息搜索必须与规划、工具使用和多步推理相协调。WideSearch 衡量在大搜索空间上的广覆盖检索与综合能力;我们报告了其英文子集的结果。最后,带工具的 HLE 评估了在具备网络搜索和计算工具条件下的高级推理能力。我们报告 WideSearch 的 Item-F1 分数、DeepSearchQA 的 F1 分数,以及其他所有基准测试的准确率。
评估协议。
我们使用一个统一的长期搜索智能体接口来评估我们的模型,该接口包含搜索、访问、更新上下文和完成工具。对于带工具的 HLE,我们增加了一个 python 工具。智能体可以迭代地检索网页、检查来源、维护一个紧凑的工作状态,并返回结构化的最终响应。每个回合最多允许 300 次内部研究循环步骤和 5 次外部自我改进循环操作,遵循 team2026mirothinker 的设置。
5.2 总体性能
| 模型 | BrowseComp | GAIA | xbench-2510 | DeepSearchQA | WideSearch-en | HLE (工具) |
| 前沿模型 | ||||||
| GPT-5.4 | 82.7 | – | – | 88.5 | 77.5 | 52.1* |
| Opus-4.6 | 83.7 | – | – | 91.3 | 77.5 | 53.0* |
| Gemini-3.1-Pro | 85.9 | 80.6 | 53.0 | 93.3 | 66.4 | 51.4* |
| 开源模型 | ||||||
| GLM-5 | 75.9 | 70.0 | – | – | 69.8 | 50.4 |
| Kimi-K2.6 | 83.2 | 80.6 | 90.0 | 92.5 | 80.8 | 54.0* |
| DeepSeek-V4-Flash | 73.2 | – | 69.0 | 90.6 | 76.4 | 45.1 |
| DeepSeek-V4-Pro | 83.4 | – | 80.0 | 88.7 | 78.0 | 48.2 |
| 通义深度研究-30B | 43.4 | 70.9 | 55.0 | – | – | 32.9 |
| Qwen3.5-35B | 61.0 | 80.0 | 50.3 | 68.5 | 57.1 | 47.4 |
| Qwen3.5-122B | 63.8 | 81.6 | – | – | 60.5 | 47.5 |
| Qwen3.5-397B | 78.6 | 83.5 | 61.0 | 82.1 | 74.0 | 48.3 |
| MiroThinker-1.7-mini | 67.9 | 80.3 | 57.2 | 67.9 | – | 36.4 |
| MiroThinker-1.7 | 74.0 | 82.7 | 62.0 | 72.1 | – | 42.9 |
| MiroThinker-H1 | 88.2 | 88.5 | 72.0 | 80.6 | – | 47.7 |
| Quest-35B | 64.6 | 80.8 | – | – | 60.6 | 37.2 |
| 我们的模型 | ||||||
| AREX-Turbo | 70.7 | 81.6 | 57.0 | 78.5 | 68.5 | 40.6 |
| AREX-Base | 82.5 | 85.4 | 71.0 | 89.9 | 82.0 | 52.4 |
如表1所示,AREX在多种搜索增强推理任务上均取得了强劲且一致的表现。在考虑模型规模时,AREX-Base以100亿活跃参数展现了强大的能力与参数规模之间的权衡。它持续优于Qwen3.5骨干模型系列,包括规模大得多的Qwen3.5-397B模型,并在所有评估中与领先的开源和专有研究智能体保持竞争力。在Qwen3.5系列之外,AREX-Base与专门的研究智能体及其他前沿开源系统相比也表现更优。它在DeepSearchQA和纯文本HLE上超越了MiroThinker-H1,同时在xbench-2510上差距在一个百分点以内;它还在DeepSearchQA、WideSearch-en和纯文本HLE上超过了DeepSeek-V4-Pro,并在GAIA和WideSearch-en上优于Kimi-K2.6。在与专有前沿系统的对比中,AREX-Base取得了已报道的最佳WideSearch-en分数,并在BrowseComp和DeepSearchQA上保持竞争力。这些优势从搜索密集型任务扩展到了广泛的信息综合、长周期智能体任务以及专家级推理,AREX-Base在WideSearch-en上取得了最佳总体结果。在紧凑规模上也呈现出类似趋势,其中40亿参数的AREX-Turbo在六项基准测试中的五项上优于Qwen3.5-35B。综合来看,这些结果表明AREX在多种搜索、推理和工具使用场景中具备强大且广泛可迁移的研究能力。其在两种模型规模上的优异表现进一步证明了我们框架的有效性,该框架递归地保留已验证的进展,并将搜索重新导向未解决的约束条件,从而在长期研究视野中实现系统性进步。
5.3 推理框架分析
在推理阶段,AREX 在固定的交互预算下执行内部研究循环。该模型使用 python、search 和 visit 来获取并验证证据,使用 update_context 将不断演进的研究轨迹整合为紧凑的研究状态,并使用 finish 将答案及其支持证据和置信度分数外部化。我们分析了决定 AREX 如何使用其推理预算的两种机制:自主上下文更新(ACU),它刷新内部研究循环内的有效上下文;以及外部自我改进循环,它根据 finish 产生的结构化结果来接受、优化或重新开始递归轮次。该分析区分了三个问题:模型何时调用 update_context、在受控比较下 ACU 和外部自我改进循环如何改变准确率,以及答案级别的置信度分数是否支持基于置信度的决策过程。我们将完整系统称为 AREX w/ ACU。在相应的消融实验(记为 AREX w/o ACU)中,同一模型保留所有其他工具并在相同的交互预算下运行,但无法刷新其研究状态,必须依赖未压缩的交互历史。
上下文更新行为。
我们首先将 ACU 视为一种运行时行为,而不仅仅是一个架构组件。该智能体在 128K token 的活跃上下文窗口内运行。在此预算内,当当前研究轨迹需要整合时,AREX 可以调用 update_context。如果活跃上下文达到 128K token 的限制,则智能体必须在继续研究之前调用 update_context。
| 更新使用情况 | 调用触发条件 | 更新内容 | |||
| 指标 | 数值 | 类别 | 类别 | ||
| 有更新的案例 | 80.3% | 修订搜索策略 | 66.9% | 已验证的发现 | 72.1% |
| 上限 | 128,000 | 拒绝候选 | 13.6% | 当前候选 | 39.2% |
| 最小上下文 token 数 | 3,788 | 验证证据/答案 | 5.3% | 未解决的约束 | 95.5% |
| 平均上下文 token 数 | 25,721 | 识别新线索 | 7.2% | 有效性疑虑 | 14.1% |
| 中位数上下文 token 数 | 25,386 | 总结进展 | 6.4% | 被拒绝的候选 | 81.5% |
| 最大上下文 token 数 | 128,591 | 其他 | 0.6% | 下一步计划 | 96.4% |
表 2 显示,AREX 在 80.3% 的 BrowseComp 案例中调用了 update_context。更新发生时,平均活跃上下文大小为 25,721 个 token,中位数为 25,386 个 token,远低于配置的 128K token 上限。仅有 0.01% 的更新达到或超过该限制。这一时机表明,ACU 主要被用作一种主动的研究操作,而硬性限制则充当安全约束,而非主要触发因素。
调用触发因素显示了研究策略在何时判定需要紧凑状态。搜索策略修订占调用次数的 66.9%,其次是候选方案拒绝,占 13.6%。识别新线索、总结进展以及验证证据或暂定答案所占份额较小。当检索方向变得无效,或新证据改变了哪些候选方案仍然可行时,模型最常刷新其状态。
更新内容凸显了 ACU 在保留与决策相关的研究状态方面的重要性。总体而言,ACU 保留了后续推理所需的大部分有效信息,尤其是未解决的约束条件和下一步计划,这些是最稳定保留的元素。这表明 ACU 优先考虑关于哪些内容仍需核查、哪些条件仍需满足以及下一步应采取哪些行动的信息。它还保留了已验证的发现和被拒绝的候选方案,确保后续决策基于已确立的证据,同时避免走先前已证明无效的路径。从这个意义上说,ACU 充当了研究过程的紧凑表征,围绕已确认的证据、剩余约束、已排除的替代方案以及计划中的后续行动来组织信息。
综合来看,使用模式、触发模式和内容模式将 ACU 刻画为一种用于长周期研究的轨迹整合与研究状态刷新机制。通过在有意义的关键转折点进行更新,并同时保留正面和负面证据,ACU 帮助 AREX 避免重复之前已被否决的路径,并将剩余交互预算用于解决尚未解决的约束条件。
递归式自我改进。
表 3 将递归式自我改进的两个部分分开:内部研究循环中的 ACU 和外部自我改进循环。没有外部循环的行会接受 `finish` 生成的第一个输出,因此它们隔离了用 ACU 构建的有效上下文替换完整轨迹所带来的影响。在这种匹配的单轮设置下,ACU 将 BrowseComp 的准确率从 59.6 提升至 71.4,绝对提升了 11.8 个百分点。这一提升支持了内部循环的论断:包含已验证发现、被否决候选方案、未解决约束条件以及来源标识符的刷新研究状态,比完整的交互历史对研究策略更有用。
| 方法 | 设置 | 准确率 |
| 不含 ACU 的 AREX | 无外部循环 | 59.6 |
| 有外部循环 | 69.8 | |
| 含 ACU 的 AREX | 无外部循环 | 71.4 |
| 有外部循环 | 82.5 |
方法内部的差异隔离了在内部循环产生结构化结果后,外部自我改进循环所带来的影响。在没有 ACU 的情况下,启用外部循环将准确率从 59.6 提升至 69.8,绝对提升了 10.2 个百分点。在有 ACU 的情况下,相同的外部循环将准确率从 71.4 提升至 82.5,提升了 11.1 个百分点。这些一致的提升显示了外部自我改进循环的重要性:当 AREX 能够在生成低置信度的结构化结果后运行另一轮递归,而不是直接返回 `finish` 生成的第一个答案时,它就能得到改进。完整系统达到了 82.5 的准确率,比既没有 ACU 也没有外部自我改进循环的配置高出 22.9 个百分点。
答案级置信度分数。
图 3 评估了由 finish 生成的置信度分数,该分数是内循环传递给外自我改进循环的结构化结果的一部分。正确的最终输出集中在 90–100 区间,其中不使用 ACU 时有 89.3% 的正确输出落在此区间,使用 ACU 时则为 95.9%。错误的最终输出则保留了大量的低置信度分布:不使用 ACU 时有 61.0% 的错误输出低于 60,使用 ACU 时则为 55.2%。这种分离支持了基于置信度的决策流程,因为许多失败案例可以通过答案级别的置信度分数识别出来,而无需重新解读整个轨迹。
5.4 消融实验
我们在 BrowseComp 上进行了受控消融实验,以检验 AREX 训练方案中的三个组成部分:渐进式多轮能力训练、关键步骤聚焦监督以及步骤感知强化学习。所有变体均使用相同的模型初始化,并保留其余的训练流程。对于与监督相关的消融实验,我们匹配了监督 token 和优化预算;对于强化学习,我们保持提示词、展开预算、初始化和训练计划不变。
渐进式多轮能力训练。
我们中期训练流程的第一阶段旨在按顺序获取互补能力。模型首先在浏览密集型、多轮工具交互轨迹上进行训练,以建立网页导航、证据获取和迭代研究行为。随后,模型在推理密集型轨迹上进行训练,这些轨迹更侧重于长文本推理、假设验证和困难问题求解。为了评估这种渐进式排序是否必要,我们将渐进式多轮能力训练流程替换为直接混合训练,即从训练开始就将浏览密集型和推理密集型数据合并,并在匹配的整体训练预算下进行。此消融实验旨在检验渐进式获取工具使用和推理能力是否比从单一混合分布中同时学习这些能力更有效。
如表 4 所示,将渐进式多轮能力训练替换为直接混合训练后,BrowseComp 准确率从 82.5 下降至 77.5。尽管两种设置使用了相同的浏览密集型与推理密集型能力分布,但分阶段方案首先建立多轮工具使用行为,之后再引入推理密集型监督。这一结果表明,这种顺序安排减少了异构训练目标之间的干扰,并为后续的整合与强化学习阶段提供了更强的初始化基础。
步骤级损失分析。
我们分析了第 4.1 节中识别的关键步骤在完整轨迹中期训练后是否仍然困难。对于每个助手步骤,我们计算其在训练模型下的平均 token 级负对数似然,并比较标注的关键步骤与普通步骤的平均损失。
如图 4 所示,普通步骤的平均损失为 0.232,而所有三类标注的关键步骤均表现出更高的损失。证据发现、路径拒绝与重定向、以及关键上下文更新的平均损失分别为 0.277、0.298 和 0.300。这些数值相对于普通步骤分别增加了约 19%、28% 和 29%。三类步骤之间一致的差距表明,完整轨迹监督更容易学习常规动作,而建立证据、修正研究方向或解决上下文更新等中间决策则相对学习不足。
关键步骤聚焦监督与步骤感知强化学习。
我们在匹配的训练条件下,评估了关键步骤聚焦监督和步骤感知强化学习在 BrowseComp 上的效果。对于没有关键步骤聚焦监督的变体,选定的关键步骤会被替换为从同一浏览密集型轨迹池中随机采样的助手步骤。随机步骤基线使用相同的前缀条件训练格式,仅对采样步骤计算损失,并匹配了监督 token 和优化预算。对于没有步骤感知强化学习的变体,我们将完整的步骤感知目标替换为标准 GRPO,同时保持 RL 提示词、rollout 预算、初始化和训练计划不变。
将关键步骤聚焦监督替换为等预算的随机步骤回放,使 BrowseComp 准确率从 82.5 降至 74.1,这是消融实验中降幅最大的。由于普通步骤在长程轨迹中占大多数,随机步骤基线主要回放的是那些已经表现出较低损失的常规行为。结合图 4,这一结果表明,将额外的监督集中在学习不足、决策关键步骤上,比分配给任意中间动作要有效得多。
最后,在相同的 rollout 和训练配置下,将步骤感知强化学习目标替换为标准 GRPO,准确率从 82.5 降至 79.4。由此带来的 3.1 个百分点的提升表明,在中期训练期间建立主要能力之后,步骤感知策略优化进一步改进了研究策略。
| 训练设置 | 准确率 |
| 将多轮能力训练替换为混合训练 | 77.5 |
| 将关键步骤聚焦监督替换为随机步骤回放 | 74.1 |
| 将步骤感知 RL 替换为标准 GRPO | 79.4 |
| 完整 AREX | 82.5 |
总体而言,消融实验表明,AREX 的性能得益于互补的训练组件。渐进式多轮能力训练建立了长程交互行为,关键步骤聚焦监督强化了困难且具有决定性的中间动作,而步骤感知强化学习则进一步优化了由此产生的研究策略。
6 结论
在这项工作中,我们介绍了 AREX,一个用于深度研究的递归式自我改进智能体。AREX 利用深度研究中发现与验证的不对称性,将临时答案转化为部分验证的研究状态,保留有证据支持的内容,同时将未解决的论断分离出来,供后续针对性调查。结合自主上下文更新和步骤感知训练,AREX 在深度搜索、广度搜索、智能体推理和工具使用基准测试中均取得了强劲性能。我们的初步训练分析进一步强调了在长程轨迹中识别并强化决策关键步骤的重要性,而非对所有中间动作一视同仁。未来工作将探索更通用、更自主的机制,用于估计步骤效用并分配细粒度的训练信号。这些结果表明,基于验证的状态精炼和步骤感知优化为构建可靠的长程研究智能体提供了一个有前景的方向。
参考文献
附录 A 相关工作
工具增强型深度研究
语言模型智能体将大语言模型从静态响应生成扩展到借助工具、网络环境和外部知识源进行迭代式问题求解(react; toolformer; webgpt)。深度研究进一步推动了这一范式:智能体必须定位稀疏证据、对比矛盾来源、并综合出满足多重耦合约束的答案(deepresearch; deepresearch_survey)。近期系统通过工具使用监督、合成轨迹构建、智能体微调、强化学习以及更长搜索轨迹上的推理时扩展来提升研究性能(searchr1; webdancer; websailor; tongyi_deepresearch; minddr; beyond_ten_turns)。这些方法主要强化了研究轨迹内部的探索。AREX 解决了一个互补性问题:在取得部分进展后,智能体必须识别哪些约束已得到支持、哪些仍未解决,以及这一诊断应如何定义下一个研究问题。
验证作为递归式研究控制。
验证已被广泛用于改进推理,通常表现为结果排序、过程监督或步骤级奖励建模(lets_verify; math_shepherd)。近期工作进一步利用了生成正确解与验证给定解之间的不对称性,使用验证来引导测试时搜索或评判中间智能体决策(zeng2025pushing; team2026mirothinker)。AREX 将验证用于不同的角色。AREX 并未将其视为最终接受过滤器或局部动作评判器,而是使验证成为研究轮次之间的转移算子。约束级审计将临时答案转化为部分验证的研究状态:已支持的声明得以保留,未解决的条件被隔离,矛盾证据被呈现。因此,下一轮研究由剩余不确定性的结构驱动,而非搜索的无方向延续。
研究状态管理与长周期训练。
持续的研究需要智能体在包含证据、失败的搜索、推测性假设和不断演变的计划的漫长轨迹中维护有用信息。先前的工作研究了分层记忆、虚拟上下文管理、学习型记忆状态、周期性摘要以及显式的记忆编辑动作(memgpt; hiagent; mem1; resum; supo; memory_as_action)。AREX 在此基础上发展,通过学习调用一个上下文更新工具,该工具生成一个围绕当前研究目标组织的改进状态,包括已验证的证据、引用、约束状态、未解决的空白以及下一步计划。训练此类智能体也带来了稀疏的信用分配挑战,因为最终的成功很少能揭示哪些中间步骤是决定性的。受过程监督和回合级信用分配(lets_verify; math_shepherd; ragen; turn_credit)的启发,AREX 增加了对关键步骤的暴露,在这些步骤中获取证据、解决矛盾或修复错误方向,从而在高效密集和混合专家模型规模(switch_transformer; gshard; mixtral; deepseekv3)下实现递归研究控制。
附录 B 简化设置下的初步探索
本节探讨了一个未纳入最终 AREX-Base 方案的训练方向。该实验使用了一个早期的简化配置,工具集减少,并且没有 ACU、外部自我改进循环、关键步骤监督、完整的多阶段数据混合或完整的测试时扩展策略。因此,其绝对的 BrowseComp 分数既不能与完整的 AREX-Base 系统直接比较,也不能与原始骨干模型报告的结果直接比较。该比较仅旨在衡量同一受控设置内的相对差异。
轨迹自蒸馏。
我们进行了一项初步实验,以检验一个经过浏览训练的智能体能否为从同一骨干网络初始化的新模型提供更优的监督信号。直接训练和自蒸馏两种变体均使用 122B-A10B 初始化、相同的问题分布以及匹配的训练与推理配置。直接训练基线从原始的浏览密集型轨迹中学习。对于自蒸馏,一个中间阶段的浏览训练智能体会为相同问题重新生成轨迹,随后在基础模型的新副本上对接受的生成轨迹进行训练。
在此简化设置下,轨迹自蒸馏将 BrowseComp 得分从 52.3 提升至 57.1,提高了 4.8 个点(表 5)。这一结果表明,对于同一骨干网络,由中间阶段智能体生成的轨迹可能比原始轨迹提供更有效的监督信号。可能的解释包括:与目标策略的动作分布更优的对齐、更一致的搜索决策,以及更清晰的中间推理结构。
这项初步研究并未分离出改进的具体来源,也未证实该增益在与 ACU、关键步骤监督以及完整 AREX 训练方案结合时能够持续。此外,自生成的轨迹可能继承或放大教师模型的偏差和失败模式。因此,我们将轨迹自蒸馏作为未来迭代中一个具有前景的方向来呈现,而非作为最终系统的一个组成部分。
| 训练设置 | BrowseComp |
| 直接训练 | 52.3 |
| 自蒸馏 | 57.1 |
贡献者
核心贡献者:Shuqi Lu¹¹这些作者对本文贡献相同。、Chaofan Li¹¹footnotemark: 1、Kun Luo¹¹footnotemark: 1、Zhang Zhang、Hui Wang、Hongwang Xiao、Zheng Liu²²²Zheng Liu 是项目负责人。
参与者:Lei Xiong、Jiahao Wang、Sen Wang、Xiyan Jiang、Wanli Li、Yuyang Hu、Hongjin Qian、Bingyu Yan、Ziyi Xia
顾问:邵英夏、刘康、窦志成、何迪、李朝卓、叶启伟、王仲远