# Video-DeepResearch：迈向下一代多模态深度研究智能体

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-04 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsfoajgx07p9roch4d7vrjuh
- 原文链接：https://arxiv.org/abs/2608.03979

## 精选理由

将深度研究从静态图像扩展到视频流，通过强制视觉定位再检索的两阶段训练，让模型摆脱了对文本搜索的路径依赖，给视频智能体研发提供了可验证的训练范式。

## AI 摘要

Video-DeepResearch（Video-DR）将多模态智能体从静态图像扩展到连续视频流，提出解耦感知-探索流水线与分阶段工具解锁，以应对模态偏差和参数知识泄漏两大瓶颈。

## 正文

fazii@mail.ustc.edu.cn, wxhuang0616@gmail.com

摘要

我们提出了 Video-DeepResearch（Video-DR），将多模态智能体从静态图像扩展到连续视频流——这一设定要求密集的时空定位与开放网络探索相结合。初步评估揭示了当前模型的两个关键瓶颈：（1）模态偏差，即智能体绕过视觉工具而偏向文本搜索；（2）参数化知识泄漏，即模型依赖内部记忆而非真正的工具增强执行。为应对这些挑战，我们提出了 Video-DeepResearch，其采用解耦的感知-探索流水线，并通过分阶段工具解锁机制，强制在网络检索之前完成跨帧视觉定位。我们的框架采用两阶段训练方案——监督微调后接组相对策略优化（GRPO）——从而实现突破模仿学习上限的自主探索。此外，我们构建了 VideoDR-Bench，一个人类与 AI 协作的基准测试集，包含 200 个复杂的多跳 VQA 实例。实验结果表明，我们的 Video-DeepResearch-35B-A3B 取得了 64.0% 的平均准确率，创下新的最先进水平，超越专有模型 Claude-4.5-Sonnet（59.0%）5.0 个百分点，并显著优于 GPT-5（52.5%）和 Gemini 2.5 Pro（57.5%）。30B-A3B 变体达到 59.3%，与 Claude-4.5-Sonnet 相当，证明了我们的训练范式即使在紧凑规模下也行之有效。

Video-DeepResearch：迈向下一代多模态深度研究智能体

Video-Deepresearch 团队 fazii@mail.ustc.edu.cn, wxhuang0616@gmail.com https://github.com/Osilly/Vision-DeepResearch

1 引言

通过主动交互来执行长周期任务，是迈向 AGI 征程中的一个关键里程碑，而近期深度研究智能体的兴起正是这一能力的集中体现（Li et al. (2025b)；Wu et al. (2025a)；Tao et al. (2025)）。借助先进的视觉语言模型（Bai et al. (2025)；Team (2026)；Comanici et al. (2025)），研究智能体已经深入非结构化、视觉信息丰富的数字旷野之中（Chen et al. (2026)；Huang et al. (2026)；Ma et al. (2025)；Wu et al. (2025b)；Feng et al. (2026)）。这一转变将智能体的工作重心从处理纯净的文本输入，转向从嘈杂、高度冗余的多媒体网页布局中提炼关键信息，从而重新定义了自主探索的复杂度。

以往针对这些挑战的文献，大体沿着一条多模态路径演进。基于文本的网页智能体，尤其是 WebGPT（Nakano et al. (2021)）和 AutoGPT（Yang et al. (2023)），奠定了通过程序化搜索进行迭代式知识综合的基础。为了适应丰富的视觉布局，后续范式转向感官界面；诸如 WebWatcher（Geng et al. (2025)）之类的框架引入了多种视觉工具以改善搜索效果，而近期的 Vision-DeepResearch（Huang et al. (2026)）则进一步拓展了这一前沿，能够在高度密集、复杂的视觉情境中执行多步骤、穷尽式的搜索。

尽管取得了这些进展，现有文献仍绕开了一个生态效度更高、但也更具挑战性的场景：视频深度研究（Video-DeepResearch，Video-DR）。这一范式将焦点从单一模态转向一个整体性环境，其中基于文本的综合分析与密集视觉追踪深度交织，从根本上重新定义了自主智能体的认知负载。开拓这一 Video-DR 前沿领域面临两大现有方法无法解决的根本瓶颈。首先，在数据合成方面，如何构建与视频深度研究内在特性相匹配的有效训练流水线，在很大程度上仍是一个未解难题。传统视频数据集侧重于局部描述或短期动作标签；相反，Video-DR 需要生成式数据策展，将长时程决策轨迹与密集、随时间变化的文本和视觉证据相结合。其次，从评测角度来看，建立一套严谨且高保真的基准测试也是一项艰巨挑战。标准视觉问答指标不足以衡量智能体的多步策略执行能力，因此迫切需要多维评测协议，能够在连续时间动态下准确量化长期推理一致性与错误恢复行为。

图 1：视频深度研究（Video-DeepResearch）流水线概览。

为应对这些挑战，我们首先对当前智能体直接应用于视频深度研究（Video-DR）时的根本性失败模式进行了实证调查。通过在现有基准上评估三个代表性模型（Liu et al., 2026），我们发现了两个惊人结论：（i）严重的模态偏差——即使是最强的开源模型，每项任务平均仅调用 0.10 次视觉工具，却严重依赖文本搜索（1.27 次调用），这表明模型系统性地回避主动视觉探索；（ii）参数化知识泄漏——GPT-5 在几乎零工具调用的情况下达到了 57% 的竞争性准确率，这表明现有评测在很大程度上仅靠记忆的世界知识即可解决。这些发现促使我们对视频深度研究智能体的训练与评测范式进行整体性反思。

基于这些洞察，我们提出了 Video-DeepResearch，一个统一框架，共同应对视频深度研究（Video-DR）在数据、训练和评测方面的挑战。我们的贡献总结如下：

一个可扩展的数据引擎，通过解耦的感知-探索流水线配合分阶段工具解锁，生成了 3 万条视频锚定问答对和 7 千条精选轨迹，直接针对我们初步研究中揭示的模态偏差问题。

一种两阶段训练方案，将监督微调与 GRPO 相结合，使紧凑型模型能够超越规模大得多的专有系统。我们的 Video-DeepResearch-35B-A3B（64.0%）确立了新的最先进水平，以 5.0 个百分点的优势超越 Claude-4.5-Sonnet（59.0%）；30B 变体（59.3%）在与专有基线相当的性能水平上，展现了强大的开源能力。

VideoDR-Bench，一个包含 200 个实例的多跳 VQA 基准，通过可扩展的人机协同标注构建而成，其中每个问题都被证明必须同时依赖视觉搜索和外部知识推理。

2 一种朴素尝试：从图像深度研究到视频深度研究

如图 1 所示，我们将视频概念化为关键实体轨迹的时间组合。因此，我们的核心洞察在于，Video-DR 可以被构建为一个顺序式定位流程：识别关键时间帧、执行局部视觉搜索，并通过后续的文本检索来综合发现。为了将这一工作流落地，并弥合与以图像为中心的研究之间的差距，我们为智能体配备了两个基础工具：Select_Keyframe 和 Crop_Search。具体而言，智能体首先使用 Select_Keyframe 从连续流中分离出信息量丰富的时刻，然后对显著实体应用 Crop_Search 来构建精确的视觉查询，这为下游基于文本的探索提供了坚实的锚点。

图 2：VideoDR-Bench 概览。该基准涵盖六个视频领域：知识（29.5%）、娱乐（22.0%）、日常生活（18.5%）、游戏与体育（14.5%）、新闻（12.0%）以及其他（3.5%）。每个实例都要求联合进行视觉定位和多跳外部知识推理。

问题定义

形式上，给定一个复杂的研究查询和视觉输入（可以是连续的视频流，也可以是预先采样的一系列关键帧），Video-DR 智能体的目标是综合出一个全面的响应。我们将其构建为一个顺序决策过程。在第 t 步，智能体基于历史轨迹生成一个动作：QV={v1,v2,…,vT}Riai∈𝒜ℋi=[Q,V,a1,o1,…,ai−1,oi−1]

ai∼πθ​(a∣ℋi) (1)

其中 π 表示多模态策略，o 是来自环境的执行观测。为了实现时空定位流程，动作空间包含我们定义的工具以及标准的网络操作：。具体而言，时间工具选择特定索引来分离出信息丰富的帧。随后，空间工具接收该帧和一个边界框来裁剪目标实体，从而为下游搜索生成局部视觉上下文。或者，这两个工具也可以封装为一个联合操作。πθo𝒜𝒜={Select_Keyframe,Crop_Search,Text_Search,…}t∈{1,…,T}vtvtB∈ℝ4cv​i​s=Crop​(vt,B)

实证研究

为了实证评估这一朴素公式，我们在 VideoDR Liu et al. (2026) 基准上使用三个代表性模型实例化了该智能体，并专门跟踪每个工具的执行频率，以分析其行为模式。

媒体内容 · 前往原文查看

表 1：各模型在 VideoDR Liu et al. (2026) 上的准确率与平均工具调用次数对比。

模型 准确率 视觉工具 文本工具

Qwen3.5-35B-A3B 41 0.04 0.58

Qwen3.5-397B-A17B 58 0.10 1.27

GPT-5 57 0.00 0.12

如表 1 所示，我们的初步评估得出了两个关键发现：

发现 1：严重的模态偏差与视觉工具回避。当前模型表现出对调用视觉工具的内在抵触。即使是最强大的开源模型 Qwen3.5-397B-A17B，每个任务平均仅执行 0.10 次视觉操作，而压倒性地偏向文本工具（1.27）。这表明智能体主要默认采用文本搜索，完全绕过了预期的主动视觉探索。

发现 2：易受参数化知识泄漏影响。现有评估设置存在严重的先验知识泄漏问题。值得注意的是，GPT-5 在几乎不进行任何工具调用（视觉 0.00，文本 0.12）的情况下，取得了极具竞争力的 57 分。这表明该模型完全绕过了多步接地过程，仅依靠其庞大的内部记忆来臆造或直接猜测正确答案。

3 Video-DeepResearch

图 3：Video-DeepResearch 概览。第一阶段：来自多种来源的原始视频通过基于规则和基于智能体的阶段进行过滤。第二阶段：选择关键帧，裁剪实体以进行视觉搜索，并通过单实体和多实体模式合成 VQA 对，同时进行参数泄漏过滤。第三阶段：通过解耦的感知-探索流水线构建轨迹：智能体首先使用 Select_Keyframe 和 Crop_Search 在帧间对实体进行接地，然后动作空间扩展至 Search 和 Visit 以进行网络探索；只有正确的轨迹才能通过拒绝采样存活下来。

我们首先详细介绍一个用于合成视频问答数据的生成式流水线（第 3.1 节），它是构建高质量执行轨迹的基础（第 3.2 节）。在此精选数据的基础上，我们接着描述智能体的多模态训练流程（第 3.3 节），最后建立一个稳健的基准测试来评估视频深度推理（Video-DR）能力（第 3.4 节）。

3.1 视频问答生成

鉴于缺乏专门用于视频深度推理的数据集，我们通过合成基础视频问答对来启动流水线。该流程将原始视频转化为明确的视频问答对。为确保数据质量，我们为每个实例标注中间证据，从而保证所生成查询的可视觉锚定性和可回答性。

第 0 步：多领域视频筛选。我们首先从多个领域精选多样化的原始视频集合。这些视频既来自已有的视频数据集 Ben-Ami 等人（2025）；Ataallah 等人（2025）；Wu 等人（2024）；Wang 等人（2025）；Tao 等人（2026）；Li 等人（2024，2025a）；Goel 等人（2026）；Li 等人（2026）；Cheng 等人（2025a）；Fu 等人（2025a）；Hu 等人（2025）；Yang 等人（2025a）；Hong 等人（2026）；Yang 等人（2025b）；Wang 和 Yang（2026），也来自真实世界流媒体平台¹¹¹YouTube。这些视频随后经过两阶段筛选流程。首先，基于规则的过滤器剔除超出预设时长阈值的样本。其次，我们引入一个智能体筛选阶段，由 Qwen3.5-35B-A3B Team（2026）评估内容复杂度，剔除信息量不足或过于简单的视频。随后，该精选数据集被划分为训练集（用于构建训练轨迹）和测试集（用于建立评估基准）。

步骤 1：关键帧选择与视觉搜索。随后，我们启动一个由智能体驱动的元数据整理流程。具体而言，在通过基于 CLIP 的帧间相似度提出候选帧之后，我们部署 Qwen3.5-397B-A17B Team (2026) 来完成关键帧的最终选定。对于每一个关键帧，同一模型会预测边界框以定位不同的实体。这些实体随后被裁剪出来，用于执行视觉搜索查询。为确保数据保真度，一个辅助模型（Qwen3.5-35B-A3B）会验证裁剪区域与检索结果之间的语义一致性。验证通过后，我们编译视频元数据，并将其结构化为一个元组：。vtvtBe⟨vt,B,entity name,search summary⟩

步骤 2：VQA 生成与验证。最后，我们通过两种生成模式从整理好的元数据中合成问答对：（1）单实体：采样一个实体来构建基于事实的问题；（2）多实体：采样多个实体来构建需要跨实体推理的组合式问题。在两种设置下，我们都明确惩罚表面化的视觉属性查询。生成之后，我们严格过滤掉容易发生参数记忆泄漏的实例。具体而言，我们对每个问题执行四次无工具推理；如果智能体在任意一次尝试中回答正确，该实例将被永久丢弃，从而保证剩余任务严格需要外部工具的使用。最终，我们获得了 3 万对 VQA 数据。n

3.2 轨迹生成

基于合成得到的 VQA 问答对，我们进一步构建用于智能体训练的执行轨迹。如第 2 节所述，当前的视频文档检索（Video-DR）智能体在调用视觉工具方面存在天然的惰性，往往绕过视觉工具而倾向于仅依赖文本搜索。为克服这种模态偏差，我们提出了一种解耦的轨迹构建流程，将视觉感知与网页探索明确分离。具体而言，我们使用 Qwen3.5-397B-A17B 生成轨迹，并采用拒绝采样进行筛选。为实现解耦，我们采用了一种分阶段的工具解锁策略。在初始阶段，智能体被限制在仅视觉的动作空间中，该空间仅包含 Select_Keyframe 和 Crop_Search 两个动作。智能体不会急于给出答案，而是被迫通过跨多个关键帧裁剪不同实体来执行充分的视觉检索。一旦智能体判定视觉上下文已足够——或达到预设的最大感知轮次——我们便将动作空间扩展至包含文本工具（Search 和 Visit），并提示智能体推导出最终答案。这种两阶段范式迫使模型在网页探索之前进行彻底的跨帧、跨实体视觉定位。最后，我们仅保留成功解决的轨迹用于下游策略训练。最终，我们获得了 7k 条正确轨迹。

3.3 训练

我们采用两阶段训练范式。我们选择 Qwen3-VL-30B-A3B-Instruct（Bai 等人，2025）作为 Video-DeepResearch-30B-A3B 的基础模型，因为它是被广泛采用的开源视觉语言模型（VLM），并且拥有强大的 AI 基础设施支持。对于 Video-DeepResearch-35B-A3B，我们采用 Qwen3.5-35B-A3B（Team，2026）作为基础模型，并遵循相同的训练方案。两个变体都经历完全相同的训练流程。在第一阶段，我们进行监督微调（SFT）以建立冷启动。此阶段旨在使模型与期望的解耦感知-探索工作流对齐，使其内化正确的多模态推理语法。在第二阶段，我们应用组相对策略优化（GRPO）来进一步优化策略。通过主动生成轨迹并为成功轨迹获得奖励，智能体被鼓励自主探索动作空间，从而超越初始 SFT 阶段的性能上限。实验在包含四个 NVIDIA H800（80GB）GPU 节点的计算集群上进行。更多细节详见附录 B。

SFT

对于 SFT 阶段，我们利用第 3.2 节中合成的 7K 高质量轨迹，使模型能够内化解耦感知-探索范式。此外，为了解决表 LABEL:tab:_motivation 中观察到的文本工具利用不足的问题，我们用来自 VDR（Huang 等人，2026）的额外 7K 纯文本问答实例扩充了训练语料库。这种混合训练策略明确强化了智能体的基础深度研究能力。相同的数据方案应用于 30B 和 35B 两个变体。形式上，给定混合数据集，其中每个实例包含一个上下文（包括系统提示词、视觉输入和交互历史）和目标输出序列，SFT 的目标是最小化标准的自回归负对数似然：𝒟xy={y1,…,yN}

ℒSFT=−𝔼(x,y)∼𝒟​[∑i=1|y|log⁡πθ​(yi∣x,y<i)] (2)

其中表示基础模型的策略，表示前面的 token。πθy<i

RL

为了推动智能体超越静态的 SFT 模仿，并激励其进行内生探索，我们采用了组相对策略优化（GRPO）方法（Shao 等人，2024）。GRPO 通过组内相对奖励来计算优势值，有效消除了独立价值网络带来的内存开销。我们构建了一个包含 2K 个中等难度样本的 RL 数据集，方法是对每条轨迹执行四次 rollout（见第 3.2 节），并严格保留 Pass@4 得分在 0 到 1 之间的实例。我们采用稀疏二元奖励，对正确答案（由 Qwen3-VL-30B-A3B-Instruct 评判）给予奖励，否则不给予奖励。为防止格式违规或重复循环主导更新过程，我们计算相应的优势值，但对其负梯度进行降采样，仅以 20% 的概率应用这些梯度。目标函数定义为：r=1r=0A^

ℒGRPO=1G∑i=1G[min(πθ​(oi)πold​(oi)A^i,clip(πθ​(oi)πold​(oi),1−ϵ,1+ϵ)A^i)]−β𝔻KL (3)

3.4 VideoDR-Bench

为了建立我们的评估基准，我们从经过严格筛选的视频池中抽取了一个子集。由于一个稳健的基准必须同时满足可回答性和高数据保真度的要求，我们引入了一个可扩展的“人在回路”标注框架来完成最终的策展工作。

具体来说，给定一段视频和一个可选的来源 URL，人工标注者被指示在关键时间戳处暂停。随后，他们利用 Crop_Search 工具查询显著的视觉实体，严格核验检索到的外部证据与原始帧之间的一致性。基于这些核验结果，标注者为每段视频构建若干条种子 VQA 对。随后，这些种子被输入到一个多智能体框架中，以综合生成复杂的多跳推理问题。具体而言，多智能体流水线的运作方式如下。首先，一个起草智能体（Drafting Agent）构思语义方向以扩展种子 VQA（例如，将“勒布朗·詹姆斯”这样的基础答案扩展为与其球队、配偶或 MVP 奖项相关的关键词）。这些生成的关键词随后通过搜索引擎进行查询。接下来，一个问答生成智能体（QA Generation Agent）利用检索到的网页上下文来构建新颖的多跳问题。为严格强制外部工具依赖，我们过滤掉那些模型无需工具访问即可正确回答的问题（即参数化知识泄漏）。随后，人工标注者根据检索到的证据手动核验剩余候选问题的可回答性。在此之后，一个排序智能体（Ranking Agent）对已核验的问题进行评分，仅保留得分最高的实例。至关重要的是，这个排名最高的 VQA 可以递归地作为新的种子，从而实现迭代循环，以综合生成日益复杂、跳数更高的推理任务。

媒体内容 · 前往原文查看

表 2：VideoDR-Bench 的视频时长分布。

视频类型 时长（分钟） 数量 占比

短视频 ≤2 92 46.0%

中视频 2∼10 68 34.0%

长视频 ≥10 40 20.0%

4 实验

4.1 实验设置

我们在 VideoDR-Bench 和 VideoDR 上评估了多种视觉语言模型（VLM），包括 Gemini 2.5 Pro、GPT-5、Claude-4.5-Sonnet、Qwen3-VL-30B-A3B-Instruct、Qwen3.5-35B-A3B、Qwen3.5-397B-A3B 以及 Kimi K2.5。VideoDR-Bench 是一个包含 100 条人工标注 VQA 对的评测基准，旨在通过整合视频上下文与开放网络探索来评估智能体的复杂推理能力。

我们在智能体（Agentic）设置下评估模型：即模型配备如表 6 所示的完整视觉和文本工具套件。

表 3：视频深度研究智能体基准测试的主要结果。我们在两种不同的执行设置下评估了多种最先进的视觉语言模型（VLM）：直接（Direct，无工具基线）和智能体（Agentic，配备完整视觉和文本工具套件）。性能指标涵盖 Video-DR（准确率）以及我们提出的 VideoDR-Bench 基准中的六个细粒度类别，同时报告总体平均得分。VideoDR-Bench 的列缩写对应相应视频类别：KNL 表示知识，ENT 表示娱乐，DLY 表示日常，G&S 表示游戏与体育，NWS 表示新闻，OTH 表示其他。

模型 Video-DR VideoDR-Bench（准确率 %） 平均

准确率 KNL ENT DLY G&S NWS OTH 总体

闭源模型

Gemini 2.5 Pro Comanici et al. (2025) 62.0 54.2 52.3 51.4 51.7 54.2 57.1 53.0 57.5

GPT-5 OpenAI. (2025) 57.0 50.8 45.5 48.6 48.3 45.8 42.9 48.0 52.5

Claude-4.5-Sonnet Anthropic (2025) 63.0 55.9 54.5 54.1 58.6 54.2 42.9 55.0 59.0

开源模型

Qwen3.5-397B-A13B Team (2026) 58.0 49.2 61.4 40.5 55.2 29.2 14.3 47.5 52.8

Kimi K2.5 Team et al. (2026) 61.0 54.2 52.3 51.4 51.7 54.2 57.1 53.0 57.0

Qwen3-VL-30B-A3B-Instruct Bai et al. (2025) 38.0 44.1 43.2 35.1 51.7 41.7 42.9 43.0 40.5

Video-DeepResearch-30B-A3B（我们的模型） 62.0 62.7 61.4 40.5 58.6 58.3 42.9 56.5 59.3

提升幅度↑ +24.0 +18.6 +18.2 +5.4 +6.9 +16.6 0.0 +13.5 +18.8

Qwen3.5-35B-A3B Team (2026) 42.0 45.8 50.0 40.5 44.8 33.3 28.6 43.5 42.8

Video-DeepResearch-35B-A3B（我们的模型） 68.0 66.1 65.9 56.8 62.1 41.7 42.9 60.0 64.0

提升幅度↑ +26.0 +20.3 +15.9 +16.3 +17.3 +8.4 +14.3 +16.5 +21.2

arxiv

为保证公平，在相同的交互约束下，我们从轨迹的最后一步提取最终预测。随后由 Qwen3-VL-30B-A3B-Instruct 采用通义深度研究团队等（2025）的官方评判提示词对正确性进行评估。

4.2 主要结果

主要评估结果汇总于表 4.1。我们提出的 Video-DeepResearch 在多个模型规模上展现出卓越的深度研究能力。

Video-DeepResearch-35B-A3B。在所有被评估模型中，我们的 35B 变体以 64.0% 的整体平均准确率确立了新的最先进水平，比领先的闭源模型 Claude-4.5-Sonnet（59.0%）高出 5.0 个百分点。与其基础模型（Qwen3.5-35B-A3B）相比，Video-DeepResearch-35B 实现了显著的 +21.2% 提升，其中在知识密集型（KNL：+20.3%）和娱乐（ENT：+15.9%）类别中表现尤为突出。值得注意的是，Video-DeepResearch-35B 在所有被评估模型中取得了 VideoDR-Bench 的最高分（65.4%）。

Video-DeepResearch-30B-A3B。30B 变体实现了 59.3% 的平均准确率，与 Claude-4.5-Sonnet（59.0%）相当，并显著超越 GPT-5（52.5%）和 Gemini 2.5 Pro（57.5%）。与其基础模型（Qwen3-VL-30B-A3B-Instruct）相比，Video-DeepResearch-30B 实现了显著的绝对提升：在 VideoDR 基准上跃升 +24.0%，在 VideoDR-Bench 上提升 +13.5%。这一明确的性能飞跃严格验证了我们的轨迹合成和 RL 优化流程即使在紧凑规模下也具备有效性。

与专有模型的对比。尽管专有模型拥有庞大的参数量和广泛的训练，它们在 Video-DR 任务上表现出明显的局限性。GPT-5（52.5%）显著落后，可能归因于视觉工具使用方面的优化不足。Gemini 2.5 Pro（57.5%）表现出具有竞争力的性能，但仍不及我们的两个变体。这些结果表明，仅靠原始模型规模并不能保证有效的 Video-DR 能力；专门的训练流程至关重要。

细粒度类别分析。在细粒度层面，我们的模型在不同视频领域展现出各自的优势：

知识（KNL）：Video-DeepResearch-35B 达到 66.1%，展示了在基于视频的知识查询中进行事实推理的卓越能力。

娱乐（ENT）：两个变体均表现出色（分别为 61.4% 和 65.9%），超越了所有专有模型。

日常生活（DLY）：Video-DeepResearch-35B 显著提升至 56.8%（较基础模型提升 +16.3%），表明对常见场景具有更好的泛化能力。

新闻（NWS）：Video-DeepResearch-30B 表现出较强的鲁棒性（58.3%），不过 Video-DeepResearch-35B（41.7%）则表明，更大规模的变体可能面临领域迁移方面的挑战。

规模洞察。我们的实验中出现了一个关键观察：不同模型规模下的性能提升幅度并不一致。Video-DeepResearch-30B 相比其基础模型提升了 +18.8%，而 Video-DeepResearch-35B 则提升了 +21.2%。这表明我们的训练流程与更大的模型容量能够更好地协同，尤其是在复杂的多跳推理任务上。然而，在新闻类别上相对较小的提升幅度（8.4%，而 30B 为 16.6%）则表明，模型在处理时间动态性内容时可能存在脆弱性，这值得进一步研究。

4.3 工具使用分析

媒体内容 · 前往原文查看

表 4：在 VideoDR 和我们的基准测试上，视觉与文本工具的平均使用次数。

模型 VideoDR VideoDR-Bench

视觉 文本 视觉 文本

Claude-4.5-Sonnet 1.83 3.38 2.25 3.24

GPT-5 0.00 0.12 0.31 1.43

Gemini-2.5-Pro 0.31 0.84 1.93 2.07

Qwen3.5-35B 0.04 0.58 0.20 0.70

Qwen3.5-397B 0.10 1.27 0.04 2.77

基础模型 1.82 2.21 1.75 2.40

我们的模型 2.33 4.24 2.98 3.81

为了理解我们性能提升背后的行为模式，我们在表 4 中对不同评估集上的工具调用频率进行了剖析。

基准测试特性。从基准测试的角度来看，VideoDR-Bench 相比 VideoDR 更严格地迫使模型执行更多的视觉和文本操作。例如，GPT-5 的视觉工具调用次数从 0.00 增加到 0.31，文本调用次数从 0.12 增加到 1.43。这明确表明，我们的基准测试规避了现有数据集中普遍存在的参数化知识泄漏问题，成功强制模型进行真正的多步骤、工具增强的开放网络探索。

方法论分析。我们提出的 Video-DeepResearch 与基线模型相比，在工具使用方面表现出深刻的转变：

模态偏差修正：基线模型 Qwen3.5-397B 在每个任务上仅执行 0.10 次视觉操作，同时严重偏向文本工具（1.27）。相比之下，Video-DeepResearch-30B 在 VideoDR 上实现了 2.33 次视觉和 4.24 次文本工具调用，这代表了智能体探索策略的根本性重构。

均衡多模态搜索：在我们精心设计的轨迹流水线驱动下，Video-DeepResearch 内化了主动的时空感知能力。再辅以混合文本训练数据，最终形成一种高度均衡且详尽的多模态搜索策略，能够动态克服基线模型中观察到的模态偏差。

规模适配的效率：值得注意的是，Video-DeepResearch-30B 的工具使用率甚至超过了 397B 的基线模型，这证实了在决定智能体能力方面，训练方法比原始参数量更为重要。

核心洞见。工具使用多样性与任务表现之间的强相关性验证了我们的核心假设：有效的 Video-DR 智能体必须克服导致模型依赖参数化知识的模态偏差。我们的训练流水线成功灌输了这一能力，定量性能提升和向更详尽探索方向的行为转变都证明了这一点。

4.4 消融实验

媒体内容 · 前往原文查看

表 5：不同模型在 VideoDR 和我们的基准测试上的性能对比。

设置 VideoDR VideoDR-Bench 平均

基线 38.0 43.0 40.5

4k-SFT 44.0 48.0 46.0

7K-SFT 55.0 51.0 53.0

7K-SFT+7k-text-SFT 59.0 54.5 56.8

14k-SFT+2K-RL 62.0 56.5 59.3

为了细致地厘清每个数据整理和训练阶段的贡献，我们在 Video-DeepResearch-30B 上进行了消融实验，详见表 5。

视频中心化 SFT（基线 7K-SFT）。从基线（40.5%）出发，引入 4K 条合成的 Video-DR 轨迹立即带来了 +5.5% 的平均提升。将该多模态语料扩展到 7K 进一步将性能推高至 53.0%。这一明确的 +12.5% 轨迹驱动式跃升证实，我们的视觉基础数据对于智能体内化基础感知-探索范式是严格必要的。有趣的是，提升在 VideoDR-Bench 上（51.0% 对比基线 43.0%）比在 VideoDR 上（55.0% 对比基线 38.0%）更为显著，这表明视觉基础对于基准质量的评估尤为关键。→

文本增强 SFT（+7k 文本 SFT）。随后，加入 7K 条纯文本问答样本带来了额外的 +3.8% 提升（达到 56.8%）。这直接验证了我们的假设：显式注入文本探索数据能有效缓解智能体初始的工具调用偏差，从而强化更全面的开放网页搜索能力。这种跨模态迁移效应表明，文本深度研究技能与视觉锚定行为形成互补并增强后者。

RL 优化（+2K-RL）。最后，在 2K 条中等难度数据集上应用 GRPO，达到了 59.3% 的整体最优准确率。这最后的 +2.5% 性能跃升凸显了强化学习的必要性——推动模型超越静态模仿，执行稳健、自主驱动的探索轨迹。RL 阶段尤其有利于 VideoDR-Bench 性能（+2.0%，达到 56.5%），表明学到的探索策略能很好地泛化到基准级任务。

累积设计洞察。每个训练阶段带来的增量改进揭示了一个重要原则：Video-DR 能力源于视觉锚定（轨迹 SFT）、文本深度研究技能（混合 SFT）和自主探索（RL）的协同组合。任何单一组件都无法达到最优性能，完整流水线对于取得最先进结果至关重要。

4.5 讨论：超越基准

实验结果引发了对视频智能本质的更深入思考。

涌现而非规模。我们的发现挑战了“仅凭足够的模型规模就能产生涌现能力”这一主流假设。参数量达 397B 的 Qwen3.5-397B-A13B，尽管容量巨大，其表现却与我们用专门流水线训练的 30B 模型相当。这表明 Video-DR 能力不仅仅是模型规模的函数，而是一种需要精心设计课程体系的涌现属性——具体而言，就是我们提出的“感知-探索解耦”范式。智能体必须学会何时感知、何时检索，这种时间维度的协调无法仅从静态语料中习得。

主动接地作为真正理解的检验标准。对我们结果的一种颇具启发性的解读，涉及工具使用究竟在衡量什么。在 GPT-5 中观察到的参数化知识泄漏（在零工具调用的情况下达到具有竞争力的准确率）表明，仅凭基准测试表现可能与真正的视频理解脱钩。我们的方法通过在网页检索之前强制执行详尽的视觉接地，有效地将一条原则付诸实践：理解一段视频意味着能够对其采取行动。工具调用模式的变化（从 0.10 次到 2.33 次视觉操作）因此不仅代表着行为上的改变，更是对智能体认知策略的根本性重构——从被动回忆转向主动验证。

模态的平等性。或许最反直觉的发现是，训练方法可以比模型规模带来近一个数量级的优势。我们的 30B 模型实现了比 397B 基线更高的工具多样性，这表明模态偏差并非架构上的局限，而是训练数据分布特征所导致的结果。这意味着，要实现真正的多模态平等，不仅需要架构上的统一，还需要数据与训练范式的对齐——这比简单地扩展模型参数提出了更为精细的要求。

5 相关工作

5.1 视频理解

早期的视频大语言模型（Video-LLM）通常依赖均匀帧采样进行单轮推理（Lin 等，2024a, b；Zhang 等，2024）。由于缺乏动态视觉查询机制，它们容易出现错误累积和模型幻觉。尽管最近的智能体框架引入了交互式工具以实现主动的细粒度感知（Yang 等，2025b；Zhang 等，2025；Tian 等，2025），但这些框架仍局限于封闭世界的视频场景。因此，它们在处理需要外部可验证证据的知识密集型任务时表现不佳（Wang 等，2017；Fu 等，2025b）。为解决这一问题，我们提出了 Video-DeepResearch，一个将视频内部定位与迭代式开放网络探索相结合的视频深度研究框架。通过从封闭世界的参数化记忆转向开放世界的协同验证循环，Video-DeepResearch 实现了高度鲁棒、多来源的深度推理。

5.2 多模态深度研究系统。

自主深度研究智能体已从纯文本系统（Team 等，2025；Wu 等，2025a；Li 等，2025b；Tao 等，2025）迅速发展为以图像为中心的 Vision-DR 框架。近期的工作采用反向图像搜索（Geng 等，2025）、GRPO 优化（Wu 等，2025b；Shao 等，2024）以及实体级裁剪（Narayan 等，2025）来导航静态视觉场景。然而，这一发展路径完全绕过了连续的视频模态。与静态图像不同，视频深度研究（Video-DR）要求智能体解耦密集的时空动态，并在嘈杂帧之间进行多步骤验证，这构成了一个明显更为艰巨的挑战。

与此同时，为这一新前沿建立严格的评测体系仍然困难重重。虽然现有基准大致能评估静态多模态事实性（Cheng 等，2025b）、外部知识锚定（Wang 等，2017；Chen 等，2023；Fu 等，2025b）以及基于图像的搜索工作流（Jiang 等；Geng 等，2025），但它们本质上不足以应对视频流。此外，为建立专门的 Video-DR 基准所做的零星努力也遭遇了一个关键瓶颈：严重依赖劳动密集、难以规模化的人工标注。为克服这一难题，我们提出了一种高度可扩展的人机协同标注框架，用于稳健的 Video-DR 评测。

6 结论

我们提出了 Video-DeepResearch，这是首个统一的视频深度研究框架，将可扩展的数据合成、智能体训练与严格评测贯通起来。对现有智能体的初步研究揭示了两个关键失败模式：系统性的视觉工具回避和参数化知识泄漏，二者都损害了对 Video-DR 能力的忠实评估。Video-DeepResearch 通过一种解耦的感知-探索流水线并配合分阶段工具解锁来解决这些问题，生成了 3 万条基于视频的问答对和 7 千条精选轨迹。结合两阶段 SFT–GRPO 训练方案，我们的 Video-DeepResearch-35B-A3B 达到了 64.0%（SOTA），而 30B-A3B 变体达到了 59.3%，与 Claude-4.5-Sonnet 相当。我们还进一步推出了 VideoDR-Bench，这是一个包含 200 个实例的多跳 VQA 基准，其中每个问题都被证明同时需要视觉搜索和外部知识推理。我们希望这项工作能为下一代视频深度研究智能体奠定坚实基础。

作者信息

完整作者列表：Zhen Fang1、Yu Zeng1、Wenxuan Huang、Yiming Zhao1、Shiting Huang1、Tianfei Ren1、Qi Lu1、Qingnan Ren1、Qisheng Su1、Lionel Z. Wang4、Qingyu Yin5、Shuang Chen6、Zehui Chen1、Lin Chen1、Zhenfei Yin7、Yao Hu2、Shaohui Lin8、Wanli Ouyang3、Shaosheng Cao2,9、Feng Zhao1。

所属机构：1中国科学技术大学，2小红书，3香港中文大学，4香港理工大学，5浙江大学，6加州大学洛杉矶分校，7牛津大学，8华东师范大学，9清华大学。

共同第一作者为甄放、曾宇、黄文轩和赵一鸣。曾宇和黄文轩担任项目负责人。通讯作者为黄文轩、曹绍升和赵峰。

局限性

尽管 Video-DeepResearch 开创了首个将数据构建与模型训练整合到复杂视频深度研究（Video-DR）任务中的完整流水线，但这种严谨的方法也带来了一定的权衡取舍。首先，达到当前性能水平需要相当大的计算开销。为确保高质量的数据合成和稳健的模型训练，该框架需要大量 GPU 资源，这主要源于大规模模型部署与动态网络搜索操作的并发需求。此外，为保证评估的准确性和可靠性，我们基准的构建目前依赖细致的人工标注。虽然这确保了评估标准的高保真度，但也限制了数据集的快速扩展能力。在未来的工作中，我们计划通过探索计算高效的流水线、轻量级架构以及基于 LLM 的自动化评估指标来缓解这些限制，从而减少对人工的依赖。

参考文献

Anthropic（2025）Introducing claude sonnet 4.5。网址：https://www.anthropic.com/news/claude-sonnet-4-5 引用位置：§4.1，§4.1。

K. Ataallah, E. M. Bakr, M. Ahmed, C. Gou, K. Pahwa, J. Ding, and M. Elhoseiny（2025）Infinibench：面向长篇电影和电视剧的大型多模态模型基准。载于《2025年自然语言处理实证方法会议论文集》，第 19496–19523 页。引用位置：§3.1。

S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, 等（2025）Qwen3-VL 技术报告。arXiv 预印本 arXiv:2511.21631。引用位置：§1，§3.3，§4.1，§4.1。

D. Ben-Ami, G. Serussi, K. Cohen, and C. Baskin（2025）HERBench：视频问答中多证据整合的基准。arXiv 预印本 arXiv:2512.14870。引用位置：§3.1。

S. Chen、K. Feng、H. Chen、W. Huang、D. Dai、Q. Shou、Y. Lin、X. Yue、S. Gao 和 T. Pang（2026）《OpenSearch-vl：面向前沿多模态搜索智能体的开放配方》。arXiv 预印本 arXiv:2605.05185。引用自：§1。

Y. Chen、H. Hu、Y. Luan、H. Sun、S. Changpinyo、A. Ritter 和 M. Chang（2023）《预训练的视觉和语言模型能否回答视觉信息寻求类问题？》。arXiv 预印本 arXiv:2302.11713。引用自：§5.2。

J. Cheng、Y. Ge、T. Wang、Y. Ge、J. Liao 和 Y. Shan（2025a）《Video-holmes：多模态大语言模型能否像福尔摩斯一样进行复杂视频推理？》。arXiv 预印本 arXiv:2505.21374。引用自：§3.1。

X. Cheng、W. Zhang、S. Zhang、J. Yang、X. Guan、X. Wu、X. Li、G. Zhang、J. Liu、Y. Mai 等人（2025b）《Simplevqa：多模态大语言模型的多模态事实性评估》。收录于 IEEE/CVF 国际计算机视觉大会论文集，第 4637–4646 页。引用自：§5.2。

G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人（2025）《Gemini 2.5：以先进推理、多模态、长上下文和下一代智能体能力推动前沿》。arXiv 预印本 arXiv:2507.06261。引用自：§1、§4.1、§4.1。

K. Feng、M. Zhang、S. Chen、Y. Lin、K. Fan、Y. Jiang、H. Li、D. Zheng、C. Wang 和 X. Yue（2026）《Gen-searcher：强化图像生成的智能体搜索》。arXiv 预印本 arXiv:2603.28767。引用自：§1。

C. Fu、Y. Dai、Y. Luo、L. Li、S. Ren、R. Zhang、Z. Wang、C. Zhou、Y. Shen、M. Zhang 等人（2025a）《Video-mme：首个多模态大语言模型视频分析综合评估基准》。收录于 IEEE/CVF 计算机视觉与模式识别大会论文集，第 24108–24118 页。引用自：§3.1。

M. Fu、Y. Peng、B. Liu、Y. Wan 和 D. Chen（2025b）《LiveVQA：实时视觉知识寻求》。arXiv 预印本 arXiv:2504.05288。引用自：§5.1、§5.2。

X. Geng、P. Xia、Z. Zhang、X. Wang、Q. Wang、R. Ding、C. Wang、J. Wu、Y. Zhao、K. Li 等人（2025）《Webwatcher：开辟视觉语言深度研究智能体的新前沿》。arXiv 预印本 arXiv:2508.05748。引用自：§1、§5.2、§5.2。

A. Goel、S. Ghosh、V. Agarwal、N. Anand、K. Jayakumar、L. Koroshinadze、Y. Xu、K. Lyons、J. Case、K. Sapra 等人（2026）《MMOU：面向长时复杂真实世界视频的大规模多任务全模态理解与推理基准》。arXiv 预印本 arXiv:2603.14145。引用位置：§3.1。

J. Hong、S. Yan、J. Cai、X. Jiang、Y. Hu 和 W. Xie（2026）《WorldSense：评估多模态大语言模型的真实世界全模态理解能力》。外部链接：2502.04326，链接。引用位置：§3.1。

K. Hu、P. Wu、F. Pu、W. Xiao、Y. Zhang、X. Yue、B. Li 和 Z. Liu（2025）《Video-MMMU：评估从多学科专业视频中获取知识的能力》。arXiv 预印本 arXiv:2501.13826。引用位置：§3.1。

W. Huang、Y. Zeng、Q. Wang、Z. Fang、S. Cao、Z. Chu、Q. Yin、S. Chen、Z. Yin、L. Chen 等人（2026）《Vision-DeepResearch：激发多模态大语言模型的深度研究能力》。arXiv 预印本 arXiv:2601.22060。引用位置：§1、§1、§3.3。

[18] D. Jiang、R. Zhang、Z. Guo、Y. Wu、P. Qiu、P. Lu、Z. Chen、G. Song、P. Gao、Y. Liu 等人《MmSearch：揭示大模型作为多模态搜索引擎的潜力》。收录于第十三届国际学习表征会议。引用位置：§5.2。

C. Li、Y. Chen、Y. Ji、J. Xu、Z. Cui、S. Li、Y. Zhang、W. Wang、Z. Song、D. Zhang 等人（2025a）《OmniVideoBench：面向全模态 MLLM 的视听理解评估》。arXiv 预印本 arXiv:2510.10689。引用位置：§3.1。

K. Li、Z. Zhang、H. Yin、L. Zhang、L. Ou、J. Wu、W. Yin、B. Li、Z. Tao、X. Wang 等人（2025b）《WebSailor：驾驭网页智能体的超人类推理能力》。arXiv 预印本 arXiv:2507.02592。引用位置：§1、§5.2。

K. Li、Y. Wang、Y. He、Y. Li、Y. Wang、Y. Liu、Z. Wang、J. Xu、G. Chen、P. Luo 等人（2024）《MVBench：一个全面的多模态视频理解基准》。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集，第 22195–22206 页。引用位置：§3.1。

Z. Li、C. Li、X. Mao、S. Lin、M. Li、S. Zhao、Z. Xu、X. Li、Y. Feng、J. Sun 等人（2026）《Sekai：面向世界探索的视频数据集》。神经信息处理系统进展 38。引用位置：§3.1。

B. Lin、Y. Ye、B. Zhu、J. Cui、M. Ning、P. Jin 和 L. Yuan（2024a）《Video-LLaVA：在投影前通过对齐学习统一视觉表征》。载于《2024年自然语言处理实证方法会议论文集》，第5971–5984页。引用位置：§5.1。

J. Lin、H. Yin、W. Ping、P. Molchanov、M. Shoeybi 和 S. Han（2024b）《VILA：关于视觉语言模型的预训练研究》。载于《IEEE/CVF计算机视觉与模式识别会议论文集》，第26689–26699页。引用位置：§5.1。

C. Liu、X. Yu、Z. Chang、Z. Huang、S. Zhang、H. Lian、K. Wang、R. Xu、S. Hu、J. Hou 等人（2026）《观看、推理与搜索：面向智能体视频推理的开放网络视频深度研究基准》。arXiv预印本 arXiv:2601.06943。引用位置：§1、§2、表1、§4.1。

X. Ma、H. Qiu、G. Zhang、Z. Zeng、S. Yang、L. Ma 和 F. Zhao（2025）《STAGE：用于自回归图像生成的稳定且可泛化的 GRPO》。arXiv预印本 arXiv:2509.25027。引用位置：§1。

R. Nakano、J. Hilton、S. Balaji、J. Wu、L. Ouyang、C. Kim、C. Hesse、S. Jain、V. Kosaraju、W. Saunders 等人（2021）《WebGPT：基于浏览器辅助且带有人类反馈的问答系统》。arXiv预印本 arXiv:2112.09332。引用位置：§1。

K. Narayan、Y. Xu、T. Cao、K. Nerella、V. M. Patel、N. Shiee、P. Grasch、C. Jia、Y. Yang 和 Z. Gan（2025）《DeepMMSearch-R1：赋能多模态大语言模型进行多模态网络搜索》。arXiv预印本 arXiv:2510.12801。引用位置：§5.2。

OpenAI。（2025）《OpenAI GPT-5 系统卡》。arXiv预印本 arXiv:2601.03267。引用位置：§4.1、§4.1。

A. Radford、J. W. Kim、C. Hallacy、A. Ramesh、G. Goh、S. Agarwal、G. Sastry、A. Askell、P. Mishkin、J. Clark 等人（2021）《从自然语言监督中学习可迁移的视觉模型》。载于《国际机器学习会议》，第8748–8763页。引用位置：附录C。

Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人（2024）《DeepSeekMath：推动开源语言模型数学推理能力的极限》。arXiv预印本 arXiv:2402.03300。引用位置：§3.3、§5.2。

K. Tao、Y. Zheng、J. Xu、W. Du、K. Shao、H. Wang、X. Chen、X. Jin、J. Zhu、B. Yu 等人（2026）《Lvomnibench：开创全模态大语言模型长音视频理解评测》。arXiv 预印本 arXiv:2603.19217。引用位置：§3.1。

Z. Tao、J. Wu、W. Yin、J. Zhang、B. Li、H. Shen、K. Li、L. Zhang、X. Wang、Y. Jiang 等人（2025）《Webshaper：通过信息寻求形式化实现智能体式数据合成》。arXiv 预印本 arXiv:2507.15061。引用位置：§1、§5.2。

K. Team、T. Bai、Y. Bai、Y. Bao、S. Cai、Y. Cao、Y. Charles、H. Che、C. Chen、G. Chen 等人（2026）《Kimi K2.5：视觉智能体智能》。arXiv 预印本 arXiv:2602.02276。引用位置：§4.1、§4.1。

Q. Team（2026）《Qwen3.5-Omni 技术报告》。arXiv 预印本 arXiv:2604.15804。引用位置：§1、§3.1、§3.1、§3.3、§4.1、§4.1、§4.1。

T. D. Team、B. Li、B. Zhang、D. Zhang、F. Huang、G. Li、G. Chen、H. Yin、J. Wu、J. Zhou 等人（2025）《通义深度研究技术报告》。arXiv 预印本 arXiv:2510.24701。引用位置：§4.1、§5.2。

S. Tian、R. Wang、H. Guo、P. Wu、Y. Dong、X. Wang、J. Yang、H. Zhang、H. Zhu 和 Z. Liu（2025）《Ego-R1：面向超长第一视角视频推理的工具链式思考》。arXiv 预印本 arXiv:2506.13654。引用位置：§5.1。

P. Wang、Q. Wu、C. Shen、A. Dick 和 A. Van Den Hengel（2017）《FVQA：基于事实的视觉问答》。IEEE 模式分析与机器智能汇刊 40（10），第 2413–2427 页。引用位置：§5.1、§5.2。

W. Wang、Z. He、W. Hong、Y. Cheng、X. Zhang、J. Qi、M. Ding、X. Gu、S. Huang、B. Xu 等人（2025）《LVBench：极端长视频理解基准》。收录于 IEEE/CVF 国际计算机视觉大会论文集，第 22958–22967 页。引用位置：§3.1。

W. Wang 和 Y. Yang（2026）《VideoUFO：百万级用户导向的文生视频数据集》。神经信息处理系统进展 38。引用位置：§3.1。

H. Wu、D. Li、B. Chen 和 J. Li（2024）《LongVideoBench：长上下文交错视频-语言理解基准》。神经信息处理系统进展 37，第 28828–28857 页。引用位置：§3.1。

J. Wu、B. Li、R. Fang、W. Yin、L. Zhang、Z. Tao、D. Zhang、Z. Xi、G. Fu、Y. Jiang 等人（2025a）《Webdancer：迈向自主信息获取智能体》。arXiv 预印本 arXiv:2505.22648。引用位置：§1、§5.2。

J. Wu、Z. Deng、W. Li、Y. Liu、B. You、B. Li、Z. Ma 和 Z. Liu（2025b）《MMSearch-r1：激励多模态大模型进行搜索》。arXiv 预印本 arXiv:2506.20670。引用位置：§1、§5.2。

H. Yang、S. Yue 和 Y. He（2023）《Auto-GPT 用于在线决策：基准测试与补充观点》。arXiv 预印本 arXiv:2306.02224。引用位置：§1。

J. Yang、S. Yang、A. W. Gupta、R. Han、李飞飞和 S. Xie（2025a）《在空间中思考：多模态大语言模型如何看见、记忆和回忆空间》。收录于 IEEE/CVF 计算机视觉与模式识别会议（CVPR）论文集，第 10632–10643 页。引用位置：§3.1。

Z. Yang、S. Wang、K. Zhang、K. Wu、S. Leng、Y. Zhang、B. Li、C. Qin、S. Lu、X. Li 等人（2025b）《LongVT：通过原生工具调用激励“长视频思考”》。arXiv 预印本 arXiv:2511.20785。引用位置：§3.1、§5.1。

H. Zhang、X. Gu、J. Li、C. Ma、S. Bai、C. Zhang、B. Zhang、Z. Zhou、D. He 和 Y. Tang（2025）《用视频思考：面向长视频推理的多模态工具增强强化学习》。arXiv 预印本 arXiv:2508.04416。引用位置：§5.1。

Y. Zhang、J. Wu、W. Li、B. Li、Z. Ma、Z. Liu 和 C. Li（2024）《LLaVA-Video：基于合成数据的视频指令微调》。arXiv 预印本 arXiv:2410.02713。引用位置：§5.1。

附录 A 附录

附录 B 训练细节

训练设置与超参数。监督微调（SFT）在高性能计算集群上进行，该集群由多个节点组成，每个节点配备 GB 级 GPU（总计 GPU 数量为 ），采用 Megatron-LM 框架。为适应超长上下文长度（ tokens）且不进行数据打包，我们采用了高度优化的混合并行策略。具体而言，我们配置了张量并行（TP）大小为 、上下文并行（CP）大小为 、专家并行（EP）大小为 。同时启用了序列并行（SP）以进一步降低内存占用。训练共进行 个 epoch，微批大小为 ，全局批大小为 。学习率采用线性预热与衰减调度，在前 个训练步内预热至峰值 ，随后衰减至最小值 。48×803280,00042831645%1×10−55×10−7

优化与效率提升。为确保混合专家（MoE）架构的高效训练，我们应用了 的辅助损失系数用于负载均衡，并将专家容量因子设置为 以减少 token 丢弃。我们集成了先进的 MoE 计算优化，包括置换操作融合、分组 GEMM 以及共享专家计算与通信的重叠。此外，我们采用了严格的内存优化技术，以防止长上下文训练期间出现内存不足（OOM）错误。我们使用 FlashAttention 作为主要注意力后端，并利用 PyTorch 的可扩展段特性（expandable_segments:True）来最小化内存碎片。全量激活检查点（activation checkpointing）统一应用于每一层，以计算换内存。在系统级效率方面，启用了融合交叉熵损失，使用 OpenMP 线程优化了 CPU 线程，并通过预处理进程和 DataLoader 工作线程对数据处理流水线进行了高度并行化。检查点每 步以 Safetensors 格式序列化，有意省略优化器状态和随机数生成器（RNG）状态以节省存储开销。1×10−62.0321288500

附录 C 数据详情

在关键帧提取方面，我们使用 CLIP-ViT-L/14@336px（Radford 等人，2021）计算帧间相似度。为减少冗余，我们丢弃相似度得分超过 0.8 的连续帧，以及任何无信息量的单色帧。每个视频的关键帧数量严格上限为 20 帧。值得注意的是，这一预处理配置统一应用于数据合成流程和所有评估阶段，包括对 VideoDR 的处理。

附录 D 标注细节

VideoHunt 的构建涉及严格的人工标注流程，以确保基准测试的质量和可靠性。整个标注工作历时约三周。

标注团队。我们招募了 8 名标注员，均具备多模态大语言模型数据标注的专业经验。每位标注员都熟悉视频理解、视觉搜索和多跳推理任务。

质量保证。在正式标注阶段之前，所有标注员都需接受结构化培训，涵盖任务定义、工具使用（如 Crop_Search）以及常见陷阱（如参数化知识泄漏）。随后在预留的试点集上进行资格测试；只有达到预定准确率阈值的标注员才能进入正式标注环节。在生产过程中，工作流程分为两个解耦阶段：标注阶段（标注员创建并验证 VQA 实例）和质量检查阶段（另一组审核员交叉检查每个实例的可回答性、视觉可依据性和事实正确性）。检查中被标记的实例将退回修改或直接丢弃。

媒体内容 · 前往原文查看

图 4：用于判断视频是否具有足够的语义深度和信息差、从而需要外部网络搜索的 Video-DR 任务（见第 3.1 节）的结构化评估提示词。

媒体内容 · 前往原文查看

图 5：第 3.1 节中使用的多帧实体提取结构化提示词。该提示词强制模型扮演一个智能体角色，观察时序帧，选择 3 到 5 个多样化的关键帧子集，并在每帧中精确锚定一个互斥的显著实体。

媒体内容 · 前往原文查看

图 6：第 3.1 节中用于基于知识生成问题的结构化提示词。该大语言模型充当智能体，动态选择提问策略并综合生成多步推理问题，同时严格遵守视觉引用约束以防止信息泄露。

媒体内容 · 前往原文查看

图 7：用于判断深度研究报告是否包含正确答案的结构化评估提示词。

媒体内容 · 前往原文查看

图 8：深度研究智能体的提示词，该智能体可访问全部三个工具，并遵循视觉优先策略：在文本网页探索之前，先通过 select_crop_search 对视觉实体进行定位。

媒体内容 · 前往原文查看

表 6：智能体可用的工具。select_crop_search 是探索阶段唯一开放的工具；search 和 visit 在作答阶段才被加入。

参数 类型 必填 描述

select_crop_search — 选取帧，从每帧中裁剪一个边界框，对每个裁剪区域执行反向图像/视觉网络搜索。

selections 对象列表（1–8） ✓ 一批 (frame, bbox) 选择，用于在单次调用中裁剪和搜索。使用多个选择可广泛撒网，或使用单个紧凑裁剪来放大某个具有区分度的区域。

.frame_index 整数 ()≥0 ✓ 视频帧列表中该帧的 0 起始索引。

.bbox list[float]，长度 4 ✓ 以归一化坐标表示的裁剪区域，包含 和 。使用 表示整帧。[x1,y1,x2,y2]0.0≤x1<x2≤1.00.0≤y1<y2≤1.0[0,0,1,1]

goal 字符串 ✓ 关于要识别的内容以及要查找的相关事实的精确陈述。

返回：针对每个裁剪区域，返回顶部网页结果（标题、URL、摘要）以及任何识别出的实体（人物、产品、标志、地标）。

search — 运行网络搜索，从 Google / Serper / 智谱返回顶部结果（带自动回退）。

query 字符串或字符串列表 ✓ 单个搜索查询或并行运行的查询列表。优先使用多个简短、聚焦的查询，而非一个冗长的复合查询。

num_results 整数 — 每个查询返回的最大结果数（默认 10）。

返回：针对每个查询，返回一个有序的条目列表。{title,url,snippet}

visit — 获取一个或多个网页，并由摘要模型将其提炼为面向目标的结构化 JSON。

url 字符串或字符串列表 ✓ 要获取的 URL，或并行获取的 URL 列表。通常是先前 search 调用返回的 URL。

goal 字符串 ✓ 页面中需要查找内容的精确说明；摘要模型据此决定保留哪些内容、舍弃哪些内容。

返回结果：针对每个 URL，返回一个 JSON 对象，包含 rationale（该页面为何相关）、evidence（逐字引用的支撑片段）以及 summary（一段话的综合概述）。原始 HTML 不会暴露给智能体。
