fazii@mail.ustc.edu.cn, wxhuang0616@gmail.com
摘要
我们提出了 Video-DeepResearch(Video-DR),将多模态智能体从静态图像扩展到连续视频流——这一设定要求密集的时空定位能力,并与开放网络探索相结合。初步评估揭示了当前模型存在的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而偏向文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正的工具增强执行。为解决这些挑战,我们提出了 Video-DeepResearch,其核心是一个解耦的感知-探索流水线,配合分阶段工具解锁机制,强制模型在网络检索之前完成穷尽式的跨帧视觉定位。我们的框架采用两阶段训练方案——监督微调后接组相对策略优化(GRPO)——从而实现突破模仿学习上限的自主探索。此外,我们构建了 VideoDR-Bench,一个人类与 AI 协作的基准测试集,包含 200 个复杂的多跳 VQA 实例。实验结果表明,我们的 Video-DeepResearch-35B-A3B 取得了 64.0% 的平均准确率,刷新了最先进水平,超越专有模型 Claude-4.5-Sonnet(59.0%)5.0 个百分点,并显著优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当,证明了我们的训练范式即使在紧凑规模下也行之有效。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-Deepresearch 团队 fazii@mail.ustc.edu.cn, wxhuang0616@gmail.com https://github.com/Osilly/Vision-DeepResearch
1 引言
通过主动交互执行长周期任务,是迈向 AGI 征程中的一个关键里程碑,而近期深度研究智能体的兴起正是这一能力的集中体现(Li et al., 2025b; Wu et al., 2025a; Tao et al., 2025)。借助先进的视觉语言模型(Bai et al., 2025; Team, 2026; Comanici et al., 2025),研究智能体已深入非结构化、视觉信息丰富的数字荒野(Chen et al., 2026; Huang et al., 2026; Ma et al., 2025; Wu et al., 2025b; Feng et al., 2026)。这一转变将智能体的工作重心从处理干净的文本输入,转向从嘈杂、高度冗余的多媒体网页布局中提炼关键信息,从而重新定义了自主探索的复杂度。
以往针对这些挑战的研究文献,大体沿着多模态路径演进。基于文本的网页智能体,尤其是 WebGPT(Nakano et al., 2021)和 AutoGPT(Yang et al., 2023),奠定了通过程序化搜索进行迭代式知识综合的基础。为适配丰富的视觉布局,后续范式转向感知接口;诸如 WebWatcher(Geng et al., 2025)等框架引入了多种视觉工具以提升搜索效果,而近期的 Vision-DeepResearch(Huang et al., 2026)则进一步拓展了这一前沿,能够在高度密集、复杂的视觉情境中执行多步骤、穷尽式的搜索。
尽管取得了这些进展,现有文献仍绕开了一个生态效度更高、但也更具挑战性的场景:视频深度研究(Video-DeepResearch,Video-DR)。这一范式将焦点从孤立模态转向一个整体性环境,在此环境中,基于文本的综合分析与密集视觉追踪深度交织,从根本上重新定义了自主智能体的认知负荷。开拓这一 Video-DR 前沿领域面临两大现有方法无法解决的根本瓶颈。首先,在数据合成方面,如何构建与基于视频的深度研究内在属性相匹配的有效训练流程,在很大程度上仍是一个悬而未决的问题。传统视频数据集侧重于局部描述或短期动作标签;相反,Video-DR 需要生成式数据策展,将长时程决策轨迹与密集的、随时间变化的文本和视觉证据相结合。其次,从评估角度来看,建立一套严谨且高保真的基准测试也是一项艰巨挑战。标准视觉问答指标不足以衡量智能体的多步策略执行能力,因此迫切需要能够准确量化长期推理一致性以及连续时间动态下错误恢复行为的多维评估协议。
为应对这些挑战,我们首先对当前智能体直接应用于视频深度研究(Video-DR)时的根本性失败模式进行了实证调查。通过在现有基准(Liu et al., 2026)上评估三个代表性模型,我们发现了两个惊人结论:(i)严重的模态偏差——即使是最强的开源模型,每个任务平均仅调用 0.10 次视觉工具,却严重依赖文本搜索(1.27 次调用),表明模型系统性地回避主动视觉探索;(ii)参数化知识泄漏——GPT-5 在几乎零工具调用的情况下达到了 57% 的竞争性准确率,表明现有评测在很大程度上仅靠记忆的世界知识即可解决。这些发现促使我们对 Video-DR 智能体的训练与评测范式进行整体性反思。
基于这些洞见,我们提出了 Video-DeepResearch,一个统一框架,共同应对 Video-DR 在数据、训练和评测方面的挑战。我们的贡献总结如下:
- •
一个可扩展的数据引擎,通过解耦的感知-探索流水线与分阶段工具解锁机制,生成 30K 条视频问答对和 7K 条精选轨迹,直接针对初步研究中揭示的模态偏差问题。
- •
一种两阶段训练方案,结合监督微调与 GRPO,使紧凑模型能够超越规模大得多的专有系统。我们的 Video-DeepResearch-35B-A3B(64.0%)创下新的最先进水平,超越 Claude-4.5-Sonnet(59.0%)5.0 个百分点;30B 变体(59.3%)在达到与专有基线相当性能的同时,展现出强大的开源能力。
- •
VideoDR-Bench,一个包含 200 个实例的多跳 VQA 基准,通过可扩展的人机协同标注构建,其中每个问题都被证明必须同时依赖视觉搜索和外部知识推理。
2 一个朴素的尝试:从图像深度研究到视频深度研究
如图 1 所示,我们将视频概念化为关键实体轨迹的时间组合。因此,我们的核心洞见在于,Video-DR 可以被构建为一个顺序式定位流程:识别关键时间帧、执行局部视觉搜索,并通过后续的文本检索来综合发现。为了落地这一工作流并弥合与以图像为中心的研究之间的差距,我们为智能体配备了两个基础工具:Select_Keyframe 和 Crop_Search。具体而言,智能体首先使用 Select_Keyframe 从连续流中提取信息量丰富的时刻,然后对显著实体应用 Crop_Search 来构建精确的视觉查询,从而为下游基于文本的探索提供坚实锚点。
问题形式化
形式上,给定一个复杂的研究查询和一个视觉输入(可以是连续的视频流,也可以是预先采样的一系列关键帧),Video-DR 智能体的目标是综合出一个全面的响应。我们将其形式化为一个顺序决策过程。在第 步,智能体基于历史轨迹 生成一个动作 :
| (1) |
其中 表示多模态策略, 是来自环境的执行观测。为了落地时空定位流程,动作空间包含我们定义的工具以及标准网络操作:。具体而言,时间工具选择特定索引 来提取信息丰富的帧 。随后,空间工具接收 和一个边界框来裁剪目标实体,从而为下游搜索生成局部视觉上下文。或者,这两个工具也可以封装为单一的联合操作。
实证研究
为了实证评估这一朴素方案,我们在 VideoDR Liu et al. (2026) 基准上使用三个代表性模型实例化该智能体,并专门跟踪每个工具的执行频率,以分析其行为模式。
| 模型 | 准确率 | 视觉工具 | 文本工具 |
|---|---|---|---|
| Qwen3.5-35B-A3B | 41 | 0.04 | 0.58 |
| Qwen3.5-397B-A17B | 58 | 0.10 | 1.27 |
| GPT-5 | 57 | 0.00 | 0.12 |
如表 1 所示,我们的初步评估得出两个关键发现:
发现 1:严重的模态偏差与视觉工具回避。当前模型表现出对调用视觉工具的内在抵触。即便是能力最强的开源模型 Qwen3.5-397B-A17B,每个任务平均仅执行 0.10 次视觉操作,而压倒性地偏向文本工具(1.27)。这表明智能体主要默认采用文本搜索,完全绕过了预期的主动视觉探索。
发现 2:易受参数化知识泄漏影响。现有评估设置存在严重的先验知识泄漏问题。值得注意的是,GPT-5 在几乎不进行任何工具调用(视觉 0.00,文本 0.12)的情况下取得了极具竞争力的 57 分。这表明该模型完全绕过了多步接地(grounding)流程,仅依靠其庞大的内部记忆来臆测或直接猜测正确答案。
3 Video-DeepResearch
我们首先详细介绍一个用于合成视频问答数据的生成式流水线(第 3.1 节),它是构建高质量执行轨迹的基础(第 3.2 节)。在此精选数据的基础上,我们接着描述智能体的多模态训练流程(第 3.3 节),最后建立一个稳健的基准测试来评估视频深度推理(Video-DR)能力(第 3.4 节)。
3.1 视频问答生成
鉴于目前缺乏专门用于视频深度推理的数据集,我们通过合成基础视频问答对来启动流水线。该流程将原始视频转化为明确的视频问答对。为确保数据质量,我们为每个实例标注中间证据,从而保证所生成查询的可视觉锚定性和可回答性。
第 0 步:多领域视频筛选。我们首先从多个领域精选一批多样化的原始视频。这些视频既来自已有的视频数据集 Ben-Ami 等人(2025);Ataallah 等人(2025);Wu 等人(2024);Wang 等人(2025);Tao 等人(2026);Li 等人(2024, 2025a);Goel 等人(2026);Li 等人(2026);Cheng 等人(2025a);Fu 等人(2025a);Hu 等人(2025);Yang 等人(2025a);Hong 等人(2026);Yang 等人(2025b);Wang 和 Yang(2026),也来自真实世界的流媒体平台¹¹¹YouTube。这些视频随后经过两阶段筛选流程。首先,基于规则的过滤器剔除超出预设时长阈值的样本。其次,我们引入一个智能体筛选阶段,由 Qwen3.5-35B-A3B Team(2026)评估内容复杂度,剔除信息量不足或过于简单的视频。随后,这一精选数据集被划分为训练集(用于构建训练轨迹)和测试集(用于建立评估基准)。
步骤 1:关键帧选取与视觉搜索。我们随后启动一个由智能体驱动的元数据整理流程。具体而言,在通过基于 CLIP 的帧间相似度提出候选帧之后,我们部署 Qwen3.5-397B-A17B Team (2026) 来完成关键帧的最终选取。对于每一帧,同一模型预测边界框以定位不同的实体。这些实体随后被裁剪并用于执行视觉搜索查询。为确保数据保真度,一个辅助模型(Qwen3.5-35B-A3B)会验证裁剪区域与检索结果之间的语义一致性。验证通过后,我们编译视频元数据,其结构化为一个元组:。
步骤 2:VQA 生成与验证。最后,我们通过两种生成模式从整理好的元数据中合成问答对:(1)单实体:采样一个实体来构建基于事实的问题;(2)多实体:采样多个实体来构建需要跨实体推理的组合式问题。在两种设置下,我们都明确惩罚浅层的视觉属性查询。生成之后,我们严格过滤掉容易发生参数记忆泄漏的实例。具体而言,我们对每个问题执行四次无工具推理;如果智能体在任意一次尝试中回答正确,该实例即被永久丢弃,从而保证剩余任务严格需要外部工具的使用。最终,我们获得了 30k 个 VQA 对。
3.2 轨迹生成
基于合成的 VQA 问答对,我们进一步构建用于智能体训练的执行轨迹。如第 2 节所述,当前的 Video-DR 智能体表现出一种固有的倾向,即不愿调用视觉工具,常常绕过这些工具,转而依赖纯文本搜索。为克服这种模态偏差,我们提出了一种解耦的轨迹构建流程,将视觉感知与网页探索明确分离。具体而言,我们使用 Qwen3.5-397B-A17B 生成轨迹,并应用拒绝采样。为实现这种解耦,我们采用了一种分阶段的工具解锁策略。在初始阶段,智能体被限制在仅视觉的动作空间中,只包含 Select_Keyframe 和 Crop_Search 两个动作。智能体不会急于给出答案,而是被迫执行大量的视觉检索,在多个关键帧中裁剪不同的实体。一旦智能体判定视觉上下文已足够——或达到预设的最大感知轮次——我们便将动作空间扩展至包含文本工具(Search 和 Visit),并提示智能体推导出最终答案。这种两阶段范式迫使模型在网页探索之前,先进行彻底的跨帧、跨实体视觉定位。最后,我们仅保留成功解决的轨迹用于下游策略训练。最终,我们获得了 7k 条正确轨迹。
3.3 训练
我们采用两阶段训练范式。我们选择 Qwen3-VL-30B-A3B-Instruct(Bai 等人,2025)作为 Video-DeepResearch-30B-A3B 的基础模型,因为它作为开源视觉语言模型(VLM)被广泛采用,且具备强大的 AI 基础设施支持。对于 Video-DeepResearch-35B-A3B,我们采用 Qwen3.5-35B-A3B(Team,2026)作为基础模型,并遵循相同的训练方案。两个变体都经历完全相同的训练流程。在第一阶段,我们进行监督微调(SFT)以建立冷启动。该阶段旨在使模型与预期的解耦感知-探索工作流对齐,使其内化正确的多模态推理语法。在第二阶段,我们应用组相对策略优化(GRPO)来进一步优化策略。通过主动生成轨迹(rollouts)并为成功轨迹获得奖励,智能体被鼓励自主探索动作空间,从而超越初始 SFT 阶段的性能上限。实验在包含四个 NVIDIA H800(80GB)GPU 节点的计算集群上进行。更多细节详见附录 B。
监督微调(SFT)
对于 SFT 阶段,我们利用第 3.2 节中合成的 7K 高质量轨迹,使模型内化解耦感知-探索范式。此外,为了解决表 LABEL:tab:_motivation 中观察到的文本工具利用不足问题,我们用来自 VDR(Huang 等人,2026)的额外 7K 纯文本问答实例扩充了训练语料。这种混合训练策略明确强化了智能体的基础深度研究能力。30B 和 35B 两个变体均采用相同的数据方案。形式上,给定混合数据集,其中每个实例由上下文(包括系统提示词、视觉输入和交互历史)和目标输出序列组成,SFT 的目标是最小化标准的自回归负对数似然:
| (2) |
其中表示基础模型的策略,表示前面的 token。
强化学习(RL)
为了让智能体超越静态的 SFT 模仿、激励其内生探索,我们采用了组相对策略优化(GRPO)(Shao 等人,2024)。GRPO 通过组内相对奖励计算优势值,有效消除了独立价值网络带来的内存开销。我们构建了一个包含 2K 条中等难度样本的 RL 数据集,方法是对每条轨迹执行四次 rollout(见 3.2 节),并严格保留 Pass@4 得分介于 0 和 1 之间的样本。我们采用稀疏二元奖励,对正确答案(由 Qwen3-VL-30B-A3B-Instruct 判定)赋予奖励,否则不赋予。为防止格式违规或重复循环主导更新过程,我们计算相应的优势值,但对其负梯度进行降采样,仅以 20% 的概率应用这些梯度。目标函数定义为:
| (3) |
3.4 VideoDR-Bench
为建立我们的评测基准,我们从经过严格筛选的视频池中抽取了一个子集。由于一个可靠的基准必须同时具备可回答性和高数据保真度,我们引入了一个可扩展的“人在回路”标注框架来完成最终的数据整理。
具体而言,给定一段视频和一个可选的来源 URL,人工标注者被指示在关键时间戳处暂停。随后,他们利用 Crop_Search 工具查询显著的视觉实体,严格核验检索到的外部证据与原始帧之间的一致性。基于这些核验结果,标注者为每段视频构建若干条种子 VQA 对。接着,这些种子被输入到一个多智能体框架中,以综合生成复杂的多跳推理问题。具体来说,多智能体流程的运行方式如下。首先,一个起草智能体(Drafting Agent)构思语义方向以扩展种子 VQA(例如,将“勒布朗·詹姆斯”这样的基础答案扩展为相关关键词,如他的球队、配偶或 MVP 奖项)。这些生成的关键词随后通过搜索引擎进行查询。接下来,一个问答生成智能体(QA Generation Agent)利用检索到的网页上下文来构建新颖的多跳问题。为严格执行外部工具依赖,我们过滤掉任何模型在无需工具访问的情况下即可正确回答的问题(即参数化知识泄漏)。随后,人工标注者根据检索到的证据手动核验剩余候选问题的可回答性。之后,一个排序智能体(Ranking Agent)对核验通过的问题进行评分,仅保留得分最高的实例。至关重要的是,这个排名最高的 VQA 可以递归地作为新的种子,从而实现迭代循环,以综合生成日益复杂、跳数更高的推理任务。
4 实验
4.1 实验设置
我们评估了多种视觉语言模型(VLM),包括 Gemini 2.5 Pro Comanici et al. (2025)、GPT-5 OpenAI. (2025)、Claude-4.5-Sonnet Anthropic (2025)、Qwen3-VL-30B-A3B-Instruct Bai et al. (2025)、Qwen3.5-35B-A3B Team (2026)、Qwen3.5-397B-A3B Team (2026) 以及 Kimi K2.5 Team et al. (2026),在 VideoDR-Bench 和 VideoDR Liu et al. (2026) 上进行了评估。VideoDR-Bench 是一个评估基准,包含 100 条人工标注的 VQA 对,旨在通过整合视频上下文与开放网络探索来评估智能体的复杂推理能力。
我们在智能体(Agentic)设置下评估模型:即模型配备如表 6 所示的完整视觉和文本工具套件。
| 模型 | Video-DR | VideoDR-Bench(准确率 %) | 平均 | ||||||
|---|---|---|---|---|---|---|---|---|---|
| 准确率 | KNL | ENT | DLY | G&S | NWS | OTH | 总体 | ||
| 闭源模型 | |||||||||
| Gemini 2.5 Pro Comanici et al. (2025) | 62.0 | 54.2 | 52.3 | 51.4 | 51.7 | 54.2 | 57.1 | 53.0 | 57.5 |
| GPT-5 OpenAI. (2025) | 57.0 | 50.8 | 45.5 | 48.6 | 48.3 | 45.8 | 42.9 | 48.0 | 52.5 |
| Claude-4.5-Sonnet Anthropic (2025) | 63.0 | 55.9 | 54.5 | 54.1 | 58.6 | 54.2 | 42.9 | 55.0 | 59.0 |
| 开源模型 | |||||||||
| Qwen3.5-397B-A13B Team (2026) | 58.0 | 49.2 | 61.4 | 40.5 | 55.2 | 29.2 | 14.3 | 47.5 | 52.8 |
| Kimi K2.5 Team et al. (2026) | 61.0 | 54.2 | 52.3 | 51.4 | 51.7 | 54.2 | 57.1 | 53.0 | 57.0 |
| Qwen3-VL-30B-A3B-Instruct Bai et al. (2025) | 38.0 | 44.1 | 43.2 | 35.1 | 51.7 | 41.7 | 42.9 | 43.0 | 40.5 |
| Video-DeepResearch-30B-A3B(我们的模型) | 62.0 | 62.7 | 61.4 | 40.5 | 58.6 | 58.3 | 42.9 | 56.5 | 59.3 |
| 提升幅度 | +24.0 | +18.6 | +18.2 | +5.4 | +6.9 | +16.6 | 0.0 | +13.5 | +18.8 |
| Qwen3.5-35B-A3B Team (2026) | 42.0 | 45.8 | 50.0 | 40.5 | 44.8 | 33.3 | 28.6 | 43.5 | 42.8 |
| Video-DeepResearch-35B-A3B(我们的模型) | 68.0 | 66.1 | 65.9 | 56.8 | 62.1 | 41.7 | 42.9 | 60.0 | 64.0 |
| 提升幅度 | +26.0 | +20.3 | +15.9 | +16.3 | +17.3 | +8.4 | +14.3 | +16.5 | +21.2 |
arxiv
为保证公平,在相同的交互约束条件下,我们从轨迹的最后一步提取最终预测结果。随后,由 Qwen3-VL-30B-A3B-Instruct 采用通义深度研究团队等(2025)的官方评判提示词对正确性进行评估。
4.2 主要结果
主要评估结果汇总于表 4.1。我们提出的 Video-DeepResearch 在多个模型规模上展现出卓越的深度研究能力。
Video-DeepResearch-35B-A3B。在所有被评估模型中,我们的 35B 变体以 64.0% 的整体平均准确率确立了新的最先进水平,比领先的闭源模型 Claude-4.5-Sonnet(59.0%)高出 5.0 个百分点。与其基础模型(Qwen3.5-35B-A3B)相比,Video-DeepResearch-35B 实现了显著的 +21.2% 提升,其中在知识密集型(KNL:+20.3%)和娱乐(ENT:+15.9%)类别中表现尤为突出。值得注意的是,Video-DeepResearch-35B 在所有被评估模型中取得了 VideoDR-Bench 的最高分(65.4%)。
Video-DeepResearch-30B-A3B。30B 变体实现了 59.3% 的平均准确率,与 Claude-4.5-Sonnet(59.0%)相当,并显著超越 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。与其基础模型(Qwen3-VL-30B-A3B-Instruct)相比,Video-DeepResearch-30B 实现了显著的绝对提升:在 VideoDR 基准上飙升 +24.0%,在 VideoDR-Bench 上提升 +13.5%。这一明确的性能跃升严格验证了我们的轨迹合成和 RL 优化流程即使在紧凑规模下也具备有效性。
与专有模型的对比。尽管专有模型拥有庞大的参数量和广泛的训练,但它们在 Video-DR 任务上表现出明显的局限性。GPT-5(52.5%)显著落后,可能归因于视觉工具使用方面的优化不足。Gemini 2.5 Pro(57.5%)表现出具有竞争力的性能,但仍不及我们的两个变体。这些结果表明,仅靠原始模型规模并不能保证有效的 Video-DR 能力;专门的训练流程至关重要。
细粒度类别分析。在细粒度层面,我们的模型在不同视频领域展现出各自的优势:
- •
知识(KNL):Video-DeepResearch-35B 达到 66.1%,展示了在基于视频的知识查询中进行事实推理的卓越能力。
- •
娱乐(ENT):两个变体均表现优异(分别为 61.4% 和 65.9%),超越所有专有模型。
- •
日常生活(DLY):Video-DeepResearch-35B 显著提升至 56.8%(较基础模型提升 +16.3%),表明对常见场景具有更好的泛化能力。
- •
新闻(NWS):Video-DeepResearch-30B 表现出特别的稳健性(58.3%),不过 Video-DeepResearch-35B(41.7%)则表明,更大规模的变体可能存在领域迁移方面的挑战。
规模洞察。从我们的实验中浮现出一个关键观察:不同模型规模下的提升幅度并不一致。Video-DeepResearch-30B 相比其基础模型提升了 +18.8%,而 Video-DeepResearch-35B 则提升了 +21.2%。这表明我们的训练流程与更大的模型容量能够更好地协同,尤其是在复杂的多跳推理任务上。然而,在新闻类别上相对较小的提升(8.4%,而 30B 为 16.6%)则表明,模型在处理时间动态性内容时可能存在脆弱性,这值得进一步研究。
4.3 工具使用分析
| 模型 | VideoDR | VideoDR-Bench | ||
|---|---|---|---|---|
| 视觉 | 文本 | 视觉 | 文本 | |
| Claude-4.5-Sonnet | 1.83 | 3.38 | 2.25 | 3.24 |
| GPT-5 | 0.00 | 0.12 | 0.31 | 1.43 |
| Gemini-2.5-Pro | 0.31 | 0.84 | 1.93 | 2.07 |
| Qwen3.5-35B | 0.04 | 0.58 | 0.20 | 0.70 |
| Qwen3.5-397B | 0.10 | 1.27 | 0.04 | 2.77 |
| 基础模型 | 1.82 | 2.21 | 1.75 | 2.40 |
| 我们的模型 | 2.33 | 4.24 | 2.98 | 3.81 |
为了理解我们性能提升背后的行为模式,我们在表 4 中对不同评测集上的工具调用频率进行了剖析。
基准测试特性。从基准测试的角度来看,与 VideoDR 相比,VideoDR-Bench 严格要求模型执行更多的视觉和文本操作。例如,GPT-5 的视觉工具调用次数从 0.00 增加到 0.31,文本调用次数从 0.12 增加到 1.43。这明确表明,我们的基准测试规避了现有数据集中普遍存在的参数知识泄漏问题,成功强制模型进行真正的多步骤、工具增强的开放网络探索。
方法论分析。我们提出的 Video-DeepResearch 与基线模型相比,在工具利用方面展现出深刻的转变:
- •
模态偏差修正:基线模型 Qwen3.5-397B 每个任务仅执行 0.10 次视觉操作,同时高度偏向文本工具(1.27)。相比之下,Video-DeepResearch-30B 在 VideoDR 上实现了 2.33 次视觉和 4.24 次文本工具调用,这代表了智能体探索策略的根本性重构。
- •
均衡多模态搜索:在我们精心设计的轨迹流水线驱动下,Video-DeepResearch 内化了主动的时空感知能力。再辅以混合文本训练数据,最终形成一种高度均衡且详尽的多模态搜索策略,能够动态克服基线模型中观察到的模态偏差。
- •
规模适配的高效性:值得注意的是,Video-DeepResearch-30B 的工具使用率甚至超过了 397B 的基线模型,这证实了在决定智能体能力方面,训练方法论比原始参数量更为重要。
核心洞察。工具使用多样性与任务表现之间的强相关性验证了我们的核心假设:有效的 Video-DR 智能体必须克服导致模型依赖参数化知识的模态偏差。我们的训练流水线成功灌输了这一能力,定量性能提升和行为向更详尽探索的转变都证明了这一点。
4.4 消融实验
| 设置 | VideoDR | VideoDR-Bench | 平均 |
|---|---|---|---|
| 基线 | 38.0 | 43.0 | 40.5 |
| 4k-SFT | 44.0 | 48.0 | 46.0 |
| 7K-SFT | 55.0 | 51.0 | 53.0 |
| 7K-SFT+7k-text-SFT | 59.0 | 54.5 | 56.8 |
| 14k-SFT+2K-RL | 62.0 | 56.5 | 59.3 |
为了细致地厘清每个数据整理和训练阶段的贡献,我们在 Video-DeepResearch-30B 上进行了消融实验,详见表 5。
以视频为中心的 SFT(基线 7K-SFT)。从基线(40.5%)出发,引入 4K 合成 Video-DR 轨迹立即带来了 +5.5% 的平均提升。将该多模态语料库扩展到 7K 进一步将性能推高至 53.0%。这一显著的 +12.5% 轨迹驱动式增长证实,我们的视觉基础数据对于智能体内化基础感知-探索范式是严格必要的。有趣的是,在 VideoDR-Bench 上的提升(51.0% 对比基线 43.0%)比在 VideoDR 上(55.0% 对比基线 38.0%)更为显著,这表明视觉基础对于基准质量的评估尤为关键。
文本增强 SFT(+7k 文本 SFT)。随后,加入 7K 条纯文本问答样本带来了额外的 +3.8% 提升(达到 56.8%)。这直接验证了我们的假设:显式注入文本探索数据能有效缓解智能体最初的工具调用偏差,从而强化更全面的开放网页搜索能力。这种跨模态迁移效应表明,文本深度研究技能与视觉锚定行为互为补充、相互增强。
强化学习优化(+2K-RL)。最后,在 2K 条中等难度数据集上应用 GRPO,达到了 59.3% 的整体最高准确率。这最后的 +2.5% 性能跃升凸显了强化学习的必要性——推动模型超越静态模仿,执行稳健、自主驱动的探索轨迹。RL 阶段尤其对 VideoDR-Bench 性能提升显著(+2.0%,达到 56.5%),表明学到的探索策略能很好地泛化到基准级任务上。
累积设计洞察。每个训练阶段带来的增量提升揭示了一个重要原则:视频深度研究(Video-DR)能力源于视觉锚定(轨迹 SFT)、文本深度研究技能(混合 SFT)和自主探索(RL)三者的协同组合。任何单一组件都无法达到最优性能,完整流水线对于取得最先进结果至关重要。
4.5 讨论:超越基准
实验结果引发了对视频智能本质的更深入思考。
涌现而非规模。我们的发现挑战了“仅凭足够的模型规模就能产生涌现能力”这一主流假设。参数量达 397B 的 Qwen3.5-397B-A13B,尽管容量巨大,其表现却与我们用专门流水线训练的 30B 模型相当。这表明视频深度研究(Video-DR)能力不仅仅是模型规模的函数,更是一种需要精心设计课程才能涌现的属性——具体来说,就是我们提出的“感知与探索解耦”范式。智能体必须学会何时感知、何时检索,这种时间上的协调无法仅从静态语料中习得。
主动接地作为真正理解的检验标准。对我们结果的一种颇具启发性的解读,涉及工具使用究竟在衡量什么。在 GPT-5 中观察到的参数化知识泄漏(在零工具调用的情况下达到具有竞争力的准确率)表明,仅凭基准测试表现可能与真正的视频理解脱钩。我们的方法通过在网络检索之前强制执行详尽的视觉接地,有效地将一条原则付诸实践:理解一段视频意味着能够对其采取行动。工具调用模式的转变(从 0.10 次视觉操作增加到 2.33 次)因此不仅代表着行为上的改变,更是对智能体认知策略的根本性重构——从被动回忆转向主动验证。
模态的平等性。也许最反直觉的发现是,训练方法可以在近一个数量级的程度上超越模型规模。我们的 30B 模型实现了比 397B 基线更高的工具多样性,这表明模态偏差并非架构上的限制,而是训练数据分布特征所导致的结果。这意味着,要实现真正的多模态平等,不仅需要架构上的统一,还需要数据和训练范式的对齐——这比简单地扩展模型参数要更为精细复杂。
5 相关工作
5.1 视频理解。
早期的视频大语言模型(Video-LLM)通常依赖均匀帧采样进行单轮推理(Lin 等,2024a, b;Zhang 等,2024)。由于缺乏动态视觉查询机制,它们容易产生错误累积和模型幻觉。尽管近期一些智能体框架引入了交互式工具以实现主动的细粒度感知(Yang 等,2025b;Zhang 等,2025;Tian 等,2025),但这些框架仍局限于封闭世界的视频场景。因此,它们在处理需要外部可验证证据的知识密集型任务时表现不佳(Wang 等,2017;Fu 等,2025b)。为解决这一问题,我们提出了 Video-DeepResearch,一个将视频内部定位与迭代式开放网络探索相结合的视频深度研究框架。通过从封闭世界的参数化记忆转向开放世界的协同验证循环,Video-DeepResearch 实现了高度稳健的多源深度推理。
5.2 多模态深度研究系统。
自主深度研究智能体已迅速从纯文本系统(Team 等,2025;Wu 等,2025a;Li 等,2025b;Tao 等,2025)演进为以图像为中心的 Vision-DR 框架。近期的工作采用反向图像搜索(Geng 等,2025)、GRPO 优化(Wu 等,2025b;Shao 等,2024)以及实体级裁剪(Narayan 等,2025)来导航静态视觉场景。然而,这一演进路径完全绕过了连续的视频模态。与静态图像不同,视频深度研究(Video-DR)要求智能体解耦密集的时空动态,并在嘈杂帧中进行多步骤验证,这构成了一个明显更为艰巨的挑战。
与此同时,为这一新前沿建立严格的评测体系仍然困难重重。虽然现有基准测试在一定程度上能够评估静态多模态事实性(Cheng 等,2025b)、外部知识锚定(Wang 等,2017;Chen 等,2023;Fu 等,2025b)以及基于图像的搜索工作流(Jiang 等;Geng 等,2025),但它们本质上不足以应对视频流场景。此外,为建立专门的 Video-DR 基准所做的零星努力也遭遇了一个关键瓶颈:严重依赖劳动密集、难以规模化的人工标注。为克服这一难题,我们提出了一种高度可扩展的人机协同标注框架,用于稳健的 Video-DR 评测。
6 结论
我们提出了 Video-DeepResearch,这是首个统一的视频深度研究框架,将可扩展的数据合成、智能体训练与严格评测贯通为一体。对现有智能体的初步研究揭示了两个关键失败模式:系统性的视觉工具回避和参数化知识泄漏,这两者都损害了对 Video-DR 能力的忠实评估。Video-DeepResearch 通过一种解耦的感知-探索流水线配合分阶段工具解锁来解决这些问题,生成了 3 万条视频锚定问答对和 7 千条精选轨迹。结合两阶段 SFT–GRPO 训练方案,我们的 Video-DeepResearch-35B-A3B 达到了 64.0%(SOTA),而 30B-A3B 变体达到了 59.3%,与 Claude-4.5-Sonnet 相当。我们还进一步推出了 VideoDR-Bench,这是一个包含 200 个实例的多跳问答基准,其中每个问题都被证明同时需要视觉搜索和外部知识推理。我们希望这项工作能为下一代视频深度研究智能体奠定坚实基础。
作者信息
完整作者列表:Zhen Fang1, Yu Zeng1, Wenxuan Huang, Yiming Zhao1, Shiting Huang1, Tianfei Ren1, Qi Lu1, Qingnan Ren1, Qisheng Su1, Lionel Z. Wang4, Qingyu Yin5, Shuang Chen6, Zehui Chen1, Lin Chen1, Zhenfei Yin7, Yao Hu2, Shaohui Lin8, Wanli Ouyang3, Shaosheng Cao2,9, Feng Zhao1。
所属机构:1中国科学技术大学,2小红书,3香港中文大学,4香港理工大学,5浙江大学,6加州大学洛杉矶分校,7牛津大学,8华东师范大学,9清华大学。
共同第一作者为甄芳、曾宇、黄文轩和赵一鸣。曾宇和黄文轩担任项目负责人。通讯作者为黄文轩、曹绍升和赵峰。
局限性
尽管 Video-DeepResearch 率先提出了首个将数据构建与模型训练整合到复杂视频深度研究(Video-DR)任务中的完整流水线,但这种严谨的方法也带来了一定的权衡取舍。首先,达到当前性能水平需要相当大的计算开销。为确保高质量的数据合成和稳健的模型训练,该框架需要大量 GPU 资源,这主要源于大规模模型部署与动态网络搜索操作的并发需求。此外,为保证评估的准确性和可靠性,我们基准的构建目前依赖细致的人工标注。虽然这确保了评估标准的高保真度,但也限制了数据集快速扩展的能力。在未来的工作中,我们计划通过探索计算高效的流水线、轻量级架构以及基于 LLM 的自动化评估指标来缓解这些限制,从而减少对人工的依赖。
参考文献
- Anthropic (2025) Introducing claude sonnet 4.5. 网址:https://www.anthropic.com/news/claude-sonnet-4-5 引用位置:§4.1, §4.1。
- K. Ataallah, E. M. Bakr, M. Ahmed, C. Gou, K. Pahwa, J. Ding, and M. Elhoseiny (2025) Infinibench: a benchmark for large multi-modal models in long-form movies and tv shows. 收录于《Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing》,第 19496–19523 页。引用位置:§3.1。
- S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, 等 (2025) Qwen3-vl technical report. arXiv 预印本 arXiv:2511.21631。引用位置:§1, §3.3, §4.1, §4.1。
- D. Ben-Ami, G. Serussi, K. Cohen, and C. Baskin (2025) HERBench: a benchmark for multi-evidence integration in video question answering. arXiv 预印本 arXiv:2512.14870。引用位置:§3.1。
- S. Chen、K. Feng、H. Chen、W. Huang、D. Dai、Q. Shou、Y. Lin、X. Yue、S. Gao 和 T. Pang(2026)《OpenSearch-vl:面向前沿多模态搜索智能体的开放配方》。arXiv 预印本 arXiv:2605.05185。引用自:§1。
- Y. Chen、H. Hu、Y. Luan、H. Sun、S. Changpinyo、A. Ritter 和 M. Chang(2023)《预训练的视觉和语言模型能否回答视觉信息寻求类问题?》。arXiv 预印本 arXiv:2302.11713。引用自:§5.2。
- J. Cheng、Y. Ge、T. Wang、Y. Ge、J. Liao 和 Y. Shan(2025a)《Video-holmes:多模态大语言模型能否像福尔摩斯一样进行复杂视频推理?》。arXiv 预印本 arXiv:2505.21374。引用自:§3.1。
- X. Cheng、W. Zhang、S. Zhang、J. Yang、X. Guan、X. Wu、X. Li、G. Zhang、J. Liu、Y. Mai 等人(2025b)《Simplevqa:多模态大语言模型的多模态事实性评估》。收录于 IEEE/CVF 国际计算机视觉大会论文集,第 4637–4646 页。引用自:§5.2。
- G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人(2025)《Gemini 2.5:以先进推理、多模态、长上下文和下一代智能体能力推动前沿》。arXiv 预印本 arXiv:2507.06261。引用自:§1、§4.1、§4.1。
- K. Feng、M. Zhang、S. Chen、Y. Lin、K. Fan、Y. Jiang、H. Li、D. Zheng、C. Wang 和 X. Yue(2026)《Gen-searcher:强化图像生成的智能体搜索》。arXiv 预印本 arXiv:2603.28767。引用自:§1。
- C. Fu、Y. Dai、Y. Luo、L. Li、S. Ren、R. Zhang、Z. Wang、C. Zhou、Y. Shen、M. Zhang 等人(2025a)《Video-mme:首个面向视频分析中多模态大语言模型的全面评估基准》。收录于 IEEE/CVF 计算机视觉与模式识别大会论文集,第 24108–24118 页。引用自:§3.1。
- M. Fu、Y. Peng、B. Liu、Y. Wan 和 D. Chen(2025b)《LiveVQA:实时视觉知识寻求》。arXiv 预印本 arXiv:2504.05288。引用自:§5.1、§5.2。
- X. Geng、P. Xia、Z. Zhang、X. Wang、Q. Wang、R. Ding、C. Wang、J. Wu、Y. Zhao、K. Li 等人(2025)《Webwatcher:开辟视觉语言深度研究智能体的新前沿》。arXiv 预印本 arXiv:2508.05748。引用自:§1、§5.2、§5.2。
- A. Goel、S. Ghosh、V. Agarwal、N. Anand、K. Jayakumar、L. Koroshinadze、Y. Xu、K. Lyons、J. Case、K. Sapra 等人(2026)《MMOU:面向长时复杂真实世界视频的大规模多任务全模态理解与推理基准》。arXiv 预印本 arXiv:2603.14145。引用位置:§3.1。
- J. Hong、S. Yan、J. Cai、X. Jiang、Y. Hu 和 W. Xie(2026)《WorldSense:评估多模态大语言模型的真实世界全模态理解能力》。外部链接:2502.04326,链接。引用位置:§3.1。
- K. Hu、P. Wu、F. Pu、W. Xiao、Y. Zhang、X. Yue、B. Li 和 Z. Liu(2025)《Video-MMMU:评估从多学科专业视频中获取知识的能力》。arXiv 预印本 arXiv:2501.13826。引用位置:§3.1。
- W. Huang、Y. Zeng、Q. Wang、Z. Fang、S. Cao、Z. Chu、Q. Yin、S. Chen、Z. Yin、L. Chen 等人(2026)《Vision-DeepResearch:激励多模态大语言模型的深度研究能力》。arXiv 预印本 arXiv:2601.22060。引用位置:§1、§1、§3.3。
- [18] D. Jiang、R. Zhang、Z. Guo、Y. Wu、P. Qiu、P. Lu、Z. Chen、G. Song、P. Gao、Y. Liu 等人《MmSearch:揭示大模型作为多模态搜索引擎的潜力》。收录于第十三届国际学习表征会议。引用位置:§5.2。
- C. Li、Y. Chen、Y. Ji、J. Xu、Z. Cui、S. Li、Y. Zhang、W. Wang、Z. Song、D. Zhang 等人(2025a)《OmniVideoBench:面向全模态 MLLM 的视听理解评估》。arXiv 预印本 arXiv:2510.10689。引用位置:§3.1。
- K. Li、Z. Zhang、H. Yin、L. Zhang、L. Ou、J. Wu、W. Yin、B. Li、Z. Tao、X. Wang 等人(2025b)《WebSailor:驾驭网页智能体的超人类推理能力》。arXiv 预印本 arXiv:2507.02592。引用位置:§1、§5.2。
- K. Li、Y. Wang、Y. He、Y. Li、Y. Wang、Y. Liu、Z. Wang、J. Xu、G. Chen、P. Luo 等人(2024)《MVBench:一个全面的多模态视频理解基准》。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22195–22206 页。引用位置:§3.1。
- Z. Li、C. Li、X. Mao、S. Lin、M. Li、S. Zhao、Z. Xu、X. Li、Y. Feng、J. Sun 等人(2026)《Sekai:面向世界探索的视频数据集》。神经信息处理系统进展 38。引用位置:§3.1。
- B. Lin、Y. Ye、B. Zhu、J. Cui、M. Ning、P. Jin 和 L. Yuan(2024a)《Video-LLaVA:在投影前通过对齐学习统一视觉表征》。载于《2024年自然语言处理实证方法会议论文集》,第5971–5984页。引用位置:§5.1。
- J. Lin、H. Yin、W. Ping、P. Molchanov、M. Shoeybi 和 S. Han(2024b)《VILA:关于视觉语言模型的预训练》。载于《IEEE/CVF计算机视觉与模式识别会议论文集》,第26689–26699页。引用位置:§5.1。
- C. Liu、X. Yu、Z. Chang、Z. Huang、S. Zhang、H. Lian、K. Wang、R. Xu、S. Hu、J. Hou 等人(2026)《观看、推理与搜索:面向智能体视频推理的开放网络视频深度研究基准》。arXiv预印本 arXiv:2601.06943。引用位置:§1、§2、表1、§4.1。
- X. Ma、H. Qiu、G. Zhang、Z. Zeng、S. Yang、L. Ma 和 F. Zhao(2025)《STAGE:用于自回归图像生成的稳定且可泛化的 GRPO》。arXiv预印本 arXiv:2509.25027。引用位置:§1。
- R. Nakano、J. Hilton、S. Balaji、J. Wu、L. Ouyang、C. Kim、C. Hesse、S. Jain、V. Kosaraju、W. Saunders 等人(2021)《WebGPT:基于浏览器辅助且带有人类反馈的问答系统》。arXiv预印本 arXiv:2112.09332。引用位置:§1。
- K. Narayan、Y. Xu、T. Cao、K. Nerella、V. M. Patel、N. Shiee、P. Grasch、C. Jia、Y. Yang 和 Z. Gan(2025)《DeepMMSearch-R1:在多模态网络搜索中赋能多模态大语言模型》。arXiv预印本 arXiv:2510.12801。引用位置:§5.2。
- OpenAI。(2025)《OpenAI GPT-5 系统卡》。arXiv预印本 arXiv:2601.03267。引用位置:§4.1、§4.1。
- A. Radford、J. W. Kim、C. Hallacy、A. Ramesh、G. Goh、S. Agarwal、G. Sastry、A. Askell、P. Mishkin、J. Clark 等人(2021)《从自然语言监督中学习可迁移的视觉模型》。载于《国际机器学习会议》,第8748–8763页。引用位置:附录C。
- Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《DeepSeekMath:推动开源语言模型数学推理能力的极限》。arXiv预印本 arXiv:2402.03300。引用位置:§3.3、§5.2。
- K. Tao、Y. Zheng、J. Xu、W. Du、K. Shao、H. Wang、X. Chen、X. Jin、J. Zhu、B. Yu 等人(2026)《Lvomnibench:开创全模态大语言模型长音视频理解评测》。arXiv 预印本 arXiv:2603.19217。引用自:§3.1。
- Z. Tao、J. Wu、W. Yin、J. Zhang、B. Li、H. Shen、K. Li、L. Zhang、X. Wang、Y. Jiang 等人(2025)《Webshaper:通过信息寻求形式化实现智能体式数据合成》。arXiv 预印本 arXiv:2507.15061。引用自:§1、§5.2。
- K. Team、T. Bai、Y. Bai、Y. Bao、S. Cai、Y. Cao、Y. Charles、H. Che、C. Chen、G. Chen 等人(2026)《Kimi K2.5:视觉智能体智能》。arXiv 预印本 arXiv:2602.02276。引用自:§4.1、§4.1。
- Q. Team(2026)《Qwen3.5-Omni 技术报告》。arXiv 预印本 arXiv:2604.15804。引用自:§1、§3.1、§3.1、§3.3、§4.1、§4.1、§4.1。
- T. D. Team、B. Li、B. Zhang、D. Zhang、F. Huang、G. Li、G. Chen、H. Yin、J. Wu、J. Zhou 等人(2025)《通义深度研究技术报告》。arXiv 预印本 arXiv:2510.24701。引用自:§4.1、§5.2。
- S. Tian、R. Wang、H. Guo、P. Wu、Y. Dong、X. Wang、J. Yang、H. Zhang、H. Zhu 和 Z. Liu(2025)《Ego-R1:面向超长第一视角视频推理的工具链式思考》。arXiv 预印本 arXiv:2506.13654。引用自:§5.1。
- P. Wang、Q. Wu、C. Shen、A. Dick 和 A. Van Den Hengel(2017)《FVQA:基于事实的视觉问答》。IEEE 模式分析与机器智能汇刊 40(10),第 2413–2427 页。引用自:§5.1、§5.2。
- W. Wang、Z. He、W. Hong、Y. Cheng、X. Zhang、J. Qi、M. Ding、X. Gu、S. Huang、B. Xu 等人(2025)《LVBench:极端长视频理解基准》。收录于 IEEE/CVF 国际计算机视觉大会论文集,第 22958–22967 页。引用自:§3.1。
- W. Wang 和 Y. Yang(2026)《VideoUFO:百万级用户导向的文生视频数据集》。神经信息处理系统进展 38。引用自:§3.1。
- H. Wu、D. Li、B. Chen 和 J. Li(2024)《LongVideoBench:长上下文交错视频-语言理解基准》。神经信息处理系统进展 37,第 28828–28857 页。引用自:§3.1。
- J. Wu、B. Li、R. Fang、W. Yin、L. Zhang、Z. Tao、D. Zhang、Z. Xi、G. Fu、Y. Jiang 等人(2025a)《Webdancer:迈向自主信息获取智能体》。arXiv 预印本 arXiv:2505.22648。引用位置:§1、§5.2。
- J. Wu、Z. Deng、W. Li、Y. Liu、B. You、B. Li、Z. Ma 和 Z. Liu(2025b)《MMSearch-r1:激励多模态大模型进行搜索》。arXiv 预印本 arXiv:2506.20670。引用位置:§1、§5.2。
- H. Yang、S. Yue 和 Y. He(2023)《Auto-GPT 用于在线决策:基准测试与补充观点》。arXiv 预印本 arXiv:2306.02224。引用位置:§1。
- J. Yang、S. Yang、A. W. Gupta、R. Han、李飞飞和 S. Xie(2025a)《在空间中思考:多模态大语言模型如何看见、记忆和回忆空间》。收录于 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 10632–10643 页。引用位置:§3.1。
- Z. Yang、S. Wang、K. Zhang、K. Wu、S. Leng、Y. Zhang、B. Li、C. Qin、S. Lu、X. Li 等人(2025b)《LongVT:通过原生工具调用激励“长视频思考”》。arXiv 预印本 arXiv:2511.20785。引用位置:§3.1、§5.1。
- H. Zhang、X. Gu、J. Li、C. Ma、S. Bai、C. Zhang、B. Zhang、Z. Zhou、D. He 和 Y. Tang(2025)《伴随视频思考:面向长视频推理的多模态工具增强强化学习》。arXiv 预印本 arXiv:2508.04416。引用位置:§5.1。
- Y. Zhang、J. Wu、W. Li、B. Li、Z. Ma、Z. Liu 和 C. Li(2024)《LLaVA-Video:利用合成数据进行视频指令微调》。arXiv 预印本 arXiv:2410.02713。引用位置:§5.1。
附录 A 附录
附录 B 训练细节
训练设置与超参数。监督微调(SFT)在高性能计算集群上进行,该集群由多个节点组成,每个节点配备 GB 级 GPU(总计 GPU 数量为 ),采用 Megatron-LM 框架。为容纳超长上下文长度的 token 且无需数据打包,我们采用了高度优化的混合并行策略。具体而言,我们配置了张量并行(TP)大小为 、上下文并行(CP)大小为 、专家并行(EP)大小为 。同时启用了序列并行(SP)以进一步降低内存占用。训练共进行 个 epoch,微批大小为 ,全局批大小为 。学习率采用线性预热与衰减调度,在前 的训练步数内线性预热至峰值 ,随后衰减至最小值 。
优化与效率提升。为确保混合专家(MoE)架构的高效训练,我们应用了 的辅助损失系数用于负载均衡,并将专家容量因子设置为 以减少 token 丢弃。我们集成了先进的 MoE 计算优化技术,包括置换操作融合、分组 GEMM(Grouped GEMM),以及共享专家计算与通信的重叠。此外,我们采用了严格的内存优化技术,以防止长上下文训练期间出现内存不足(OOM)错误。我们使用 FlashAttention 作为主要注意力后端,并利用 PyTorch 的可扩展段特性(expandable_segments:True)来最小化内存碎片。全量激活检查点(activation checkpointing)统一应用于每一层,以计算换内存。在系统级效率方面,我们启用了融合交叉熵损失,使用 OpenMP 线程优化了 CPU 线程,并通过预处理进程和 DataLoader 工作线程对数据处理流水线进行了高度并行化。检查点每 步以 Safetensors 格式序列化,并有意省略优化器状态和随机数生成器(RNG)状态以节省存储开销。
附录 C 数据详情
在关键帧提取方面,我们使用 CLIP-ViT-L/14@336px(Radford 等人,2021)计算帧间相似度。为减少冗余,我们丢弃相似度得分超过 0.8 的连续帧,以及任何无信息的单色帧。每个视频的关键帧数量严格上限为 20 帧。值得注意的是,这一预处理配置统一应用于数据合成流程和所有评估阶段,包括 VideoDR 的处理。
附录 D 标注细节
VideoHunt 的构建涉及严格的人工标注流程,以确保基准测试的质量和可靠性。整个标注工作耗时约三周。
标注团队。我们招募了一支由 8 名标注员组成的团队,他们均具有多模态大语言模型数据标注的专业经验。每位标注员都熟悉视频理解、视觉搜索和多跳推理任务。
质量保证。在正式标注阶段之前,所有标注员都要接受结构化培训,涵盖任务定义、工具使用(如 Crop_Search)以及常见陷阱(如参数化知识泄漏)。随后在预留的试点集上进行资格测试;只有达到预定准确率阈值的标注员才能进入正式标注环节。在生产过程中,工作流程分为两个解耦阶段:标注阶段(标注员创建并验证 VQA 实例)和质量检查阶段(另一组审核员交叉检查每个实例的可回答性、视觉可溯源性以及事实正确性)。检查中被标记的实例将被退回修改或直接丢弃。
| 参数 | 类型 | 必填 | 描述 |
| select_crop_search — 选取帧,从每帧中裁剪一个边界框,对每个裁剪区域执行反向图像/视觉网络搜索。 | |||
| selections | 对象列表(1–8) | ✓ | 一批 (frame, bbox) 选择,用于在单次调用中完成裁剪和搜索。使用多个选择可广泛撒网,或使用单个紧凑裁剪来放大某一判别性区域。 |
| .frame_index | 整数 () | ✓ | 视频帧列表中该帧的 0 起始索引。 |
| .bbox | list[float],长度为 4 | ✓ | 以归一化坐标表示的裁剪区域,包含 和 。使用 表示整帧。 |
| goal | 字符串 | ✓ | 关于要识别的内容以及要查询的相关事实的精确陈述。 |
| 返回:针对每个裁剪区域,返回顶部网络结果(标题、URL、摘要)以及任何识别出的实体(人物、产品、标志、地标)。 | |||
| search — 执行网络搜索,从 Google / Serper / 智谱返回顶部结果(带自动回退)。 | |||
| query | 字符串或字符串列表 | ✓ | 单个搜索查询或并行执行的查询列表。优先使用多个简短、聚焦的查询,而非一个冗长的复合查询。 |
| num_results | 整数 | — | 每个查询返回的最大结果数(默认 10)。 |
| 返回:针对每个查询,返回一个有序的条目列表。 | |||
| visit — 获取一个或多个网页,并由摘要模型将其提炼为目标导向的 JSON。 | |||
| url | 字符串或字符串列表 | ✓ | 要获取的 URL,或并行获取的 URL 列表。通常是先前 search 调用返回的 URL。 |
| goal | 字符串 | ✓ | 对页面中应关注内容的精确说明;摘要模型据此决定保留什么、舍弃什么。 |
| 返回结果:针对每个 URL,返回一个 JSON 对象,包含 rationale(该页面为何相关)、evidence(逐字引用的支持片段)以及 summary(一段话的综合概述)。原始 HTML 不会暴露给智能体。 | |||