Sreyan Ghosh
Arushi Goel
Kaousheik Jayakumar
Lasha Koroshinadze
Nishit Anand
Siddharth Gururani
Hanrong Ye
Pritam Biswas
Yuanhang Su
Ehsan Hosseini-Asl
Sang-gil Lee
Zhifeng Kong
Jaehyeon Kim
Sungwon Kim
Karan Sapra
S Sakshi
Ramani Duraiswami
Dinesh Manocha
Andrew Tao
Mohammad Shoeybi
Bryan Catanzaro
Ming-Yu Liu
Wei Ping
NVIDIA, 美国
马里兰大学, 美国
模型
数据集
演示
摘要
我们提出了 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),这是一个完全开源的、最先进的音视频大语言模型(AV-LLM),用于对音频、图像和长视频进行联合理解与推理。与以往主要关注短视频片段的 AV-LLM 不同,AV-Flamingo 专为理解和推理长且复杂的真实世界(音视频)视频而设计。为此,我们做出了三项关键贡献:(i)Audio-Visual-Skills,一个大规模的真实世界视频集合,包含 700 万个描述和问答训练实例,旨在强调时间性、组合性和跨模态的音视频推理;(ii)一种新颖的三阶段课程,逐步训练模型从短距离感知到长跨度多事件推理;(iii)时间音视频交错思维链,一种推理框架,将中间推理步骤显式地锚定到长音视频流中的时间戳上,从而改善时间对齐和可解释性。在超过 15 个音视频、全模态、音频和视觉基准测试上的广泛实验表明,AV-Flamingo 以明显优势优于同等规模的开源模型,并且与更大规模的开权重模型和闭源模型相比,依然具有很强的竞争力,在某些情况下甚至超越它们,尤其是在长且复杂的真实世界音视频理解和推理任务上。除了基准测试性能之外,AV-Flamingo 还展现出强大的真实世界实用性,并能很好地迁移到未见过的任务上,凸显了其鲁棒性和泛化能力。
1. 引言
视频占全球互联网流量的 82%,用户平均每天观看在线视频超过 2.5 小时(Kumar, 2026)。这些视频通常时长较长、内容多样且信息丰富,将复杂的视觉画面、图形、语音、声音和音乐融合成连续的信息流。这与人类感知世界的方式高度相似:即作为一个持续的视听序列。然而,尽管大语言模型(LLM)在许多现实任务中取得了显著进展,但其以类人方式理解和推理视频的能力仍相对未被充分探索。此后,除非另有说明,我们将使用该术语指代视听序列。
大多数视频理解模型仍然无法将音频与视觉信息联合处理(Zhang et al., 2023, 2025; Zhu et al., 2025)。然而,音频——包括语音、声音和音乐——是一种基础模态,甚至被描述为“观影体验的 50%”(Lucas, 1992)。
近期的视听及全模态大语言模型已展现出潜力(Xu et al., 2025a; Team, 2026),但大多数主要聚焦于短视频理解(Chowdhury et al., 2024)。相比之下,人类消费的视频内容多为中长篇幅,例如电影、电视节目、讲座和纪录片。
长篇音视频理解面临的一个核心挑战是缺乏合适的数据:公开可用的资源往往要么是纯音频、要么是纯视频,要么集中在带有字幕和问答标注的短视频上。此外,当前模型在联合音视频感知方面仍存在明显不足(Gong 等人,2024;Zhou 等人,2026;Goel 等人,2026;Chowdhury 等人,2025;Fu 等人,2025),我们认为这既源于架构上的局限性,也归因于大规模、高质量配对音视频数据的稀缺(Seth 等人,2025;Selvakumar 等人,2025)。最近的机制分析将这一现象部分归因于视觉偏差——深层网络层更偏向视觉信息,从而抑制了潜在的音频表征(Selvakumar 等人,2026)。在实践中,许多现有的全能模型是分别针对音频和视觉理解进行训练的,期望它们仅通过隐式方式获得跨模态推理能力。最后,在音视频理解领域最强的模型要么是闭源的(Team 等人,2024),要么仅开放权重(Xu 等人,2025b;Team,2026),其训练数据、代码和方法论均未公开。这既限制了开源领域的进展,也阻碍了人们对这类系统构建方式的理解。
主要贡献。在这项工作中,我们提出了 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo 或 AVF),一个完全开源的多模态大语言模型,用于对长且复杂的真实世界视频进行联合音视频理解。AV-Flamingo 是通过利用互联网规模的音视频数据和针对性的后训练来提升推理能力,从而将开放音视频智能扩展到学术基准之外的第一步。为此,AV-Flamingo 围绕三个技术组件展开。首先,我们引入了 Audio-Visual-Skills(AV-Skills),这是一个用于联合音视频理解和推理的大规模数据集。与以往那些严重依赖单模态数据并希望隐式学习跨模态推理的全能模型不同,AV-Skills 是专门为跨模态学习而策划的。它包含从不同来源收集的视频,并配有旨在测试和训练音视频推理的字幕和问答标注,总计 700 万个字幕和问答训练实例,其中包括 480 万个问答对,涵盖短视频和长视频。其次,我们提出了 Temporal Audio-Visual Interleaved Chain-of-Thought(TAVIT),这是一个推理框架,能够将中间推理步骤显式地定位到长音视频流中的时间戳上。第三,我们开发了一种新颖的三阶段训练课程,包括使用不同数据混合的预训练、中期训练和后训练。AV-Flamingo 在超过 15 个音视频、全能模态、音频和视觉基准测试中,性能优于同等规模或更大的模型。总之,我们的主要贡献是:
- 1.
我们推出了 Nemotron-Labs-Audio-Visual Flamingo,这是一个完全开源的前沿音视频大语言模型,用于对长且复杂的真实世界视频进行联合音视频理解和推理。
- 2.
我们提出了一种面向下一代音视频大语言模型的可扩展方案,包括互联网规模的音视频数据整理、针对性的能力扩展,以及针对长视频的基于时间戳的推理。
- 3.
我们开源了模型、训练和推理代码以及相关技术,以支持未来在开放音视频大语言模型领域的研究。
- 4.
AV-Flamingo 在超过 15 个基准测试中表现优于同等规模的 AV 模型和全模态大语言模型,并且与规模大得多的开源权重模型和闭源模型相比仍极具竞争力,在某些情况下甚至超越了它们。此外,它在长时长、复杂的真实世界视频上展现出显著更强的鲁棒性。
2. 方法论
2.1 架构
在本节中,我们将讨论如图 2 所示的音视频 Flamingo 架构。AVF 是一种音视频大语言模型,旨在联合推理视觉和听觉输入(两者或其中之一),同时通过语音合成支持基于语音的交互。该架构与 OmniVinci 类似,由五个关键组件构成:i) SigLip 视觉编码器,从视觉输入(例如图像、视频帧)中提取丰富的空间特征;ii) AF-Whisper(借鉴自 Audio Flamingo 系列),一种采用滑动窗口特征提取机制来处理长音频的音频编码器;iii) 跨模态交错与时间对齐模块,沿时间轴融合视频和音频表示;iv) 纯文本大语言模型,作为核心推理主干;v) 流式文本转语音模块,实现实时语音输出。下面我们将详细讨论每个组件。
SigLip 视觉编码器。为了编码视觉输入,我们采用了 SigLip(Zhai 等人,2023)视觉编码器,该编码器可从图像或视频帧中生成密集的特征表示。给定原始输入后,我们首先从预训练的 SigLip 模型中提取特征图。然后,这些特征图会通过一个“空间缩放再压缩”动态 S2 模块,该模块遵循 Liu 等人(2025)和 Ye 等人(2025)的设计原则。动态 S2 模块的工作原理是:首先在多个空间尺度上对输入图像进行编码,然后将多尺度表示压缩成一个紧凑的 token 序列。这种多尺度策略使 AVF 能够编码更高分辨率的图像和包含更多帧的更长视频,同时保留细粒度的空间和时间细节——关键在于,这不会导致大语言模型消耗的 token 总数成比例增加。最终,我们得到单个图像(或视频的每一帧)的特征表示,记为 ,其中 和 是压缩后视觉特征图的空间高度和宽度, 是视觉编码器的隐藏维度。
AF-Whisper 音频编码器。继 Audio Flamingo 3、Next 和 Music Flamingo 之后,我们采用了来自 AF-Next 的基于 Whisper 的 AF-Whisper 音频编码器(Goel 等人,2025;Ghosh 等人,2025a)。对于每个音频输入,我们首先将其重采样为 16 kHz 单声道,以统一不同音频源的采样率。然后,使用 25 毫秒的窗口大小和 10 毫秒的跳跃长度,将重采样后的原始波形转换为 128 通道的对数梅尔频谱图,生成适合下游编码器处理的时频表示。该梅尔频谱图由编码器处理(Goel 等人,2025;Ye 等人,2025),编码器采用滑动窗口机制来处理任意长度的音频:频谱图被分割成不重叠的 30 秒片段,每个片段被独立编码,然后沿时间轴拼接。由此产生的音频特征记为 ,其中 是 30 秒音频片段的总数, 是 Whisper 编码器的隐藏维度。滑动窗口设计使 AVF 能够处理长音频(例如,完整的播客剧集或电影原声带),而无需截断或消耗过多内存。
视觉与音频适配器。对于每种模态,我们都有投影层,具体来说,音频使用一个 2 层 MLP,记为 ,视觉使用一个 2 层 MLP,记为 。这些投影将编码器的输出映射到大语言模型的嵌入空间:投影后的音频嵌入为 ,投影后的图像/视频嵌入为 。
视觉与音频的跨模态对齐。多模态架构中的一个核心挑战是在将视觉和音频 token 输入大语言模型之前如何对其进行融合。遵循 OmniVinci(Ye 等人,2025)的方法,我们通过时间交错的方式强制实现两种模态之间的跨模态对齐。投影后的视频和音频 token 序列首先沿时间维度被划分为多个同步块,然后根据其时间戳进行交错排列,使得来自同一时间窗口的视觉 token 与来自同一窗口的音频 token 相邻放置。这种交错排列使得大语言模型的自注意力机制能够自然地关注同时发生的视觉和听觉事件。最后,在将这些交错的 token 嵌入向量注入大语言模型之前,我们通过约束旋转时间嵌入(CRTE)(Goel 等人,2024;Ye 等人,2025)为其增加周期性时间信息。该方法使用正弦旋转变换来编码绝对时间位置,使模型即使在交错之后也能区分多模态事件的顺序和相对时序。
大语言模型(LLM)。AVF 的核心推理组件是一个大语言模型,它处理交错的多模态 token 序列并生成文本回复。遵循 OmniVinci(Ye 等人,2025)的做法,我们采用 Qwen2.5-7B(Team.,2025)作为基础大语言模型,该模型包含 7B 参数、36 个隐藏层以及每层 16 个注意力头。大语言模型接收经过时间对齐、交错的视觉-音频嵌入向量作为输入前缀 token,随后接收任何基于文本的指令或查询,并自回归地生成文本回复。为了处理第 2.3 节中讨论的长达 15 分钟的长视频的长上下文训练,我们采用了混合序列并行(Fang 和 Zhao,2024)以及全分片数据并行(Rasley 等人,2020)。这种方法通过将多模态序列维度拆分到多个 GPU 上,使用 Ulysses(Jacobs 等人,2023)进行节点内通信,并使用 Ring-Attention(Liu 等人,2023)进行节点间通信,从而减少了内存使用。可选地,为了支持语音到语音的交互,与 Audio Flamingo 3(Goel 等人,2025)和 OmniVinci(Ye 等人,2025)类似,Audio-Visual Flamingo 集成了一个流式 TTS 模块。更多细节,请读者参阅 Goel 等人(2025)的文献。
流式 TTS。为了支持语音到语音的交互,与 Audio Flamingo 3(Goel 等人,2025)和 OmniVinci(Ye 等人,2025)类似,Audio-Visual Flamingo 集成了一个流式 TTS 模块。该模块实现为一个仅解码器的 Transformer,它根据来自大语言模型的输入子词文本 token 和先前生成的音频 token 来预测下一个音频 token。更多细节,请读者参阅 Goel 等人(2025)的文献。
2.2 训练数据
数据仍然是构建开放基础全模态与视听模型(Ye 等人,2025)中最关键但公开讨论最少的组成部分之一。尽管近期工作已改善了大规模纯音频数据集(Galvez 等人,2021;Ghosh 等人,2026)和纯图像/视频数据集(Schuhmann 等人,2022;Zhang 等人,2024)的可获取性,但用于联合视听学习的同类资源仍然有限,尤其是针对需要声音与视觉综合理解以及跨模态推理的任务。现有的视听问答数据集通常源自以识别任务(如 AVSR、事件分类或 AV 定位)为核心的基础基准(Chen 等人,2020;Tian 等人,2018),不足以训练具备强专家级推理能力的模型(Goel 等人,2026)。
在 AVF 中,我们特别强调通过大规模、高质量的视听问答数据来发展推理与问题解决能力。受 Audio Flamingo 系列启发,除了现有的单模态图像/音频/视频数据集(主要来自 OmniVinci,并有所补充,详细统计见表 LABEL:tab:dataset-details),我们引入了 Audio-Visual-Skills(AV-Skills),这是一个大规模的真实世界视频数据集,包含多样化的时长,数据来源既包括现有数据集也包括开放互联网,并配有高质量描述和问答标注。与以往严重依赖单模态监督的数据混合方式不同,AV-Skills 专门为联合跨模态视听理解而策划,重点在于教会模型超越识别的复杂技能,包括对时间跨度长、组合性强以及真实世界长视频进行推理。
作为数据整理的第一步,我们识别了实现强大真实世界视听理解所需的关键技能。为此,我们在 WorldSense 和 MMOU 等具有挑战性的基准测试上,评估了包括 Qwen-Omni 系列、Gemini 和 VideoLLaMA 在内的前沿全模态与视听模型,并分析其输出以找出系统性的能力差距。具体而言,我们将基准测试中的问答对转换为开放式形式,因为多项选择设置可能让模型利用选项偏差或排除启发式策略。我们的分析揭示了核心技能(如计数和时间理解)方面的差距,以及因训练数据对多样化视频类型接触有限而导致的分布性弱点。例如,现有开源模型使用的数据中,大量是 vlog 风格的说话人头部特写视频,对环境音、背景音乐以及复杂的真实世界视听场景覆盖相对不足。
为解决这些局限性,我们整理了两个大规模训练集:AV-Skills-Short(包含最长 60 秒的视频)和 AV-Skills-Long(包含时长在 60 秒至 15 分钟之间的视频)。这些数据集构建自两个来源:公开可用的数据集以及从开放互联网收集的原始视频,随后我们对后者进行合成标注。对于公开数据集,短视频数据主要使用 YouTube-8M (Abu-El-Haija 等人,2016)、HD-VILA (Xue 等人,2022)、InternVid (Wang 等人,2024b) 和 VidChapters (Yang 等人,2023);长视频数据则主要使用 HarmonySet (Zhou 等人,2025)、LSMDC (Rohrbach 等人,2016)、MMTrail (Chi 等人,2024)、MovieClips (Bose 等人,2022) 和 MiraData (Ju 等人,2024)。其余数据从开放互联网收集,重点在于类别多样性 (Goel 等人,2026),涵盖播客、城市导览、访谈、体育等多个领域(图 LABEL:fig:data_categories)。我们最终的 AV-Skills-Short 数据集包含 10 万小时视频和 380 万个训练实例,其中包括 100 万条字幕和 280 万个问答对(详细统计信息见表 LABEL:tab:dataset-details)。长视频训练数据包含约 14 万小时视频和 320 万个训练实例,其中包括 120 万条字幕和 200 万个问答对。对于 AV-Skills-Short,我们重点关注以下技能(示例见 LABEL:sec.dataset_examples):(i) 关系推理:涉及理解视频中实体(包括人、物体、角色及其相对配置)之间的关系、交互或区别。(ii) 情绪变化:专注于追踪一个人或角色的情绪状态随时间如何演变,包括初始情绪、最终情绪以及两者之间的转变过程。(iii) 时序推理:捕捉视频的时间结构,包括事件顺序、目标事件前后发生的情况,以及动作如何随时间展开。(iv) 空间感知:需要感知视觉场景中的空间属性,例如方向、朝向、相对位置、对齐方式以及人或物体的放置位置。(v) 因果推理:旨在通过将观察到的结果与其潜在原因联系起来,推断事件、动作、行为或结果为何发生。(vi) 幻觉检测:评估一个问题是否基于视频中实际存在的信息,要求模型拒绝虚假前提或无依据的主张。(vii) 音频计数:测试对视频中特定声音、口语词汇、乐器或其他音频事件出现次数进行计数的能力。(viii) 视频计数:衡量对视频中特定物体、实体、动作或视觉事件出现次数进行计数的能力。
针对 AV-Skills-Long,我们重点关注以下技能(示例见图 3 和表 LABEL:tab:dataset-details):(i) 大海捞针式推理:回答关于长视频中某个特定但重要时刻的问题,或某个局部事件,该事件仍需更广泛的音视频上下文才能正确识别。(ii) 时序推理:a) 时序指代:识别目标事件之前或之后立即发生的事件。b) 时序顺序:确定多个音视频事件的正确顺序。c) 时序属性:推理场景动态(如强度、节奏或氛围)如何随时间演变。(iii) 子场景理解:基于前后发生的事件,理解并描述长视频中一个有意义的中间片段。(iv) 整体推理:通过整合分布在视频大部分内容中的音视频证据,推断高层次的目标、动机或结果。(v) 计数:统计某个特定音视频事件、交互或重复模式在整个视频中出现的次数。(vi) 音视频指代:将一种模态中的事件与另一种模态中的对应事件关联起来,例如识别与某个声音相关的视觉场景,或与某个视觉事件相关的声音。(vii) 主题级推理:通过综合整个时间线上的证据,识别视频的主要活动、目标或整体主题。(viii) 详细描述:生成整个视频的全面音视频描述,捕捉关键动作、场景变化、声音和口语内容,且不重复冗余。(ix) 事件序列推理:确定视频时间线上关键音视频事件的相对顺序。(x) 音视频事件对齐:识别与某个视觉时刻恰好重合的声音,或与某个目标音频线索同步的精确视觉事件。(xi) 推断:通过组合多个未直接说明的音视频线索,得出关于隐含意图、原因或结果的结论。(xii) 比较推理:识别同一视频中两个音视频事件、场景或呈现之间的重要差异或相似之处。(xiii) 上下文理解:通过联合推理视觉细节、声音和语音,推断更广泛的情境设定、背景上下文或场景条件。
AV-Think。最后,我们引入了时间交错音频-视觉链式推理(TAVIT),这是一种推理框架,它教会模型将中间推理步骤与相互依赖的音频和视频流中的时间戳进行关联(示例见图3)。此前关于视频理解的链式推理研究仍然有限,主要集中在纯视频场景或近期全能模型中浅层的推理痕迹。现有方法通常只能带来微弱的性能提升,有时甚至会降低性能(Team, 2026),部分原因是当前的音频或音频-视觉链式推理数据大多局限于短视频片段和事后附加推理的简单问答对。
我们认为,显式推理对于长篇幅、复杂的真实世界视频最为有用,因为在这些视频中,证据分布在多个相互重叠且时间上分散的事件中。为弥补这一空白,我们构建了 AV-Think,这是一个用于时间定位音频-视觉推理的问答-推理三元组数据集。与先前工作不同,AV-Think 在带有时间戳的推理步骤中明确交错呈现音频和视觉证据,将推理准确性与时间定位能力联系起来。
AV-Think 是从具有挑战性的长视频中精选而来,包括预告片、电影解说、悬疑故事和多轮对话,并配以需要扩展时间推理能力的问题。我们将推理与时间关联,原因在于:(i) 带有时间戳的思考有助于模型在长音频-视频流中进行导航和推理;(ii) 将中间推理步骤定位到时间事件上可以提升识别性能(Kumar 等人,2026)。为构建该数据集,我们首先使用 TAC 风格的流水线为每个视频生成带时间戳的标题,然后基于这些标题提示一个大语言模型来合成推理三元组(提示词见图 LABEL:fig:prompt_avthink)。AV-Think 包含约 24,000 个训练样本,推理链平均长度为 635.7 个词。
2.3 训练课程
我们设计了一个三阶段课程来训练 AVF。在每个阶段,我们采用不同的数据混合策略,逐步增加上下文长度和任务复杂度。我们假设不同能力会在训练的不同阶段涌现:基础的听觉和视觉技能最好在早期通过单模态和短上下文数据习得,在此期间模型也会获得较弱的音视频对齐能力。另一方面,较强的音视频对齐、长上下文理解以及时间理解等更复杂的技能,则需要后期使用长篇幅、真实世界且复杂的数据进行专门化训练。我们在表 LABEL:tab:dataset-details 中提供了完整的数据混合比例,并在第 3 节中描述了训练技术,包括训练超参数。
预训练。该阶段包含两个阶段,旨在建立基础能力。在第一阶段:初始化阶段,我们从预训练的 OmniVinci(Ye 等人,2025)检查点初始化 AVF,该检查点提供了已经对齐的视觉、音频和语言表征,是一个强大的起点。在第二阶段:短上下文训练中,我们在单模态数据集(涵盖纯音频和纯视觉任务,如分类、字幕生成、ASR 以及图像/视频问答)以及我们新整理的 AV-Skills-Short 数据的混合数据上,对模型进行全参数微调。单模态数据确保从 OmniVinci 继承的特定模态能力得以保留和增强,而 AV-Skills-Short 数据则引入了 Audio-Visual Flamingo 独有的跨模态推理能力。此阶段的最大音视频时长限制为 5 分钟,重点放在高质量的中短时长样本上,因为在这些样本上,技能特定的监督信号最为可靠且可扩展。此阶段的总上下文长度限制为 16K tokens。
| 任务 | 数据集 | 模型 | 指标 | 结果 |
|---|---|---|---|---|
| 全模态理解 | WorldSense | Qwen2.5-O | ACC ↑ | 45.4 |
| OmniVinci | 48.2 | |||
| AVF-Instruct | 50.3 | |||
| AVF-Think | 51.6 | |||
| DailyOmni | OmniVinci | ACC ↑ | 66.5 | |
| AVF-Instruct | 72.4 | |||
| AVF-Think | 73.9 | |||
| OmniBench | Gemini-1.5 Pro | 准确率 ↑ | 47.6 | |
| AVF-Instruct | 48.5 | |||
| AVF-Think | 50.6 | |||
| MMOU | Gemini-2.5 Pro | 准确率 ↑ | 64.2 | |
| Minicpm-o 4.5 | 46.8 | |||
| AVF-Instruct | 56.9 | |||
| AVF-Think | 60.2 | |||
| AVHBench 音频→视频幻觉 | 视频→音频幻觉 | Gemini-2.0 Flash | 准确率 ↑ | 83.3 | 63.3 | |
| AVF-Instruct | 77.0 | 81.1 | |||
| AVF-Think | 79.0 | 85.9 | |||
| 音频理解 | MMAR | OmniVinci | 准确率 ↑ | 58.4 |
| AVF-Instruct | 60.1 | |||
| MMSU | Gemini 1.5 Pro | 准确率 ↑ | 60.7 | |
| AVF-Instruct | 61.5 | |||
| MMAU-v05.15.25 (测试集) 声音 | 音乐 | 语音 | 平均 | Audio Flamingo 3 | 准确率 ↑ | 75.83 | 74.47 | 66.97 | 72.42 | |
| OmniVinci | 73.57 | 73.07 | 68.17 | 71.60 | |||
| AVF-Instruct | 77.97 | 73.17 | 69.33 | 73.49 | |||
| CMM 幻觉 | Gemini 2.5 Pro | 准确率 ↑ | 82.0 | |
| AVF-Instruct | 86.7 | |||
| 理解 | Video-MME 无字幕 | 有字幕 | NVILA | 准确率 ↑ | 64.2 | - |
| OmniVinci | 67.3 | 68.6 | |||
| AVF-Instruct | 70.7 | 71.2 | |||
| LongVideoBench | OmniVinci | 准确率 ↑ | 62.0 | |
| NVILA | 58.7 | |||
| AVF-Instruct | 60.1 | |||
| MVHBench | OmniVinci | 准确率 ↑ | 70.6 | |
| AVF-Instruct | 71.7 | |||
| 自动语音识别 | LibriSpeech (英文) test-clean | test-other | Phi-4-mm | Qwen2.5-O | 词错误率 ↓ | 1.67 | 3.4 |
| AVF-Instruct | 1.64 | 3.5 | |||
| SPGISpeech (英文) | Qwen2-A-Inst | 词错误率 ↓ | 3.0 | |
| AVF-Instruct | 2.8 | |||
| TEDLIUM (英文) | Phi-4-mm | 词错误率 ↓ | 2.9 | |
| AVF-Instruct | 3.0 | |||
| GigaSpeech (英文) | Phi-4-mm | 词错误率 ↓ | 9.78 | |
| AVF-Instruct | 10.2 | |||
| VoxPopuli (英文) | Phi-4-mm | 词错误率 ↓ | 5.9 | |
| AVF-Instruct | 5.8 |
中期训练。本阶段建立在预训练第二阶段所获得的能力之上,重点在于将 AVF 的理解能力扩展到更长的音视频输入。我们使用 AV-Skills-Long 数据扩展了数据混合,该数据专注于长格式描述、需要精确时间定位的时序感知标注以及长上下文问答数据集。为了保持平衡的训练分布,我们还额外加入了预训练阶段 AV-Skills-Short 数据的降采样子集,确保模型在学习处理扩展时间上下文进行推理的同时,能够保留先前习得的技能。本阶段的最大音频/视频时长增加至 15 分钟,总上下文长度扩展至 32K 模型 token。由此过程训练得到的完整模型称为 AVF-Instruct。
后训练。最后,我们在 AV-Think 数据集上训练 AVF,使其具备基于时间锚点的思维链推理能力。从 AVF-Instruct 出发,我们首先在 AV-Think 上执行 SFT,引导模型生成结构化、逐步推进且锚定于音视频输入中特定实例的推理过程。随后,我们使用基于 GRPO 的强化学习(Shao 等人,2024)(更多细节见第 LABEL:sec:grpo-rl 节)对模型进行训练,以进一步增强模型的推理质量。此阶段得到的最终模型称为 AVF-Think。
3. 实验
实验设置。我们在 512 块 NVIDIA H100 GPU 上对 Audio Visual Flamingo 进行预训练、长上下文训练和后训练。关于各训练阶段的批次大小、学习率和优化器的更多细节,请参见附录第 LABEL:sec.avf_training_details 节。
基线模型。我们将所提出的模型与近期 SOTA 的开源和专有 MLLM(大型多模态语言模型,包括 Qwen2.5-O(mni)(Xu 等人,2025a)、Qwen3-O(mni)(Xu 等人,2025b)、OmniVinci(Ye 等人,2025)、Gemini(2.0 Flash、1.5 Pro、2.5 Flash 和 2.5 Pro)(Team 等人,2024;Team,2025)以及 GPT-4o(Hurst 等人,2024))进行了对比评估。此外,在音频和语音理解方面,我们还与专门的大型音频语言模型(LALM)进行了比较,例如 Audio Flamingo(Kong 等人,2024)、Audio Flamingo 2(Ghosh 等人,2025b)、Audio Flamingo 3(Goel 等人,2025)、Qwen-A(udio)(Chu 等人,2023)、Qwen2-A(udio)(Chu 等人,2024)、Qwen2-A(udio)-(Inst)ruct、R1-AQA(Li 等人,2025a)、Pengi(Deshmukh 等人,2024)、Phi-4-mm(Abouelenin 等人,2025)、百川音频(Li 等人,2025b)、Step-Audio-Chat(Tian 等人,2025)、LTU(Gong 等人,2023b)、LTU-AS(Gong 等人,2023a)、SALMONN(Tang 等人,2023)和 AudioGPT(Huang 等人,2023)。同样,在视频理解方面,我们与专门的视觉语言模型(VLM)进行了比较,例如 VILA(Lin 等人,2024)、LongVILA(Chen 等人,2024b)、NVILA(Liu 等人,2025)、InternVL(Chen 等人,2024c)、Qwen2-VL(Wang 等人,2024a)、LLaVA-OneVision(Li 等人,2024)和 Florence-VL(Chen 等人,2024a)。
评估数据集。我们在涵盖音频理解(MMAR (Ma et al., 2025)、MMSU (Wang et al., 2026)、MMAU (v05.15.25) (Sakshi et al., 2024),涵盖声音、音乐和语音推理)、视频理解(Video-MME (Fu et al., 2025)、ActivityNetQA (Yu et al., 2019)、LongVideoBench (Wu et al., 2024),涵盖视觉理解及时序推理)、全模态/多模态理解(WorldSense (Hong et al., 2026) 和 DailyOmni (Zhou et al., 2026),评估音频和视频信号的联合推理)以及 ASR(LibriSpeech(clean 和 other)(Panayotov et al., 2015)、SPGISpeech (O’Neill et al., 2021)、TEDLIUM (Hernandez et al., 2018)、GigaSpeech (Chen et al., 2021)、Common Voice 15,涵盖干净、嘈杂及多样化的真实语音场景)的多样化基准上评估我们的模型。
4. 实验结果
音频理解与推理。尽管 AVF-Instruct 是作为联合音视频模型训练的,但它在纯音频理解与推理方面展现出强大的迁移能力。它在 MMAR 上优于 OmniVinci(60.1 对比 58.4),并在 MMSU 上超过 Gemini 1.5 Pro(61.5 对比 60.7)。在 MMAU 上,AVF-Instruct 取得了最佳总体平均分(73.49),优于 AF3 和 OmniVinci,尤其在声音和语音理解方面提升显著。在 ASR 方面,AVF 在 LibriSpeech test-clean(1.64 WER)、SPGISpeech(2.8)和 VoxPopuli(5.8)上取得了最佳结果,同时在其他基准上保持与最强基线接近的水平。
视频与全模态理解。AVF-Instruct 在纯视频和全模态评估中也持续展现出性能提升。在 Video-MME 基准上,它在无字幕(70.7)和有字幕(71.2)两种设置下均取得了最佳性能,超越了 NVILA 和 OmniVinci。在 WorldSense 和 DailyOmni 基准上,AVF-Instruct 再次取得了最强结果,表明其在跨模态的联合感知与推理方面表现更优。在 LongVideoBench 基准上,虽然 OmniVinci 仍略占优势,但 AVF-Instruct 依然优于 NVILA,并在长视频理解方面保持了竞争力,这表明它能有效扩展到具有挑战性的真实世界视频场景。MMOU 基准上的结果则强调,AVF 在长时、复杂的音视频理解任务中属于顶尖水平。更多定性示例请参见表 LABEL:tab:av-cot-examples 及我们的项目页面。消融实验:表 LABEL:tab:app_training_recipe 总结了紧凑的 AVF 训练方案。表 LABEL:tab:ablation-avskills 提供了关于我们 AV-Skills 课程设置的附录消融实验结果。
5. 结论、局限性与未来工作
我们提出了 AV-Flamingo,一个完全开源的大语言模型(AV-LLM),用于对长时、复杂的真实世界视频进行联合理解与推理。AV-Flamingo 结合了 AV-Skills(一个用于联合跨模态学习的大规模数据集)、一个三阶段课程(用于从短上下文感知扩展到长程推理),以及 TAVIT(一个将中间思维锚定到音频和视频流中时间戳的推理框架)。实验表明,该模型在多种基准测试中均表现出色,尤其是在长时、复杂的真实世界视频任务上取得了显著提升。
AV-Flamingo 仍存在若干局限性。AV-Skills 基于公开数据集和互联网开放视频构建,这可能会引入来源偏差,并与先前的训练数据存在潜在重叠。此外,对超长且高密度视频的推理仍然具有挑战性,尤其是在证据稀疏或时间分布分散的情况下。最后,当前的评测基准未能完全涵盖开放式的真实世界部署场景。在未来的工作中,我们计划将 AV-Skills 扩展到更广泛的领域和更具挑战性的长视频场景,改进长上下文推理能力,并为开放音视频系统开发更贴近实际的评估方案。
参考文献
- A. Abouelenin, A. Ashfaq, A. Atkinson, H. Awadalla, N. Bach, J. Bao, A. Benhaim, M. Cai, V. Chaudhary, C. Chen, 等人 (2025) Phi-4-mini 技术报告:通过混合 LoRA 实现紧凑而强大的多模态语言模型。arXiv 预印本 arXiv:2503.01743。引用自:§3。
- S. Abu-El-Haija, N. Kothari, J. Lee, P. Natsev, G. Toderici, B. Varadarajan, 和 S. Vijayanarasimhan (2016) YouTube-8M:大规模视频分类基准。arXiv 预印本 arXiv:1609.08675。引用自:§2.2。
- D. Bose, R. Hebbar, K. Somandepalli, H. Zhang, Y. Cui, K. Cole-McLaughlin, H. Wang, 和 S. Narayanan (2022) MovieCLIP:电影中的视觉场景识别。外部链接:2210.11065,链接。引用自:§2.2。
- G. Chen, S. Chai, G. Wang, J. Du, W. Zhang, C. Weng, D. Su, D. Povey, J. Trmal, J. Zhang, M. Jin, S. Khudanpur, S. Watanabe, S. Zhao, W. Zou, X. Li, X. Yao, Y. Wang, Z. You, 和 Z. Yan (2021) GigaSpeech:一个包含 10,000 小时转录音频的不断发展的多领域 ASR 语料库。收录于 Interspeech 2021,第 3670–3674 页。外部链接:链接,文献。引用自:§3。
- H. Chen, W. Xie, A. Vedaldi, 和 A. Zisserman (2020) VGGSound:大规模音视频数据集。收录于国际声学、语音与信号处理会议 (ICASSP)。引用自:§2.2。
- J. Chen, J. Yang, H. Wu, D. Li, J. Gao, T. Zhou, 和 B. Xiao (2024a) Florence-vl:通过生成式视觉编码器与深度广度融合增强视觉语言模型。外部链接:2412.04424,链接。引用自:§3。
- Y. Chen, F. Xue, D. Li, Q. Hu, L. Zhu, X. Li, Y. Fang, H. Tang, S. Yang, Z. Liu, E. He, H. Yin, P. Molchanov, J. Kautz, L. Fan, Y. Zhu, Y. Lu, 和 S. Han (2024b) LongVILA:面向长视频的长上下文视觉语言模型扩展。外部链接:2408.10188,链接 被引用于 §3。
- Z. Chen, J. Wu, W. Wang, W. Su, G. Chen, S. Xing, M. Zhong, Q. Zhang, X. Zhu, L. Lu, B. Li, P. Luo, T. Lu, Y. Qiao, 和 J. Dai (2024c) InternVL:扩展视觉基础模型并针对通用视觉-语言任务进行对齐。外部链接:2312.14238,链接 被引用于 §3。
- X. Chi, Y. Wang, A. Cheng, P. Fang, Z. Tian, Y. He, Z. Liu, X. Qi, J. Pan, R. Zhang, M. Li, R. Yuan, Y. Jiang, W. Xue, W. Luo, Q. Chen, S. Zhang, Q. Liu, 和 Y. Guo (2024) MMTrail:一个包含语言和音乐描述的多模态预告片视频数据集。外部链接:2407.20962,链接 被引用于 §2.2。
- S. Chowdhury, H. Gani, N. Anand, S. Nag, R. Gao, M. Elhoseiny, S. Khan, 和 D. Manocha (2025) AURELIA:音频-视觉大语言模型中的测试时推理蒸馏。收录于《IEEE/CVF 国际计算机视觉大会 (ICCV) 论文集》,第 22899–22910 页。被引用于 §1。
- S. Chowdhury, S. Nag, S. Dasgupta, J. Chen, M. Elhoseiny, R. Gao, 和 D. Manocha (2024) Meerkat:用于时空定位的音频-视觉大语言模型。收录于《欧洲计算机视觉大会》,第 52–70 页。被引用于 §1。
- Y. Chu, J. Xu, Q. Yang, H. Wei, X. Wei, Z. Guo, Y. Leng, Y. Lv, J. He, J. Lin, 等 (2024) Qwen2-Audio 技术报告。arXiv 预印本 arXiv:2407.10759。被引用于 §3。
- Y. Chu, J. Xu, X. Zhou, Q. Yang, S. Zhang, Z. Yan, C. Zhou, 和 J. Zhou (2023) Qwen-Audio:通过统一的大规模音频-语言模型推进通用音频理解。外部链接:2311.07919,链接 被引用于 §3。
- S. Deshmukh, B. Elizalde, R. Singh, 和 H. Wang (2024) Pengi:面向音频任务的音频语言模型。外部链接:2305.11834,链接 被引用于 §3。
- J. Fang 和 S. Zhao (2024) USP:一种面向长上下文生成式 AI 的统一序列并行方法。arXiv 预印本 arXiv:2405.07719。被引用于 §2.1。
- C. Fu, Y. Dai, Y. Luo, L. Li, S. Ren, R. Zhang, Z. Wang, C. Zhou, Y. Shen, M. Zhang 等人 (2025) 《Video-MME:首个面向视频分析的多模态大语言模型综合评估基准》。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 24108–24118 页。引用自:§1, §3。
- D. Galvez, G. Diamos, J. Ciro, J. F. Cerón, K. Achorn, A. Gopi, D. Kanter, M. Lam, M. Mazumder 与 V. J. Reddi (2021) 《人民语音:面向商业用途的大规模多样化英语语音识别数据集》。外部链接:2111.09344, Link。引用自:§2.2。
- S. Ghosh, A. Goel, K. Jayakumar, L. Koroshinadze, N. Anand, Z. Kong, S. Gururani, S. Lee, J. Kim, A. Aljafari, C. H. Yang, S. Kim, R. Duraiswami, D. Manocha, M. Shoeybi, B. Catanzaro, M. Liu 与 W. Ping (2026) 《Audio Flamingo Next:面向语音、声音和音乐的下一代开放音频语言模型》。外部链接:2604.10905, Link。引用自:§2.2。
- S. Ghosh, A. Goel, L. Koroshinadze, S. Lee, Z. Kong, J. F. Santos, R. Duraiswami, D. Manocha, W. Ping, M. Shoeybi 等人 (2025a) 《Music Flamingo:在音频语言模型中扩展音乐理解能力》。arXiv 预印本:arXiv:2511.10289。引用自:§2.1。
- S. Ghosh, Z. Kong, S. Kumar, S. Sakshi, J. Kim, W. Ping, R. Valle, D. Manocha 与 B. Catanzaro (2025b) 《Audio Flamingo 2:具备长音频理解与专家推理能力的音频语言模型》。外部链接:2503.03983, Link。引用自:§3。
- A. Goel, S. Ghosh, V. Agarwal, N. Anand, K. Jayakumar, L. Koroshinadze, Y. Xu, K. Lyons, J. Case, K. Sapra 等人 (2026) 《MMOU:面向长时复杂真实世界视频的大规模多任务全向理解与推理基准》。arXiv 预印本:arXiv:2603.14145。引用自:§1, §2.2, §2.2。
- A. Goel, S. Ghosh, J. Kim, S. Kumar, Z. Kong, S. Lee, C. H. Yang, R. Duraiswami, D. Manocha, R. Valle 等人 (2025) 《Audio Flamingo 3:以完全开放的大型音频语言模型推动音频智能发展》。arXiv 预印本:arXiv:2507.08128。引用自:§2.1, §2.1, §2.1, §3。
- A. Goel, K. Sapra, M. Le, R. Valle, A. Tao 与 B. Catanzaro (2024) 《OmCat:全向上下文感知 Transformer》。arXiv 预印本:arXiv:2410.12109。引用自:§2.1。
- K. Gong, K. Feng, B. Li, Y. Wang, M. Cheng, S. Yang, J. Han, B. Wang, Y. Bai, Z. Yang, 和 X. Yue (2024) AV-odyssey bench: 你的多模态大语言模型真的能理解视听信息吗?. 外部链接: 2412.02611, 链接 被 §1 引用.
- Y. Gong, A. H. Liu, H. Luo, L. Karlinsky, 和 J. Glass (2023a) 联合音频与语音理解. 外部链接: 2309.14405, 链接 被 §3 引用.
- Y. Gong, H. Luo, A. H. Liu, L. Karlinsky, 和 J. Glass (2023b) 倾听、思考与理解. arXiv 预印本 arXiv:2305.10790. 被 §3 引用.
- F. Hernandez, V. Nguyen, S. Ghannay, N. Tomashenko, 和 Y. Estève (2018) TED-lium 3: 用于说话人自适应实验的双倍数据量与语料库重划分. 载于《语音与计算机》, 第 198–208 页. 外部链接: ISBN 9783319995793, ISSN 1611-3349, 链接, 文献标识码 被 §3 引用.
- J. Hong, S. Yan, J. Cai, X. Jiang, Y. Hu, 和 W. Xie (2026) WorldSense: 评估多模态大语言模型的真实世界全模态理解能力. 外部链接: 2502.04326, 链接 被 §3 引用.
- R. Huang, M. Li, D. Yang, J. Shi, X. Chang, Z. Ye, Y. Wu, Z. Hong, J. Huang, J. Liu, Y. Ren, Z. Zhao, 和 S. Watanabe (2023) AudioGPT: 理解并生成语音、音乐、声音及说话头像. 外部链接: 2304.12995, 链接 被 §3 引用.
- A. Hurst, A. Lerer, A. P. Goucher, A. Perelman, A. Ramesh, A. Clark, A. Ostrow, A. Welihinda, A. Hayes, A. Radford, 等人 (2024) GPT-4o 系统卡. arXiv 预印本 arXiv:2410.21276. 被 §3 引用.
- S. A. Jacobs, M. Tanaka, C. Zhang, M. Zhang, S. L. Song, S. Rajbhandari, 和 Y. He (2023) DeepSpeed Ulysses: 用于实现超长序列 Transformer 模型训练的系统优化. arXiv 预印本 arXiv:2309.14509. 被 §2.1 引用.
- X. Ju, Y. Gao, Z. Zhang, Z. Yuan, X. Wang, A. Zeng, Y. Xiong, Q. Xu, 和 Y. Shan (2024) MiraData: 一个具有长时长和结构化描述的大规模视频数据集. 外部链接: 2407.06358, 链接 被 §2.2 引用.
- Z. Kong, A. Goel, R. Badlani, W. Ping, R. Valle, 和 B. Catanzaro (2024) Audio Flamingo: 一种具备少样本学习和对话能力的新型音频语言模型. 外部链接: 2402.01831, 链接 被 §3 引用.
- N. Kumar (2026) 93 项 2026 年视频营销统计数据 [最新数据与趋势]。注:https://www.demandsage.com/video-marketing-statistics/DemandSage。发布于 2026 年 4 月 9 日。访问于 2026 年 4 月 14 日。引用自:§1。
- S. Kumar, P. Seetharaman, K. Chen, O. Nieto, J. Su, Z. Wang, R. Kumar, D. Manocha, N. J. Bryan, Z. Jin, 和 J. Salamon (2026) TAC:带时间戳的音频描述。外部链接:2602.15766,链接。引用自:§2.2。
- B. Li, Y. Zhang, D. Guo, R. Zhang, F. Li, H. Zhang, K. Zhang, P. Zhang, Y. Li, Z. Liu, 和 C. Li (2024) LLaVA-OneVision:轻松实现视觉任务迁移。外部链接:2408.03326,链接。引用自:§3。
- G. Li, J. Liu, H. Dinkel, Y. Niu, J. Zhang, 和 J. Luan (2025a) 强化学习优于监督微调:以音频问答为例。arXiv 预印本 arXiv:2503.11197。引用自:§3。
- T. Li, J. Liu, T. Zhang, Y. Fang, D. Pan, M. Wang, Z. Liang, Z. Li, M. Lin, G. Dong, J. Xu, H. Sun, Z. Zhou, 和 W. Chen (2025b) 百川音频:端到端语音交互的统一框架。外部链接:2502.17239,链接。引用自:§3。
- J. Lin, H. Yin, W. Ping, Y. Lu, P. Molchanov, A. Tao, H. Mao, J. Kautz, M. Shoeybi, 和 S. Han (2024) VILA:论视觉语言模型的预训练。外部链接:2312.07533,链接。引用自:§3。
- H. Liu, M. Zaharia, 和 P. Abbeel (2023) 基于分块 Transformer 的环形注意力实现近无限上下文。arXiv 预印本 arXiv:2310.01889。引用自:§2.1。
- Z. Liu, L. Zhu, B. Shi, Z. Zhang, Y. Lou, S. Yang, H. Xi, S. Cao, Y. Gu, D. Li, X. Li, Y. Fang, Y. Chen, C. Hsieh, D. Huang, A. Cheng, V. Nath, J. Hu, S. Liu, R. Krishna, D. Xu, X. Wang, P. Molchanov, J. Kautz, H. Yin, S. Han, 和 Y. Lu (2025) NVILA:高效的先进视觉语言模型。外部链接:2412.04468,链接。引用自:§2.1, §3。
- G. Lucas (1992) 声音是观看电影体验的一半。《纽约时报》。注:引自 C. Hodenfield 所著《与〈星球大战〉音效同行》,第 2 部分,第 24 页。引用自:§1。
- Z. Ma, Y. Ma, Y. Zhu, C. Yang, Y. Chao, R. Xu, W. Chen, Y. Chen, Z. Chen, J. Cong, K. Li, K. Li, S. Li, X. Li, X. Li, Z. Lian, Y. Liang, M. Liu, Z. Niu, T. Wang, Y. Wang, Y. Wang, Y. Wu, G. Yang, J. Yu, R. Yuan, Z. Zheng, Z. Zhou, H. Zhu, W. Xue, E. Benetos, K. Yu, E. Chng, 和 X. Chen (2025) MMAR:一个针对语音、音频、音乐及其混合内容深度推理的挑战性基准。外部链接:2505.13032,链接 引用自 §3。
- P. K. O’Neill, V. Lavrukhin, S. Majumdar, V. Noroozi, Y. Zhang, O. Kuchaiev, J. Balam, Y. Dovzhenko, K. Freyberg, M. D. Shulman, B. Ginsburg, S. Watanabe, 和 G. Kucsko (2021) SPGISpeech:5000小时已转录金融音频,用于全格式端到端语音识别。外部链接:2104.02014,链接 引用自 §3。
- V. Panayotov, G. Chen, D. Povey, 和 S. Khudanpur (2015) Librispeech:一个基于公共领域有声读物的ASR语料库。载于《2015年IEEE国际声学、语音与信号处理会议(ICASSP)》,第5206–5210页。外部链接:文献 引用自 §3。
- J. Rasley, S. Rajbhandari, O. Ruwase, 和 Y. He (2020) Deepspeed:系统优化使得训练超过1000亿参数的深度学习模型成为可能。载于《第26届ACM SIGKDD国际知识发现与数据挖掘会议论文集》,第3505–3506页。引用自 §2.1。
- A. Rohrbach, A. Torabi, M. Rohrbach, N. Tandon, C. Pal, H. Larochelle, A. Courville, 和 B. Schiele (2016) 电影描述。外部链接:1605.03705,链接 引用自 §2.2。
- S. Sakshi, U. Tyagi, S. Kumar, A. Seth, R. Selvakumar, O. Nieto, R. Duraiswami, S. Ghosh, 和 D. Manocha (2024) MMAU:一个大规模多任务音频理解与推理基准。外部链接:2410.19168,链接 引用自 §3。
- C. Schuhmann, R. Beaumont, R. Vencu, C. Gordon, R. Wightman, M. Cherti, T. Coombes, A. Katta, C. Mullis, M. Wortsman, 等人 (2022) Laion-5b:一个用于训练下一代图像-文本模型的开源大规模数据集。《神经信息处理系统进展》35,第25278–25294页。引用自 §2.2。
- R. Selvakumar、K. Jayakumar、S. Sakshi、S. Ghosh、R. Gao 与 D. Manocha(2026)《视听大语言模型真的能看能听吗?》发表于 IEEE/CVF 计算机视觉与模式识别大会(CVPR)会议论文集 Findings,第 5892–5902 页。引用于 §1。
- R. Selvakumar、A. Seth、N. Anand、U. Tyagi、S. Kumar、S. Ghosh 与 D. Manocha(2025)《MULTIVOX:评估语音助手多模态交互能力的基准》发表于 2025 年自然语言处理实证方法大会,C. Christodoulopoulos、T. Chakraborty、C. Rose 与 V. Peng 主编,中国苏州,第 28481–28493 页。外部链接:Link,文献编号:Document,ISBN:979-8-89176-332-6。引用于 §1。
- A. Seth、U. Tyagi、R. Selvakumar、N. Anand、S. Kumar、S. Ghosh、R. Duraiswami、C. Agarwal 与 D. Manocha(2025)《EGOILLUSION:以自我为中心视频理解中的幻觉基准测试》发表于 2025 年自然语言处理实证方法大会,C. Christodoulopoulos、T. Chakraborty、C. Rose 与 V. Peng 主编,中国苏州,第 28461–28480 页。外部链接:Link,文献编号:Document,ISBN:979-8-89176-332-6。引用于 §1。
- Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《Deepseekmath:推动开放语言模型数学推理的极限》arXiv 预印本 arXiv:2402.03300。引用于 §2.3。
- C. Tang、W. Yu、G. Sun、X. Chen、T. Tan、W. Li、L. Lu、Z. Ma 与 C. Zhang(2023)《Salmonn:为大语言模型赋予通用听觉能力》arXiv 预印本 arXiv:2310.13289。引用于 §3。
- G. Team、P. Georgiev、V. I. Lei、R. Burnell、L. Bai、A. Gulati、G. Tanzer、D. Vincent、Z. Pan、S. Wang 等人(2024)《Gemini 1.5:解锁跨越数百万 token 上下文的多模态理解》arXiv 预印本 arXiv:2403.05530。引用于 §1、§3。
- G. Team(2025)《Gemini 2.5:以高级推理、多模态、长上下文及下一代智能体能力推动前沿》外部链接:2507.06261,链接:Link。引用于 §3。
- Q. Team(2026)《Qwen3.5-omni:规模扩展,迈向原生全模态 AGI》外部链接:Link。引用于 §1、§1、§2.2。
- Q. Team. (2025) Qwen2.5 技术报告。外部链接:2412.15115,链接 引用自:§2.1。
- F. Tian, X. T. Zhang, Y. Zhang, H. Zhang, Y. Li, D. Liu, Y. Deng, D. Wu, J. Chen, L. Zhao, 等. (2025) Step-audio-r1 技术报告。arXiv 预印本 arXiv:2511.15848。引用自:§3。
- Y. Tian, J. Shi, B. Li, Z. Duan, 和 C. Xu (2018) 无约束视频中的音视频事件定位。外部链接:1803.08842,链接 引用自:§2.2。
- D. Wang, J. Li, J. Wu, D. Yang, X. Chen, T. Zhang, 和 H. Meng (2026) MMSU:大规模多任务口语理解与推理基准。外部链接:2506.04779,链接 引用自:§3。
- P. Wang, S. Bai, S. Tan, S. Wang, Z. Fan, J. Bai, K. Chen, X. Liu, J. Wang, W. Ge, Y. Fan, K. Dang, M. Du, X. Ren, R. Men, D. Liu, C. Zhou, J. Zhou, 和 J. Lin (2024a) Qwen2-vl:增强视觉语言模型对任意分辨率世界的感知能力。外部链接:2409.12191,链接 引用自:§3。
- Y. Wang, Y. He, Y. Li, K. Li, J. Yu, X. Ma, X. Li, G. Chen, X. Chen, Y. Wang, C. He, P. Luo, Z. Liu, Y. Wang, L. Wang, 和 Y. Qiao (2024b) InternVid:面向多模态理解与生成的大规模视频-文本数据集。外部链接:2307.06942,链接 引用自:§2.2。
- H. Wu, D. Li, B. Chen, 和 J. Li (2024) LongVideoBench:长上下文交错视频-语言理解基准。外部链接:2407.15754,链接 引用自:§3。
- J. Xu, Z. Guo, J. He, H. Hu, T. He, S. Bai, K. Chen, J. Wang, Y. Fan, K. Dang, B. Zhang, X. Wang, Y. Chu, 和 J. Lin (2025a) Qwen2.5-omni 技术报告。外部链接:2503.20215,链接 引用自:§1, §3。
- J. Xu, Z. Guo, H. Hu, Y. Chu, X. Wang, J. He, Y. Wang, X. Shi, T. He, X. Zhu, 等. (2025b) Qwen3-omni 技术报告。arXiv 预印本 arXiv:2509.17765。引用自:§1, §3。
- H. Xue, T. Hang, Y. Zeng, Y. Sun, B. Liu, H. Yang, J. Fu, 和 B. Guo (2022) 利用大规模视频转录推进高分辨率视频-语言表征。外部链接:2111.10337,链接 引用自:§2.2。
- A. Yang, A. Nagrani, I. Laptev, J. Sivic, 和 C. Schmid (2023) VidChapters-7m:大规模视频章节。外部链接:2309.13952,链接 引用自:§2.2。
- H. Ye, C. H. Yang, A. Goel, W. Huang, L. Zhu, Y. Su, S. Lin, A. Cheng, Z. Wan, J. Tian 等人 (2025) 《OmniVinci:为全模态理解大语言模型增强架构与数据》。arXiv 预印本 arXiv:2510.15870。引用自:§2.1, §2.1, §2.1, §2.1, §2.1, §2.2, §2.3, §3。
- Z. Yu, D. Xu, J. Yu, T. Yu, Z. Zhao, Y. Zhuang 和 D. Tao (2019) 《ActivityNet-qa:一个通过问答理解复杂网络视频的数据集》。外部链接:1906.02467, 链接。引用自:§3。
- X. Zhai, B. Mustafa, A. Kolesnikov 和 L. Beyer (2023) 《用于语言-图像预训练的 Sigmoid 损失函数》。外部链接:2303.15343, 链接。引用自:§2.1。
- B. Zhang, K. Li, Z. Cheng, Z. Hu, Y. Yuan, G. Chen, S. Leng, Y. Jiang, H. Zhang, X. Li 等人 (2025) 《VideoLLaMA 3:面向图像与视频理解的前沿多模态基础模型》。arXiv 预印本 arXiv:2501.13106。引用自:§1。
- H. Zhang, X. Li 和 L. Bing (2023) 《Video-LLaMA:一个面向视频理解的指令微调视听语言模型》。载于《2023年自然语言处理实证方法会议:系统演示论文集》,第 543–553 页。引用自:§1。
- Y. Zhang, J. Wu, W. Li, B. Li, Z. Ma, Z. Liu 和 C. Li (2024) 《LLaVA-Video:利用合成数据进行视频指令微调》。arXiv 预印本 arXiv:2410.02713。引用自:§2.2。
- Z. Zhou, K. Mei, Y. Lu, T. Wang 和 F. Rao (2025) 《HarmonySet:一个用于理解视频-音乐语义对齐与时间同步的综合数据集》。载于《计算机视觉与模式识别会议论文集》,第 3152–3162 页。引用自:§2.2。
- Z. Zhou, R. Wang, Z. Wu 和 Y. Jiang (2026) 《Daily-Omni:面向跨模态时间对齐的视听推理》。外部链接:2505.17862, 链接。引用自:§1, §3。
- J. Zhu、W. Wang、Z. Chen、Z. Liu、S. Ye、L. Gu、H. Tian、Y. Duan、W. Su、J. Shao、Z. Gao、E. Cui、X. Wang、Y. Cao、Y. Liu、X. Wei、H. Zhang、H. Wang、W. Xu、H. Li、J. Wang、N. Deng、S. Li、Y. He、T. Jiang、J. Luo、Y. Wang、C. He、B. Shi、X. Zhang、W. Shao、J. He、Y. Xiong、W. Qu、P. Sun、P. Jiao、H. Lv、L. Wu、K. Zhang、H. Deng、J. Ge、K. Chen、L. Wang、M. Dou、L. Lu、X. Zhu、T. Lu、D. Lin、Y. Qiao、J. Dai 和 W. Wang(2025)《InternVL3:探索开源多模态模型的高级训练与测试时方案》。外部链接:2504.10479,链接。引用自 §1。