王乐天
Google DeepMind
张楚涵
Google DeepMind
里沙布·卡布拉
Google DeepMind
贾斯珀·艾灵斯
Google DeepMind
史蒂文·瓦斯兰德
Google DeepMind
安德鲁·齐瑟曼
Google DeepMind
若昂·卡雷拉
Google DeepMind
何恺明
Google DeepMind
米沙·安德里卢卡
Google DeepMind
爱德华·加布里埃尔·巴扎万
Google DeepMind
安德烈·赞菲尔
Google DeepMind
克里斯蒂安·斯明奇塞斯库
Google DeepMind
摘要
在下一个模型 token 预测的驱动下,自然语言处理从任务专用模型转向了强大的通用基础模型。那么,在计算机视觉领域,实现通用模型所需的等效催化剂又是什么?在本文中,我们认为大规模文本到视频生成是计算机视觉的一种强大预训练范式,它为通用视觉智能提供了必要的时空先验、视觉-语言对齐以及可扩展性。我们提出了 GenCeption,该方法利用预训练的视频生成扩散骨干网络来定义一个前馈感知模型,该模型能够执行由文本指令引导的各种视觉任务。实验结果表明,GenCeption 在多种任务上达到了最先进的性能,包括深度估计、表面法线估计、相机位姿估计、指代表达式分割以及 3D 关键点预测,其表现往往能与甚至超越专用模型(例如 DepthAnything3、SAM3、D4RT、VGGT-、Sapiens、David、Genmo 和 Lotus-2)。此外,在可比设置下,视频生成预训练骨干网络的表现优于其他预训练范式(例如 V-JEPA 和 Video MAE)。重要的是,GenCeption 展现出初步的数据和模型缩放特性,以及卓越的数据效率——它仅用 D4RT 和 VGGT- 等领先模型 7 到 500 分之一的训练数据,就能达到与之相当的性能。最后,GenCeption 还展现出有趣的涌现行为:一个仅用合成人类视频训练的模型,能够泛化到真实世界影像以及分布外的物体类别(例如动物和机器人)。这些发现表明,视频生成不仅仅是一种合成工具,更是通往物理世界通用视觉智能的基础路径。
1 引言
自然语言处理(NLP)已从专用模型时代——即针对每项语言任务(如翻译、摘要)分别开发独立模型——演进为单一、统一的基础模型范式。这一范式依托大规模下一 token 预测预训练及后续任务对齐的后训练,有效将数千种截然不同的语言挑战整合为单一的通用智能,最终解锁了链式推理和上下文学习等涌现行为。
与此形成鲜明对比的是,计算机视觉仍停留在其“专用模型”阶段。尽管近年来涌现出强大的基础模型,例如用于定位的 Segment Anything 系列 [kirillov2023segment, ravi2024sam, carion2025sam] 或用于几何的 Depth Anything 系列 [yang2024depth, yang2025depth, lin2025depth],但这些本质上仍是任务特定的模型,需要为每项任务定制架构。我们已掌握专用感知能力,但尚未实现统一的视觉基础模型——一种镜像大语言模型从通用预训练到多才多艺的涌现智能的统一任务无关架构。为此,我们认为,追求通用视觉模型本质上是在寻找一种通用的预训练目标——即视觉领域中的下一 token 预测。这种预训练范式应满足三项核心要求:
- 1)
时空演化:世界是一个四维连续体。预训练目标应迫使模型内化运动世界的四维时间因果性与物理规律。
- 2)
视觉-语言对齐:为继承语言模型的指令遵循能力与常识知识,视觉特征应在预训练和后训练阶段均与语言语义原生对齐。
- 3)
规模化扩展:该范式应在数据和计算两方面实现规模化扩展,最终促成视觉智能的涌现。
在本文中,我们证明大规模文生视频生成可作为这一关键的预训练范式,与先前的视觉预训练方法(例如对比学习、掩码自编码器)相比,它独特地满足了所有三个要求。首先,生成高保真视频序列的目标迫使模型内化时空世界先验知识,包括3D几何、物体恒存性和物理交互。其次,由于这些模型天然以文本为条件,它们提供了固有的视觉-语言对齐能力。最后,现代文生视频生成模型因其相对较低的标注成本和高商业价值,已利用海量数据集和算力进行规模化扩展,为涌现智能提供了直接路径。
我们提出 GenCeption,一种实现该范式的通用视频感知模型。如图 1 所示,我们将预训练的视频扩散主干网络作为"基础模型",利用生成式预训练过程中习得的丰富先验知识。随后进入后训练阶段,我们主要使用合成数据对模型进行多种视觉任务的微调。这使得 GenCeption 能够在单一任务无关架构中执行异构感知任务,涵盖从像素级分割到更复杂的 3D 姿态估计与跟踪。具体而言,通过将迭代式扩散重构为前馈架构,GenCeption 在单次前向传播中动态推断目标模态,并由文本指令引导。值得注意的是,GenCeption 推动了从专用视觉模型向统一通用智能的范式转变——在不同视觉任务中采用统一的主干网络、头部网络和损失函数。在此范式下,任务规范从架构修改转向数据格式设计,从而能够随着视觉任务种类的不断扩展而实现规模化。
如图 2 所示,我们的实证结果表明,GenCeption 在多项感知任务上达到了最先进的性能,其表现与甚至超越了为单一模态设计的专用模型,包括 DepthAnything V3 [lin2025depth]、SegmentAnything V3 (SAM3) [carion2025sam]、D4RT [zhang2025efficiently]、VGGT- [wang2026vggt]、Sapiens [sapienseccv2024]、David [saleh2025david] 和 Genmo [genmo2025]。在可比的模型规模和相同的微调数据条件下,视频生成预训练骨干网络的表现也优于其他预训练范式中可用的最大变体(例如 V-JEPA [bardes2024revisiting]、VideoMAE V2 [tong2022videomae])。重要的是,GenCeption 展现出初步的扩展特性,其性能随数据量和模型规模的增大而提升,同时具备卓越的数据效率,仅用 7 到 500 分之一的训练数据就能达到与 D4RT 和 VGGT- 等领先模型相当的性能。最后,这一范式触发了涌现行为,包括无缝的仿真到现实迁移以及对未见物体类别的分布外泛化,如图 10(b) 和图 10(a) 所示。这些证据表明,视频生成不仅仅是一种合成工具,更是通往物理世界通用视觉智能的基础路径。
2 相关工作
2.1 感知基础模型。
感知基础模型近期引起了广泛关注,诸如 Segment Anything 系列 [kirillov2023segment, ravi2024sam, carion2025sam] 和 Depth Anything 系列 [yang2024depth1, yang2024depth, lin2025depth] 等框架,利用大规模数据集在多种视觉场景中实现了稳健的性能。并行的工作也在致力于开发能够同时处理多项任务的统一模型。然而,这些工作主要作用于图像领域 [saleh2025david, mizrahi20234m, bachmann20244m],缺乏对时间动态特性的内在理解。此外,这些模型中的多任务处理通常是在僵化的架构层面实现的——依赖于特定任务的编码器、解码器或损失函数 [saleh2025david]——这缺乏真正通用系统所需的灵活性。即使是那些试图处理视频并灵活应对各种任务的模型 [zhu2022uni, huang2025unityvideo],在广泛视频任务的评估中,其效能也尚未达到专门的、特定任务模型的水准。这与大语言模型(LLM)形成了鲜明对比,后者已证明单一的统一架构能够以人类水平甚至超人类水平的能力灵活掌握大量任务。一个能够匹敌 LLM 通用能力的真正统一的视频感知模型尚未实现。
2.2 视觉表征学习
这一挑战的核心在于表征学习这一长期任务:学习丰富且稳健的视觉表征,以支持广泛的视觉任务。在现有文献中,无监督学习和自监督学习已成为表征学习的核心范式,因为它们能够高效地利用大量无标注数据进行扩展。在代表性方法中,掩码自编码器(MAE)受掩码语言建模启发,学习重建缺失的图像区域,并建立了视觉预训练的基础框架,其学到的表征可有效微调至各类下游视觉任务。后续工作如 VideoMAE 和 RVM 已将其扩展至视频领域。与此同时,另一类重要的自监督范式利用特征级自蒸馏,如 DINO 系列所示——学生网络被训练以匹配动态更新的教师网络在同一图像的不同全局与局部视图上的特征分布。然而,这些纯视觉方法本质上缺乏显式的多模态视觉-语言对齐,缺少将视觉模式与高层概念关联所需的语义基础。另一类重要范式——对比学习——旨在对齐语义相似的样本,同时分离不相似的样本。通过在视觉与语言模态间进行对比学习,CLIP 和 SigLip 等模型学习到了强大的多模态表征,从而解锁了开放词汇分类与分割等广泛任务。尽管该领域充满活力,但视频层面的多模态表征学习仍是一个关键问题,面临诸多挑战。其中最主要的是模型扩展的严重限制:语言模型常规扩展至数千亿参数,而主流视频表征学习器的规模却小了好几个数量级。这一瓶颈源于多种因素,包括在密集视频数据上训练的计算成本过高,以及建模复杂时间动态带来的额外难度。
2.3 复用扩散模型。
近期,一个新兴方向是利用预训练扩散模型中学习到的丰富特征,我们的工作也遵循了这一路径。该领域的早期工作主要集中在单图像预测上。Marigold [Ke_2024_CVPR] 展示了如何通过微调预训练的图像扩散模型(如 Stable Diffusion [rombach2022high])在合成数据上,将其改造为单目深度估计器。[martingarcia2024diffusione2eft] 通过将时间步与噪声水平对齐,提高了此前基于扩散的深度估计器 [Ke_2024_CVPR, fu2024geowizard] 的效率,表明一种简单的端到端微调方法可以创建出既快速又高精度的单步确定性模型。GenPercept [xu2024diffusion] 进行了系统性研究,识别出特征注入、解码机制和训练目标等关键组件,这些组件对于成功将预训练扩散模型适配到密集感知任务至关重要。Diception [zhao2025diception] 展示了能够处理多项任务的强大视觉通才模型,通过文本提示词来引导感知任务。
然而,这些单图像模型的一个固有限制是,当应用于视频序列时,它们无法生成时间上一致的预测。为了解决这个问题,BufferAnytime [kuang2024bufferanytimezeroshotvideo] 提出通过引入一个用于深度和法线估计问题的时间层,将现有的图像扩散模型适配到视频领域。更进一步,多项工作已直接探索使用原生视频扩散模型来解决时间一致性问题。DepthCrafter [hu2024depthcraftergeneratingconsistentlong] 和 NormalCrafter [bin2025normalcrafter] 纳入了与大规模视觉基础模型(如 CLIP [radford2021learning] 或 DINO [oquab2023dinov2])的对齐目标,以促进训练。[yang2025depthvideoscalablesynthetic] 探索使用可扩展的合成数据进行训练,以克服视频真实标注数据稀缺的问题。Geo4D [jiang2025geo4d] 将视频扩散模型适配于 4D 场景重建。DiffusionRenderer [liang2025diffusionrendererneuralinverseforward] 利用视频扩散先验来解决逆向渲染和正向渲染的双重问题。ReferEverything [bagchi2025refereverything] 将视频扩散模型重新用于基于表达指代的开世界分割。[acuaviva2025generation] 提供了相关证据,表明视频扩散模型编码了可复用的视觉先验,并通过输入-输出视频转换展示了在多种任务上的少样本 LoRA 适配。然而,这些先进方法主要集中于单一、通常是密集的视觉任务。我们提出了一个统一的架构,用于密集和稀疏两种视频感知任务,利用文生视频模型丰富的先验知识和指令遵循能力,通过文本提示词来引导多样化的任务。此外,我们用一种高效的、直接的前馈架构取代了缓慢的迭代采样,实现了卓越的推理效率,以及达到或超越 SOTA 专家模型的性能。这项工作将我们之前以人为中心的模型 THFM [wang2026thfm] 推进为一个统一通用模型,涵盖了更广泛的任务和基准评估,并对模型行为进行了更详尽的分析。
值得注意的是,我们的工作在概念上与两项同期研究紧密相关,但在架构和评估方法上均存在差异。首先,我们的工作与 [wiedemer2025video] 都基于同一假设:大规模视频生成模型能够学习到强大的视觉先验。如果说 [wiedemer2025video] 证明了这些先验的存在,那么我们则提供了有效利用这些先验的架构。具体而言,[wiedemer2025video] 研究了一种通过多步视频生成实现的无训练提示方法,主要侧重于定性验证;而我们则引入了一种专门的训练后策略,并在标准化基准上进行了严格的定量评估。其次,Vision Banana [gabeur2026image] 在二维图像空间内运作,而 GenCeption 则将这一范式扩展到了原生视频领域,从而自然地捕捉时间一致性。此外,我们的方法没有聚焦于多步生成,而是采用了一种高效的前馈架构,在更广泛的任务范围内实现了更高的推理效率和强劲性能。更多能力展示请参见图 3、图 6、图 7 和图 8。
3 GenCeption
3.1 方法论
GenCeption 的核心前提是:大规模视频生成模型不仅仅是合成引擎,更是强大的通用视觉表征学习器。受大语言模型(LLM)发展轨迹的启发——其生成式预训练(下一个 token 预测)天然构建了可用于多种下游任务的丰富特征——我们将视频感知重新定义为基于预训练视频生成模型的后训练任务。我们的方法论遵循三项基本原则:
- 1)
多模态生成式预训练作为表征学习:我们采用预训练的文生视频扩散模型作为通用主干网络。以文本为条件生成高保真视频这一目标,天然迫使模型内化稳健的时空先验、三维几何与物理规律,同时促进对视觉-语言概念的深度对齐理解。为充分保留这些基础表征,核心设计原则之一是尽可能遵循原始预训练范式,仅做最小改动。
- 2)
统一架构中的任务无关后训练:为了从专用生成器转变为通用感知器,我们将多样化的视觉任务视为统一的序列到序列映射问题,而不是设计任务特定的架构或依赖专用的编码器、解码器和损失函数。通过将各种目标模态格式化为共享的表示空间(例如,针对密集任务的标准化 RGB 空间),我们允许单个统一架构在文本指令的无缝引导下掌握多个任务。在这种范式下,集成新的视觉能力不再需要改变架构或训练方案;相反,任务规范直接体现在数据表示中——这是一种数据驱动的方法,能够在一系列不断扩展的视觉任务中高效地实现规模化扩展。
- 3)
前馈重构:虽然扩散模型通常依赖缓慢的迭代采样过程来合成多样化的输出,但感知任务需要高度准确和高效的预测。因此,GenCeption 中的一个关键设计决策是将多步生成主干模型转变为单步前馈感知模型。
在这些原则的指导下,我们实现了 GenCeption,这是一个能够处理多种视频感知任务的模型。如图 4 所示,我们重新利用文本到视频生成模型,使其能够在统一架构内执行密集视觉任务(法线估计、深度估计、前景分割、指代表达式开放世界分割、密集人体语义估计、光线图估计)和稀疏视觉任务(2D 和 3D 关键点预测)。给定输入 RGB 视频和指定目标模态的文本提示词,GenCeption 能够通过单次前向传播生成目标视频(第 3.2 节),并为各种感知任务提供统一的表示(第 3.3 节);我们提出了一种可扩展的数据合成策略,以实现高效低成本地收集多样化高质量数据(第 3.4 节)。随后我们在第 3.5 节讨论我们的训练方案。
3.2 从扩散预训练到感知微调
初步说明。我们的模型基于文生视频扩散模型,其核心组件包括一个 VAE 编码器-解码器对、一个文本编码器,以及一个基于 Transformer 架构的潜在扩散模型(DiT)。原始的 DiT 模型以初始化为高斯噪声的潜在 token 和文本提示词作为输入,执行若干去噪步骤,逐步将其转换为潜在 token,这些 token 可被解码为生成的视频。去噪步骤的索引作为额外输入提供给 DiT,以根据输入噪声量调整预测结果。设 DiT 在第 步接收的视频 token 输入为 ,其中 是原始视频的无噪声潜在表示。根据具体公式,DiT 模块的训练目标可以是预测噪声分量(如 [song2020denoising, ho2020denoisingdiffusionprobabilisticmodels] 所述),预测噪声与原始输入之间的速度(如 "Rectified Flow" 变体 [liu2022flow, lipman2022flow, esser2024scaling] 所述),或者直接预测目标 [li2026back]。
前馈感知公式。在本工作中,我们将多步扩散 Transformer 重新设计为前馈预测模型。为此,我们不再将带噪声的视频潜在表示作为输入,而是直接将输入视频的干净潜在表示馈入 DiT,仅执行模型的一次前向传播。为表明输入无噪声,条件时间步长固定为 ,对应生成式 Rectified Flow 过程的终止点。由于 DiT 在 Rectified Flow 目标下训练以预测速度 ,我们在将 DiT 原始输出传递至损失函数或解码器之前对其取反。取反后的输出与目标视频的潜在表示更为接近,从经验上看,这能加速模型收敛并提升性能。
理解这一公式的一种直观方式是,我们将 DiT 重新定位为一个强大的特征提取器。关键在于,通过利用整流流(Rectified Flow)而非传统的噪声预测、以 为条件,并对速度输出取反,我们力求从预训练主干中提取信息最丰富、最全面的特征。此外,我们直接从最终层而非中间层获取特征;这确保了这些特征与后续解码器天然对齐,且无需对基础模型进行任何架构修改。
3.3 统一任务表示
在 RGB 空间中统一稠密任务。与以往针对不同任务采用独立骨干网络、解码器和损失函数的做法不同,我们的框架倡导一种统一方法:所有任务共享相同的骨干网络和解码器架构及权重,目标任务仅通过文本提示词进行调制。为实现这一点,所有稠密感知任务的输出均在 3 通道 RGB 空间内表示,取值范围为 。具体而言,对于深度和分割等单维输出,三个 RGB 通道被复制使用;而对于表面法线和 DensePose 估计等三维任务,它们则代表不同的维度。重要的是,这种表示方式也适用于更高维度的视觉模态,其中许多模态可以优雅地适配到这一 3 通道约束内。例如,为了估计传统上以矩阵形式表示的相机位姿,我们采用了像素空间光线图 [zhang2024cameras, zhao2025diffusionsfm, jiang2025geo4d],该图天然地与视频生成格式对齐(见图 5)。为了将其 6 通道格式适配到我们的 3 通道约束内,我们在空间上对帧进行划分——将光线原点分配到中心区域,将光线方向分配到外围区域。这种简单而有效的布局在充分利用预训练视觉先验的同时,保持了单解码器框架的完整性。更重要的是,这种设计理念能够自然地扩展到各种视觉任务。类似于将非文本数据重新格式化为大语言模型的文本字符串,我们主张将本质上属于视觉的任务直接投射到连续的像素空间——这是预训练视觉先验得以最佳利用的原生领域。
通过可学习 token 实现稀疏任务。尽管 RGB 具有通用性,但机器人控制等下游任务通常需要可直接操作的结构化输出,例如明确的 2D/3D 坐标。为了实现这些稀疏预测,我们引入了一种轻量级的基于 token 的扩展。我们将可学习 token(每个视频帧对应一个)附加到视频潜在表示中。经过模型处理后,一个 MLP 解码每个 token,以预测每帧的一个 -维目标。为了保持与基础 DiT 模型的兼容性,我们将原生的 3D RoPE 应用于这些新增 token。具体来说,由于这些新增 token 的空间位置未知,我们使其变为可学习。对于时间定位,由于视频帧数被压缩为潜在长度 ,我们使用位置插值 [chen2306extending] 对 token 的帧索引进行降采样,以保持在预训练期间所见的时间边界内。实验表明,这种附加查询方法优于依赖添加额外注意力层的方法。
3.4 可扩展的合成数据生成
我们模型的训练需要高质量且多样化的视频数据,并带有深度、法线、分割掩码、密集姿态、2D 关键点、3D 关键点和相机位姿的真实标注。由于大多数真实世界数据集可能仅包含有限规模下的部分模态,我们采用合成数据作为一种可扩展的方法来解决数据稀缺问题。
具体而言,我们设计了一套合成数据生成流程,用于制作高质量、以人为中心的视频数据,涵盖多样的人体实体与动作。我们使用了800个来自RenderPeople [Renderpeople.com] 的资产,并利用CMU动作捕捉数据集 [CMUmocap] 中的200个动作为其添加动画。我们采用了多种3D完整场景或类似 [bazavan2022hspacesyntheticparametrichumans] 的HDRI背景来增强背景多样性,并改变焦距、相机位置与轨迹以丰富相机条件。最终,我们生成了一个包含7500个视频的合成数据集,其中包含不同的身份、动作和背景。为了支持密集视觉任务,我们通过Blender [BlenderOnlineCommunity2025] 的独立渲染通道生成了视频法线、深度和分割掩码。我们从带有骨骼绑定的RenderPeople [Renderpeople.com] 资产中恢复人体关节位置,并将其作为2D和3D关键点回归任务的真实值。每个生成的视频都被裁剪至视频模型所需的目标帧数。我们应用了一个离线数据预处理阶段,在此阶段中,我们将输入的RGB视频和目标模态视频预计算并缓存为视频潜在表示,并将文本条件提示词预计算为文本嵌入。
3.5 训练方案
在确立了模型架构与数据流程之后,我们现在描述框架中采用的训练目标。传统上,联合多任务学习存在一个固有的优化挑战:不同的视觉任务需要针对其独特模态定制的专用损失函数。在实践中,这种异质性带来了大量工程开销,需要手动平衡不同目标之间的损失权重,这在扩展到更多种类的视觉任务、数据和更大模型规模时成为主要瓶颈。相反,我们采用了一种完全统一的损失设计:我们的模型仅使用标准损失函数进行训练,这模仿了大语言模型在单一目标下统一处理多种语言任务的方式。这个单一的损失函数直接应用于密集任务的潜在空间和稀疏任务的输出空间。
为了实现这种统一的优化而不牺牲性能,我们将特定任务定制的责任从损失函数设计转移到了数据表示设计上。以单目深度估计为主要示例——在该任务中,尺度模糊性通常需要定制化的尺度不变损失函数——我们直接在数据层面解决了这一约束。具体来说,我们使用场景的中值深度对每个视频的深度图进行归一化,从而从根本上消除了尺度模糊性。为了进一步将归一化后的深度对齐到标准 RGB 范围,类似于 [gabeur2026image],我们应用了一个非线性映射函数:,其中 可以动态调整模型对近场细节和远场结构的关注度。这种数据层面的定制有效消除了对任何特定任务目标函数的需求,不同任务之间的平衡只需通过数据混合比例来管理,这与大语言模型中普遍采用的做法类似。我们相信,这种以数据为中心的协调原则可以自然地扩展到更广泛的视觉任务范围,从而确保一个精简且稳健的多任务训练范式。
4 实验
我们在多个具有挑战性的真实世界数据集上全面评估了我们的模型,涵盖的视觉任务包括:深度估计、法线估计、分割、3D 关键点预测和相机姿态估计。
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
4.1 实现细节
我们的方法基于开源且权重开放的文字转视频扩散模型 WAN 2.1 [wan2025] 实现。遵循其原始架构,我们在分辨率为 480x832、包含 81 帧(以每秒 24 帧捕获)的视频样本上训练模型。模型的编码器以时间维度 4 倍、空间维度(宽和高)8 倍的因子对输入维度进行下采样。我们使用 64 的批量大小在 256 块 v6e TPU 上训练模型。我们采用 Adam 优化器 [kingma2014adam] 优化模型,学习率为 ,训练步数为 15000 步,并在前 250 个训练步中实施线性预热。关键在于,为了训练稳定性,我们同时应用了梯度裁剪(将梯度范数限制在特定阈值内)和梯度丢弃(丢弃梯度范数超过更高阈值的批次)。这些技术被证明对稳定训练和获得高质量性能至关重要。为了增强训练数据的多样性,我们用少量公开可用的合成数据集来增强我们提出的合成数据。具体来说,我们整合了 TartanAir [wang2020tartanair]、Virtual KITTI [gaidon2016virtual] 和 MVS Synth [huang2018deepmvs] 以提供额外的深度标注,同时利用 TartanAir [wang2020tartanair] 提供的相机轨迹数据。对于指代分割任务,我们利用现成的真实世界数据集,整合了 MeViS [ding2023mevis]、Ref-COCO [yu2016modeling] 和 YouTube-VOS [xu2018youtube]。
4.2 推理成本
我们的前馈模型消除了标准 WAN 缓慢的 50 步扩散过程。在单块 v6e TPU(81 帧,480x832)上,1.3B 模型耗时 5.92 秒(13.6 FPS,DiT 部分 0.96 秒),占用 15.3GB 显存;而 14B 模型耗时 10.03 秒(8.0 FPS,DiT 部分 5.11 秒),占用 42.8GB 显存。两者共享一个 10GB 的文本编码器和 0.25GB 的 VAE,这些可以卸载到系统内存中,以速度换取显存。
4.3 评估协议
评估数据集。我们在涵盖视频和图像数据的一系列具有挑战性的基准上评估了我们的方法。对于表面法线估计,我们在 Hi4D 数据集 [yin2023hi4d] 和 SINTEL 数据集 [butler2012naturalistic] 上进行评估。对于 Hi4D,我们遵循 Sapiens [sapienseccv2024] 和 DAVID [saleh2025david] 中建立的评估协议,从第 28、32 和 37 对中选择相同的序列。这些序列包含由摄像头 4 捕捉的六个不同主体,总共产生 1,195 帧用于测试。对于深度估计,我们在 KITTI [geiger2013vision]、SINTEL [butler2012naturalistic]、ETH3D [schops2017multi] 和 Goliath [martinez2024codec] 数据集上进行评估。对于 Goliath [martinez2024codec],我们遵循 DAVID [saleh2025david] 进行评估以确保公平比较,其中我们使用了与 DAVID [saleh2025david] 中相同的 12 个摄像头、16 帧和 4 个主体的选择,这些数据被分为面部、上半身和全身数据子集,总计约 2.2k 帧。对于软前景分割,我们在 VideoMatte [lin2021real]、PhotoMatte 85 [lin2021real] 和 PPM-100 [ke2022modnet] 上报告结果。原始的 VideoMatte 数据集没有提供官方划分,因此我们在 [lin2022robust] 中组合的静态划分上进行评估。对于相机姿态估计,我们在 SINTEL 数据集 [butler2012naturalistic] 上进行评估。对于 3D 关键点估计,我们在 EMDB 数据集 [kaufmann2023emdb] 上进行评估。对于表情指代开放世界分割,我们遵循 VoCap [uijlings2025vocap] 在 RefVOS-DAVIS [khoreva2018video] 和 MeViS [ding2023mevis] 上报告结果。
| 任务 | 法线 | 深度 | 相机位姿 | 前景分割 | 表达式指代分割 | 3D人体 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 基准 | Sintel [butler2012naturalistic] | Hi4D [yin2023hi4d] | Sintel [butler2012naturalistic] | KITTI [geiger2013vision] | ETH3D [schops2017multi] | Goliath [martinez2024codec] | Sintel [butler2012naturalistic] | V.Mat. [lin2021real] | P.Mat. [lin2021real] | Ref-DAVIS [khoreva2018video] | MEVIS [ding2023mevis] | EMDB [kaufmann2023emdb] | |||
| 方法 | 骨干网络 | mAE | AbsRel | ATE | RPE-T | RPE-R | MSE | J&F | MPJPE | ||||||
| David-Large [saleh2025david] | ViT-L 0.34B | - | 15.37 | - | - | - | - | - | - | - | - | - | - | - | - |
| Sapiens [sapienseccv2024] | ViT-L 2B | - | 12.14 | - | - | - | - | - | - | - | - | - | - | - | - |
| Marigold-E2E-FT [garcia2025fine] | SD V2 0.86B | 33.5 | - | - | - | - | - | - | - | - | - | - | - | - | |
| NormalCrafter [bin2025normalcrafter] | SVD 1.5B | 30.7 | - | - | - | - | - | - | - | - | - | - | - | - | |
| Lotus-2 [he2025lotus] | FLUX 12B | 30.3 | - | - | - | - | - | - | - | - | - | - | - | - | |
| David-Large [saleh2025david] | ViT-L 0.34B | - | - | - | - | - | 0.012 | - | - | - | - | - | - | - | - |
| Sapiens [sapienseccv2024] | MAE 2B | - | - | - | - | - | 0.033 | - | - | - | - | - | - | - | - |
| MapAnything [keetha2025mapanything] | DinoV2 1.1B | - | - | 0.306 | 0.096 | 0.202 | 0.089 | 2.383 | - | - | - | - | - | ||
| VGGT [wang2025vggt] | DinoV2 1.1B | - | - | 0.247 | 0.067 | 0.168 | 0.056 | 0.428 | - | - | - | - | - | ||
| DepthAnything 3 [lin2025depth] | DinoV2 1.15B | - | - | 0.201 | 0.059 | 0.028 | 0.065 | 0.048 | 0.456 | - | - | - | - | - | |
| D4RT [zhang2025efficiently] | VideoMAE2 1B | - | - | 0.148 | 0.051 | 0.065 | 0.024 | 0.126 | - | - | - | - | - | ||
| VGGT- [wang2026vggt] | DinoV3 1B | - | - | 0.145 | 0.041 | 0.016 | 0.057 | 0.059 | 0.407 | - | - | - | - | - | |
| MODNet [ke2022modnet] | MNetV2 | - | - | - | - | - | - | - | - | - | 0.0054 | 0.0304 | - | - | - |
| RVM [lin2022robust] | MNetV3 | - | - | - | - | - | - | - | - | - | 0.0010 | - | - | - | |
| David-Large [saleh2025david] | ViT-L 0.34B | - | - | - | - | - | - | - | - | 0.0009 | - | - | - | ||
| ReferFormer [wu2022language] | Swin-L 0.19B | - | - | - | - | - | - | - | - | - | 61.1 | 31.0 | - | ||
| VISA [yan2024visa] | Chat-Univi 13B | - | - | - | - | - | - | - | - | - | - | - | 70.4 | 44.5 | - |
| Vocap [uijlings2025vocap] | SAM2 0.4B | - | - | - | - | - | - | - | - | - | - | 75.1 | 51.9 | - | |
| ReferEverything [bagchi2025refereverything] | WAN 2.1 14B | - | - | - | - | - | - | - | - | - | 75.0 | 60.3 | - | ||
| SAM 3 [carion2025sam] | PE 0.8B | - | - | - | - | - | - | - | - | - | - | 41.3 | 38.3 | - | |
| SAM 3 + Gemini 3.5 Flash [carion2025sam] | PE 0.8B | - | - | - | - | - | - | - | - | - | - | 64.5 | 57.5 | - | |
| GVHMR [shen2024gvhmr] | ViT | - | - | - | - | - | - | - | - | - | - | - | - | - | 72.6 |
| TRAM [wang2024tram] | ViT-H | - | - | - | - | - | - | - | - | - | - | - | - | - | 74.4 |
| Genmo [genmo2025] | ViT-H | - | - | - | - | - | - | - | - | - | - | - | - | - | 73.0 |
| Diception - 通用型 [zhao2025diception] | SD3 2B | 37.9 | 20.4 | 0.500 | 0.145 | 0.177 | - | - | - | - | - | - | - | - | |
| 我们的 - 专用型 - S | WAN 2.1 1.3B | 32.7 | 0.167 | 0.060 | 0.056 | 0.057 | 0.023 | 0.720 | 69.7 | 59.9 | |||||
| 我们的 - 专用型 - L | WAN 2.1 14B | 29.7 | 10.99 | 0.130 | 0.048 | 0.037 | 0.008 | 0.050 | 0.018 | 0.464 | 0.0027 | 0.0009 | 76.4 | 70.0 | 71.8 |
| 我们的 - 通用型 - L | WAN 2.1 14B | 29.3 | 11.47 | 0.156 | 0.048 | 0.044 | 0.011 | 0.062 | 0.018 | 0.485 | 0.0010 | 0.0008 | 75.8 | 69.0 | |
| 方法 | 模型尺寸 | 训练数量 | Sintel | KITTI | ETH3D | 平均 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 数据集 | 视频 | 帧 | AbsRel | AbsRel | AbsRel | AbsRel | ||||||
| 我们的 - V-JEPA - H | 0.6B | 1 | 7.5K | 0.9M | 0.422 | 37.3 | 0.226 | 47.5 | 0.196 | 71.8 | 0.281 | 52.2 |
| 我们的 - VideoMae V2 - H | 0.6B | 1 | 7.5K | 0.9M | 0.275 | 37.4 | 0.124 | 64.6 | 0.126 | 84.1 | 0.175 | 62.0 |
| 我们的 - VideoMae V2 - G | 1B | 1 | 7.5K | 0.9M | 0.260 | 41.4 | 0.105 | 70.2 | 0.099 | 89.3 | 0.154 | 66.9 |
| 我们的 - WAN 2.1 - S | 1.3B | 1 | 7.5K | 0.9M | 0.201 | 72.7 | 0.099 | 89.2 | 0.068 | 95.6 | 0.122 | 85.8 |
| 我们的 - WAN 2.1 - L | 14B | 1 | 7.5K | 0.9M | 0.181 | 76.8 | 0.060 | 97.1 | 0.039 | 98.2 | 0.093 | 90.7 |
| DepthAnything V3 - G [lin2025depth] | 1.15B | 22+ | 1.23M | 200M | 0.201 | 72.1 | 0.059 | 96.6 | 0.028 | 98.8 | 0.096 | 89.1 |
| D4RT [zhang2025efficiently] | 1B | 11+ | 1M | 86M | 0.148 | 80.3 | 0.055 | 97.9 | 0.045 | 97.0 | 0.082 | 91.7 |
| VGGT - [wang2026vggt] | 1B | 33+ | 3M | 600M | 0.145 | 87.6 | 0.041 | 98.5 | 0.016 | 99.6 | 0.067 | 95.2 |
| 我们的 - WAN 2.1 - S | 1.3B | 4 | 8.08K | 1.23M | 0.167 | 76.9 | 0.060 | 97.3 | 0.056 | 97.6 | 0.094 | 90.6 |
| 我们的 - WAN 2.1 - L | 14B | 4 | 8.08K | 1.23M | 0.130 | 84.5 | 0.048 | 98.3 | 0.037 | 98.8 | 0.071 | 93.8 |
评估指标。为评估我们模型的性能,我们针对每项任务报告了相应的标准指标。对于表面法线估计,我们报告了常用指标 [saleh2025david, sapienseccv2024],包括平均角度误差和中位角度误差,以及误差在阈值内的像素百分比。对于深度估计,我们遵循标准做法 [sapienseccv2024, ranftl2020towards, yang2024depth],采用相对深度平均绝对值(AbsRel)和均方根误差(RMSE)。对于软前景分割,我们按照先前工作 [saleh2025david, yang2025matanyone, lin2022robust, lin2021real] 报告均方误差(MSE)。对于基于表述的开放世界分割,我们报告所有文本查询上平均的 J&F 分数 [perazzi2016benchmark](IoU 和轮廓精度的平均值)。对于 3D 关键点估计,我们遵循 [genmo2025, wang2024tram] 报告平均每关节位置误差(MPJPE)。对于相机位姿估计,我们报告平均平移误差(ATE)、相对位姿误差 - 平移(RPE-T)和相对位姿误差 - 旋转(RPE-R)。
4.4 与当前最优方法的比较
我们将自己的方法与多个具有挑战性的基准测试上的最新模型进行了比较。请注意,我们的模型在训练时未使用任何评估基准附带的训练集。此外,我们的训练完全依赖合成数据,唯一的例外是表达指代分割任务,该任务使用了真实世界数据。如表 1 所示,尽管架构统一且简单,我们的方法在性能上超越了或与那些经过大量定制、针对特定任务的最新方法相比极具竞争力。在几何理解方面,我们的方法在表面法线估计上超过了 NormalCrafter [bin2025normalcrafter] 和 Lotus-2 [he2025lotus] 等专业模型,并在深度估计和相机位姿估计上优于或持平于 DepthAnything 3 [lin2025depth]、D4RT [zhang2025efficiently] 和 VGGT [wang2026vggt] 等专用基础模型。在前景分割方面,我们的方法在视频和图像数据集上的软前景分割中均取得了有竞争力的结果。在表达指代分割任务上,与 SegmentAnything3 [carion2025sam] 相比,我们的工作在理解复杂句子方面展现出更强的能力。最后,在稀疏任务上,与包括 Genmo [genmo2025] 和 TRAM [wang2024tram] 在内的专业模型相比,我们的方法也实现了更强的 3D 关键点预测性能。定性示例见图 6、图 7 和图 8。
4.5 消融实验
联合训练 vs. 任务特定训练:如表 1 所示,从专家模型转变为统一通用模型,在不同任务和基准测试上表现出混合的行为。对于密集预测模态,表面法线估计在基准测试上显示出不同的趋势,而深度和相机位姿估计通常会出现性能下降或保持不变(例如,在 KITTI 上)。相比之下,前景分割任务始终受益于联合训练,而表达指代分割则基本保持不变。
最值得注意的是,我们通过实验观察到,联合训练会严重降低 3D 人体关键点估计的性能,并损害其他密集任务。我们推测这源于两个架构因素。首先,基于显式 token 的坐标回归与生成式视频模型的连续像素空间预训练存在差异。其次,从零开始训练的额外可学习 token 会干扰预训练 DiT 层的原生注意力机制,破坏其优化后的特征,并需要更多数据才能收敛。这一现象为后训练提供了一个有价值的见解:应尽量对预训练主干网络进行最小的架构修改,或者从根本上重新设计预训练范式,使其原生地兼容高度多样化的下游任务。
预训练的重要性。我们将视频生成预训练主干网络与其他表征学习方法进行了比较。我们使用了 V-JEPA 和 VideoMae V2 的最大可用变体,并在相同的训练集上对所有模型进行微调。如表 2 所示,我们的基于扩散模型的预训练(WAN 2.1)显著优于其他预训练方法。这提供了一个有启发性的实验证据,表明生成式扩散目标本身——而不仅仅是数据集或模型规模——对于提取优越的时空先验至关重要。此外,VideoMae 和 V-JEPA 原生不支持统一的多任务模型,通常需要针对特定任务进行训练,而我们的模型可以原生地使用文本提示词在不同任务间切换。此外,如图 9 所示,从零开始训练随机初始化的 DiT 会得到近乎平坦的学习曲线。随着使用更多预训练层,性能得到提升。这证实了预训练对于下游任务的收敛和性能至关重要。
初步的缩放特性与卓越的数据效率。如图2和表2所示,该生成式主干网络在不同模型规模和数据集上展现出有前景的初步缩放特性,性能通常随模型规模和数据量的增加而提升。该模型还表现出卓越的数据效率,仅用D4RT和VGGT等领先模型7到500分之一的训练数据,即可达到与之相当的性能。
4.6 涌现行为
除了达到或超越最先进方法的竞争性性能外,我们的模型还展现出超越其预期训练目标的有趣涌现行为。我们认为这些行为源于大规模文生视频模型中学到的丰富表征,揭示了该范式在未来探索中的更广泛潜力。
从合成训练数据泛化:我们的方法完全在合成视频上训练,却能出色地泛化到真实世界视频。定量来看,如表1和表2所示,我们的模型在所有基准测试上均树立了新的最先进性能。定性来看,我们观察到模型输出中的精细细节质量,超越了使用Blender中传统计算机图形学方法生成的训练数据,如图3、图6、图7和图8所示。例如,图10(b)(第一列)中猫的胡须,或图3(第二行)中头发的软分割。
泛化到多个实例:在每段视频仅含单个物体的合成数据上训练后,我们的方法零样本泛化到包含多个物体的真实视频,如图10(a)所示。
对 OOD 类别的泛化能力:我们的方法仅使用人类实体的合成视频进行训练,却能很好地泛化到真实世界视频——既包括人类视频,也包括动物和拟人化角色等其他类别的视频——如图 10(b) 所示。
5 结论
我们提出了 GenCeption,这是一个统一的框架,将大规模视频生成视为视觉感知的基础预训练范式。通过将预训练的视频扩散主干网络改造为高效的前馈模型,我们证明了大规模合成所需的丰富时空先验和视觉语言对齐可以直接转化为精确的感知能力,而无需昂贵的迭代采样。我们在多种视觉任务上的实验证实,GenCeption 不仅能够匹敌专门化最先进模型的性能,还展现出显著的涌现行为,为生成式视频主干网络中存在通用“世界模型”提供了有力证据。我们相信,这种从任务特定工程到可扩展生成式预训练的范式转变,为物理世界真正统一且通用的视觉智能开辟了一条有前景的道路。
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000020.jpg&exp=1784764800&sig=ddb686a528bcb2dc2318bde2f29478c1eb9194512db3187603fd218f86aecba5)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000030.jpg&exp=1784764800&sig=c533241c1460344b8d4d2d8519d694c1cf6815c02c6a1a3cadf1f6ac26e94a57)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000040.jpg&exp=1784764800&sig=ce359afa3f23a303554dd993830b0f2b48d007ed025ec1fb2f9df04aa6dc5234)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000050.jpg&exp=1784764800&sig=e69e68aab7388a09ca56ecfb9f15ff4b9abcec60251e9709be0187a12f239f68)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000060.jpg&exp=1784764800&sig=8920d251377615ef9a721bf5db8b945068c280d753bca31cb945371929573159)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F1%2F00000070.jpg&exp=1784764800&sig=36b1f324f25525a4faf12160ebf04efb536af8bd9c0c53a31912a739b7ba6564)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000041.jpg&exp=1784764800&sig=a7540ae67c26b4c5c49c221bb2ba63c2bb97c19a2da412f48704f7d67c249440)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000046.jpg&exp=1784764800&sig=f8872cef371c51776f5b69967133b76125e9c773d98a687536965dba00fdedee)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000051.jpg&exp=1784764800&sig=a8d770774715a4a520a006634be41eb2dc69e3678a79bdb60adb25c5a94a0700)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000056.jpg&exp=1784764800&sig=b09c20c04046d76da0981da4680acee332f48b740f6e34d434e6a7ac405ecef5)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000061.jpg&exp=1784764800&sig=ee1ebf9e32c5a03849778a320e3d5cb33d333804a7a035c65cc329a1935da1aa)
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2607.09024v1%2Ffigure%2Fski_snowboard%2F2%2F00000066.jpg&exp=1784764800&sig=35761d84223acc2ca534741e2da54fd9c61ab0e5b9eebacc9d4edd201ca5109a)