# 谷歌 DeepMind 发布 GenCeption：基于阿里 Wan2.1，打破计算机视觉桎梏

- 来源：IT之家（RSS）
- 发布时间：2026-07-21 15:00
- AIHOT 分数：46
- AIHOT 链接：https://aihot.virxact.com/items/cmrucrpte0wlxbi7f05292z6v
- 原文链接：https://www.ithome.com/0/979/535.htm

## AI 摘要

谷歌 DeepMind 发布 GenCeption 模型，将预训练视频生成器逆向改造成单一模型，可同时完成深度估计、图像分割等核心视觉任务。该模型基于阿里 Wan2.1 训练，一次前向传播即可输出结果，小模型处理 81 帧视频约需 6 秒。

## 正文

IT之家 7 月 21 日消息，科技媒体 The Decoder 昨日（7 月 20 日）发布博文，报道称谷歌 DeepMind 发布 GenCeption 模型，将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。

IT之家援引博文介绍，大语言模型在学习预测下一个 Token 的时候，在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。

但是在计算机视觉领域，视觉模型缺少等效的训练方法，主要由专业模型主导，包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”，每个模型都使用其特定的架构。

谷歌 DeepMind 团队为此提出 GenCeption 模型方案，尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。

GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局，仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。

GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练，与传统扩散模型需多步去噪不同，GenCeption 在一次前向传播中完成预测，从而提升视觉任务处理速度。模型通过文本提示指定任务，可输出深度图、表面法线图、分割掩码，并可处理相机运动表示。

训练数据以合成为主。论文称，数据集仅包含 7500 段视频，由 800 个数字人体模型与 200 段动作捕捉序列组合生成，再通过 Blender 在不同背景和镜头角度下渲染。

泛化方面，GenCeption 几乎只在单人合成视频上训练，但可处理真实多人视频，也可迁移到动物和类人机器人类别。论文称，部分输出细节甚至超过训练时 Blender 渲染结果，可保留猫胡须和单根发丝边缘。

性能方面，论文给出两组处理时间数据：小模型处理 81 帧视频约需 6 秒；大模型参数量为 140 亿，处理同样长度视频约需 10 秒。

Video Generation Models are General-Purpose Vision Learners
