Seedance 2.0:推进面向复杂世界的视频生成

HuggingFace Daily Papers(社区热门论文)·2026-04-15 08:00·135天前
AI 导读

Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

HuggingFace Daily Papers(社区热门论文)
精选
71AI 编辑部评分,满分 100

Seedance 2.0:推进面向复杂世界的视频生成

2026-04-15 08:00· 135天前
AI 导读

Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

推荐理由

Seedance 2.0 把音视频联合生成真正推到了可用级别,支持多片段、多图片、多音频参考输入,对做视频的创作者是直接的生产力提升。

正文 · AI 翻译

Seedance 2.0 是一款全新的原生多模态音视频生成模型,于 2026 年 2 月初在中国正式发布。与之前的 Seedance 1.0 和 1.5 Pro 版本相比,Seedance 2.0 采用了统一、高效且大规模的多模态音视频联合生成架构。这使得它能够支持文本、图像、音频和视频四种输入模态,集成了业界迄今为止最全面的多模态内容参考与编辑功能套件之一。该模型在视频和音频生成的所有关键子维度上都实现了显著且全面的提升。在专家评估和公开用户测试中,该模型的表现已达到该领域的领先水平。Seedance 2.0 支持直接生成时长在 4 到 15 秒之间的音视频内容,原生输出分辨率为 480p 和 720p。对于作为参考的多模态输入,其当前开放平台最多支持 3 个视频片段、9 张图像和 3 个音频片段。此外,我们还提供了 Seedance 2.0 Fast 版本,这是 Seedance 2.0 的加速变体,旨在提升低延迟场景下的生成速度。Seedance 2.0 在其基础生成能力和多模态生成性能方面均实现了显著改进,为终端用户带来了增强的创作体验。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org