作者:季嘉拓†、沈颖‡**、陈天荣、Laurent Dinh、王宇阳、Miguel Ángel Bautista、David Berthelot、Josh Susskind、翟双飞
归一化流(NFs)是一种基于似然函数的端到端连续数据生成模型,近期在图像生成领域取得了令人鼓舞的进展,重新获得了关注。然而,在时空复杂度与计算成本显著更高的视频生成领域,现有最先进的系统几乎完全依赖基于扩散的模型。在这项工作中,我们重新审视了这一设计空间,提出了STARFlow-V——一种基于归一化流的视频生成器,具有端到端学习、稳健的因果预测以及原生似然估计等显著优势。STARFlow-V建立在近期提出的STARFlow基础之上,在时空潜在空间中运行,采用全局-局部架构,将因果依赖关系限制在全局潜在空间内,同时保留丰富的局部帧内交互。这减轻了随时间累积的误差,而误差累积正是标准自回归扩散模型生成的常见缺陷。此外,我们提出了流分数匹配,为模型配备了一个轻量级的因果去噪器,以自回归方式提升视频生成的一致性。为提高采样效率,STARFlow-V采用了一种视频感知的雅可比迭代方案,将内部更新重构为可并行化的迭代,同时不破坏因果性。得益于其可逆结构,同一模型能够原生支持文生视频、图生视频以及视频生视频等生成任务。实验结果表明,与基于扩散的基线模型相比,STARFlow-V在视觉保真度和时间一致性方面表现出色,并具有实用的采样吞吐量。据我们所知,这些结果首次证明了NFs能够实现高质量的自回归视频生成,为构建世界模型开辟了一个有前景的研究方向。
- † 宾夕法尼亚大学
- ‡ 伊利诺伊大学厄巴纳-香槟分校
- ** 工作完成于苹果公司任职期间
相关阅读与更新。
STIV:可扩展的文本与图像条件视频生成
视频生成领域已取得显著进展,但业界仍迫切需要一套清晰、系统化的方法论,用以指导开发稳健且可扩展的模型。在本研究中,我们提出了一项综合性研究,系统探索了模型架构、训练策略与数据整理策略之间的相互作用,最终形成了一种简单且可扩展的文本-图像条件视频生成方法,命名为 STIV……
STARFlow:面向高分辨率图像合成的可扩展潜变量归一化流
我们提出了 STARFlow,一种基于归一化流的可扩展生成模型,在高分辨率图像合成任务中展现出强劲性能。STARFlow 的核心是 Transformer 自回归流(TARFlow),它融合了归一化流的表达能力与自回归 Transformer 的结构化建模能力。我们首先从理论上证明了 TARFlow 在建模连续分布方面的普适性。在此基础上……