Apple Machine Learning Research(RSS)
精选
63AI 编辑部评分,满分 100

STARFlow-V:基于标准化流的端到端视频生成建模

2026-04-30 08:00· 97天前
AI 导读

研究团队提出了基于标准化流的视频生成模型STARFlow-V,旨在应对视频生成领域长期由扩散模型主导的局面。该模型具备端到端学习、鲁棒的因果预测和原生似然估计等优势,能够直接处理连续数据并建模复杂的时空动态。这一工作标志着标准化流在图像生成取得进展后,首次被系统性地扩展至计算成本更高、时空结构更复杂的视频生成任务中,为生成式模型的设计提供了新的技术路径。

推荐理由

扩散模型几乎垄断视频生成,Apple 这篇用正规化流做视频却是清奇思路,端到端学习和因果预测的优势值得研究员细看。

正文 · AI 翻译

作者:季嘉拓†、沈颖‡**、陈天荣、Laurent Dinh、王宇阳、Miguel Ángel Bautista、David Berthelot、Josh Susskind、翟双飞

归一化流(NFs)是一种基于似然函数的端到端连续数据生成模型,近期在图像生成领域取得了令人鼓舞的进展,重新获得了关注。然而,在时空复杂度与计算成本显著更高的视频生成领域,现有最先进的系统几乎完全依赖基于扩散的模型。在这项工作中,我们重新审视了这一设计空间,提出了STARFlow-V——一种基于归一化流的视频生成器,具有端到端学习、稳健的因果预测以及原生似然估计等显著优势。STARFlow-V建立在近期提出的STARFlow基础之上,在时空潜在空间中运行,采用全局-局部架构,将因果依赖关系限制在全局潜在空间内,同时保留丰富的局部帧内交互。这减轻了随时间累积的误差,而误差累积正是标准自回归扩散模型生成的常见缺陷。此外,我们提出了流分数匹配,为模型配备了一个轻量级的因果去噪器,以自回归方式提升视频生成的一致性。为提高采样效率,STARFlow-V采用了一种视频感知的雅可比迭代方案,将内部更新重构为可并行化的迭代,同时不破坏因果性。得益于其可逆结构,同一模型能够原生支持文生视频、图生视频以及视频生视频等生成任务。实验结果表明,与基于扩散的基线模型相比,STARFlow-V在视觉保真度和时间一致性方面表现出色,并具有实用的采样吞吐量。据我们所知,这些结果首次证明了NFs能够实现高质量的自回归视频生成,为构建世界模型开辟了一个有前景的研究方向。

  • † 宾夕法尼亚大学
  • ‡ 伊利诺伊大学厄巴纳-香槟分校
  • ** 工作完成于苹果公司任职期间
视频 · 前往原文观看

相关阅读与更新。

STIV:可扩展的文本与图像条件视频生成

视频生成领域已取得显著进展,但业界仍迫切需要一套清晰、系统化的方法论,用以指导开发稳健且可扩展的模型。在本研究中,我们提出了一项综合性研究,系统探索了模型架构、训练策略与数据整理策略之间的相互作用,最终形成了一种简单且可扩展的文本-图像条件视频生成方法,命名为 STIV……

STARFlow:面向高分辨率图像合成的可扩展潜变量归一化流

我们提出了 STARFlow,一种基于归一化流的可扩展生成模型,在高分辨率图像合成任务中展现出强劲性能。STARFlow 的核心是 Transformer 自回归流(TARFlow),它融合了归一化流的表达能力与自回归 Transformer 的结构化建模能力。我们首先从理论上证明了 TARFlow 在建模连续分布方面的普适性。在此基础上……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

STARFlow-V:基于标准化流的端到端视频生成建模

Apple Machine Learning Research(RSS)·2026-04-30 08:00·97天前
AI 导读

研究团队提出了基于标准化流的视频生成模型STARFlow-V,旨在应对视频生成领域长期由扩散模型主导的局面。该模型具备端到端学习、鲁棒的因果预测和原生似然估计等优势,能够直接处理连续数据并建模复杂的时空动态。这一工作标志着标准化流在图像生成取得进展后,首次被系统性地扩展至计算成本更高、时空结构更复杂的视频生成任务中,为生成式模型的设计提供了新的技术路径。

正文 · AI 翻译

作者:季嘉拓†、沈颖‡**、陈天荣、Laurent Dinh、王宇阳、Miguel Ángel Bautista、David Berthelot、Josh Susskind、翟双飞

归一化流(NFs)是一种基于似然函数的端到端连续数据生成模型,近期在图像生成领域取得了令人鼓舞的进展,重新获得了关注。然而,在时空复杂度与计算成本显著更高的视频生成领域,现有最先进的系统几乎完全依赖基于扩散的模型。在这项工作中,我们重新审视了这一设计空间,提出了STARFlow-V——一种基于归一化流的视频生成器,具有端到端学习、稳健的因果预测以及原生似然估计等显著优势。STARFlow-V建立在近期提出的STARFlow基础之上,在时空潜在空间中运行,采用全局-局部架构,将因果依赖关系限制在全局潜在空间内,同时保留丰富的局部帧内交互。这减轻了随时间累积的误差,而误差累积正是标准自回归扩散模型生成的常见缺陷。此外,我们提出了流分数匹配,为模型配备了一个轻量级的因果去噪器,以自回归方式提升视频生成的一致性。为提高采样效率,STARFlow-V采用了一种视频感知的雅可比迭代方案,将内部更新重构为可并行化的迭代,同时不破坏因果性。得益于其可逆结构,同一模型能够原生支持文生视频、图生视频以及视频生视频等生成任务。实验结果表明,与基于扩散的基线模型相比,STARFlow-V在视觉保真度和时间一致性方面表现出色,并具有实用的采样吞吐量。据我们所知,这些结果首次证明了NFs能够实现高质量的自回归视频生成,为构建世界模型开辟了一个有前景的研究方向。

  • † 宾夕法尼亚大学
  • ‡ 伊利诺伊大学厄巴纳-香槟分校
  • ** 工作完成于苹果公司任职期间
视频 · 前往原文观看

相关阅读与更新。

STIV:可扩展的文本与图像条件视频生成

视频生成领域已取得显著进展,但业界仍迫切需要一套清晰、系统化的方法论,用以指导开发稳健且可扩展的模型。在本研究中,我们提出了一项综合性研究,系统探索了模型架构、训练策略与数据整理策略之间的相互作用,最终形成了一种简单且可扩展的文本-图像条件视频生成方法,命名为 STIV……

STARFlow:面向高分辨率图像合成的可扩展潜变量归一化流

我们提出了 STARFlow,一种基于归一化流的可扩展生成模型,在高分辨率图像合成任务中展现出强劲性能。STARFlow 的核心是 Transformer 自回归流(TARFlow),它融合了归一化流的表达能力与自回归 Transformer 的结构化建模能力。我们首先从理论上证明了 TARFlow 在建模连续分布方面的普适性。在此基础上……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com