# STARFlow-V：基于标准化流的端到端视频生成建模

- 来源：Apple Machine Learning Research（RSS）
- 发布时间：2026-04-30 08:00
- AIHOT 分数：63
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmor004mg009qslix0l0qi16f
- 原文链接：https://machinelearning.apple.com/research/starflow-v-video-modeling

## 精选理由

扩散模型几乎垄断视频生成，Apple 这篇用正规化流做视频却是清奇思路，端到端学习和因果预测的优势值得研究员细看。

## AI 摘要

研究团队提出了基于标准化流的视频生成模型STARFlow-V，旨在应对视频生成领域长期由扩散模型主导的局面。该模型具备端到端学习、鲁棒的因果预测和原生似然估计等优势，能够直接处理连续数据并建模复杂的时空动态。这一工作标志着标准化流在图像生成取得进展后，首次被系统性地扩展至计算成本更高、时空结构更复杂的视频生成任务中，为生成式模型的设计提供了新的技术路径。

## 正文

作者：季嘉拓†、沈颖‡**、陈天荣、Laurent Dinh、王宇阳、Miguel Ángel Bautista、David Berthelot、Josh Susskind、翟双飞

归一化流（NFs）是一种基于似然函数的端到端连续数据生成模型，近期在图像生成领域取得了令人鼓舞的进展，重新获得了关注。然而，在时空复杂度与计算成本显著更高的视频生成领域，现有最先进的系统几乎完全依赖基于扩散的模型。在这项工作中，我们重新审视了这一设计空间，提出了STARFlow-V——一种基于归一化流的视频生成器，具有端到端学习、稳健的因果预测以及原生似然估计等显著优势。STARFlow-V建立在近期提出的STARFlow基础之上，在时空潜在空间中运行，采用全局-局部架构，将因果依赖关系限制在全局潜在空间内，同时保留丰富的局部帧内交互。这减轻了随时间累积的误差，而误差累积正是标准自回归扩散模型生成的常见缺陷。此外，我们提出了流分数匹配，为模型配备了一个轻量级的因果去噪器，以自回归方式提升视频生成的一致性。为提高采样效率，STARFlow-V采用了一种视频感知的雅可比迭代方案，将内部更新重构为可并行化的迭代，同时不破坏因果性。得益于其可逆结构，同一模型能够原生支持文生视频、图生视频以及视频生视频等生成任务。实验结果表明，与基于扩散的基线模型相比，STARFlow-V在视觉保真度和时间一致性方面表现出色，并具有实用的采样吞吐量。据我们所知，这些结果首次证明了NFs能够实现高质量的自回归视频生成，为构建世界模型开辟了一个有前景的研究方向。

† 宾夕法尼亚大学

‡ 伊利诺伊大学厄巴纳-香槟分校

** 工作完成于苹果公司任职期间

视频 · 前往原文观看

相关阅读与更新。

STIV：可扩展的文本与图像条件视频生成

视频生成领域已取得显著进展，但业界仍迫切需要一套清晰、系统化的方法论，用以指导开发稳健且可扩展的模型。在本研究中，我们提出了一项综合性研究，系统探索了模型架构、训练策略与数据整理策略之间的相互作用，最终形成了一种简单且可扩展的文本-图像条件视频生成方法，命名为 STIV……

STARFlow：面向高分辨率图像合成的可扩展潜变量归一化流

我们提出了 STARFlow，一种基于归一化流的可扩展生成模型，在高分辨率图像合成任务中展现出强劲性能。STARFlow 的核心是 Transformer 自回归流（TARFlow），它融合了归一化流的表达能力与自回归 Transformer 的结构化建模能力。我们首先从理论上证明了 TARFlow 在建模连续分布方面的普适性。在此基础上……

探索机器学习领域的机遇。
