ABot-World-0:单张桌面级GPU实现无限交互式世界生成

HuggingFace Daily Papers(社区热门论文)·2026-07-21 23:26·47天前
AI 导读

ABot-World-0是一个动作条件视频世界模型,能在单张NVIDIA RTX 5090 GPU上以720P分辨率、最高16 FPS、1.2秒动作到首帧延迟和约19 GiB峰值显存预算运行无限交互式世界生成。该模型采用统一的帧同步键盘动作接口,通过LongForcing分布匹配阶段解决长程自回归漂移问题,并集成轻量级VAE解码器、低比特DiT推理和局部上下文KV缓存等系统级优化。

HuggingFace Daily Papers(社区热门论文)
精选
83AI 编辑部评分,满分 100

ABot-World-0:单张桌面级GPU实现无限交互式世界生成

2026-07-21 23:26· 47天前
AI 导读

ABot-World-0是一个动作条件视频世界模型,能在单张NVIDIA RTX 5090 GPU上以720P分辨率、最高16 FPS、1.2秒动作到首帧延迟和约19 GiB峰值显存预算运行无限交互式世界生成。该模型采用统一的帧同步键盘动作接口,通过LongForcing分布匹配阶段解决长程自回归漂移问题,并集成轻量级VAE解码器、低比特DiT推理和局部上下文KV缓存等系统级优化。

推荐理由

在单张 RTX 5090 上实现 720P 16FPS 交互世界滚动,从数据闭环、训练到部署全栈打通。LongForcing 对长程漂移的缓解思路对做仿真和具身智能的人参考价值很大。

正文 · AI 翻译
Refer to caption
图 1:ABot-World-0 将单块 NVIDIA RTX 5090 GPU 转化为实时交互式世界模拟器,可在约 19 GiB 的峰值显存预算内,实现 720P 分辨率、最高 16 FPS 的无限动作条件世界推演,动作到首帧延迟为 1.2 秒。

1 引言

人工智能正从生成静态内容迈向生成可进入、可控制、可持续演进的世界。目标不再是生成一系列视觉上合理的片段,而是一个持久的生成式环境:在这个环境中,动作会改变状态,由此产生的观测会指导后续动作,并且随着交互的持续,世界始终保持连贯一致。因此,世界模型 [33, 6, 19, 64, 16, 51, 25] 是迈向通用模拟器的一步:它们必须表征世界的当前状态,预测其在干预下如何演化,并为规划、学习、创造和具身智能提供基础。这是一个系统层面的挑战,而非单一的生成目标。视觉保真度仍然必要,但可控性、状态持久性、推演稳定性、延迟、吞吐量和内存占用必须联合优化。大规模视频生成的快速进展 [23, 57, 24, 4, 66, 36, 37, 53, 61] 提供了日益强大的视觉与动态先验,但要将这些先验转化为响应迅速、可访问的世界,必须解决闭环问题。

近期已有多个系统在推进这一议程的重要部分。Genie [6] 表明,通过推断的潜在动作,可以从互联网游戏画面中学习到可交互的环境;而 Genie 2 和 Genie 3 [52, 19] 则展示了能力日益增强的实时动态环境。GameNGen [64]、Oasis [16]、WHAM [31]、Runway GWM [55]、Cosmos [51] 和 Waymo World Model [29] 在游戏、开放世界、物理 AI 和自动驾驶的设计空间中探索了互补的方向。然而,仅靠扩展视频模型并不能解决交互式世界建模中相互耦合的四大瓶颈:获取具有可靠动作监督的广泛且时间连贯的数据;在相机导航和具身角色控制两方面同时表达用户意图;防止生成的历史在成为下一个输入时发生漂移;以及在实用硬件上以交互速度部署完整的生成与解码技术栈。一个系统可能在某一维度上表现强劲,但仍无法作为本地、持久的世界模拟器使用。

数据问题尤为根本。被动互联网视频提供了视觉多样性,但很少暴露同步的控制信号;游戏录像提供了精确的输入,但风格可能较为单一;仿真提供了几何结构和可控性,但需要精心设计轨迹。我们将这些来源视为互补而非可互换。我们的数据基础设施结合了 AAA 游戏数据、仿真引擎数据和真实世界互联网视频。WorldExplorer 是一个智能体驱动的采集系统,可生成同步的多模态游戏与仿真轨迹,并根据训练反馈重新分配采集工作量。随后,一套感知来源但统一处理的流水线会执行跨六个质量维度的 14 项确定性检查、基于 VLM 的语义评估、动作标注和结构化语言标注。这将数据集构建转变为世界模型开发中的闭环环节:数据分布并非仅采集一次,而是被主动塑造,以暴露模型仍然薄弱的运动、视角、环境和动作模式。

我们在此基础设施之上构建了 ABot-World-0,这是一个以动作条件驱动的视频世界模型,旨在端到端地解决控制—一致性—效率三者耦合的问题。该模型采用统一的、帧同步的键盘动作接口,而非独立的潜在动作接口;在数据构建阶段,源生控制信号与姿态推导出的伪动作被映射到同一动作空间中,推理时用户可直接使用。统一动作表示同时覆盖了观察者式的场景漫游与演员式的角色运动,而参考角色记忆则为长程第三人称推演提供持续的外观信息。这些设计选择使控制通道成为动力学模型本身的一部分,而非外部的后处理接口。

学习流程将视觉动力学质量与在线所需的因果约束分离开来。我们首先在多源动作视频语料上训练一个双向教师模型,其全序列生成能力为动作条件动力学提供了高质量的目标。随后,通过教师强制与 ODE 蒸馏,我们逐步将其转化为因果学生模型,在保留可部署信息模式的同时降低去噪预算。关键在于,局部蒸馏本身并不能解决闭环生成问题:学生的每一次预测都会改变后续预测的视觉上下文,导致短时程训练状态与长时程推理状态之间的失配不断累积。我们引入了 LongForcing,这是最后一个分布匹配阶段,用扩展时程的双向教师模型来监督学生的长程自回归推演。通过在学生自回归推演上扩展分布级监督,LongForcing 为长时程推演上下文提供了纠偏信号,而这类上下文是短时程目标仅能微弱覆盖的。

实时交互还需要超越少步采样的系统级协同设计。ABot-World-0 将其因果模型与轻量级 VAE 解码器、内存感知的模块调度、低比特 DiT 推理、高效低精度注意力机制以及有界局部上下文 KV 缓存相结合。在其优化的低比特运行区间内,所得到的 720P 流式处理流水线在单块 NVIDIA RTX 5090 上最高可达 16 FPS,动作到首帧延迟为 1.2 秒,同时峰值显存占用约 19 GiB。所报告的延迟覆盖了从接收用户动作到生成首个解码响应帧的完整生成与解码路径,而非单独报告采样速度。

我们的贡献有四个方面:

  • 我们提出 ABot-World-0,一个统一的动作条件视频世界模型,利用原始键盘输入同时支持场景漫游和角色控制,并通过参考角色记忆在第三人称交互中提供补充的外观线索。

  • 我们为交互式世界建模构建了多源数据基础设施,包括 WorldExplorer 的训练反馈驱动采集循环、同步多模态采集、多阶段质量控制以及统一的动作和文本标注。

  • 我们引入了一种渐进式双向到因果的训练流水线和 LongForcing,它将分布级教师监督扩展到长时间的学生自回归展开,以缓解累积的自回归漂移。

  • 我们展示了一套面向部署的流式处理技术栈,其优化的低比特运行区间在单块 RTX 5090 上以约 19 GiB 的峰值显存预算实现最高 16 FPS 的 720P 输出和 1.2 秒的动作到首帧延迟,并在 WorldRoamBench 上结合扩展的交互式展开评估了可控性、视觉质量、物理合理性和时间记忆。

综合来看,这些组件将交互式世界建模定位为一种全栈能力,而非单一的生成目标。ABot-World-0 是迈向本地视觉模拟器的一步,这类模拟器可以被持续探索、控制和改进,以服务于交互式创作、智能体学习和具身 AI 研究。

2 相关工作

2.1 双向视频生成

生成建模领域的最新进展大幅提升了视频合成的质量,扩散模型已成为主流范式 [23, 57, 4]。早期的视频扩散模型普遍采用基于 U-Net 的架构,而近期方法则越来越多地采用带有时空注意力机制的扩散 Transformer [46, 48, 37, 53, 47, 76]。通过在整个片段上建模空间与时间依赖关系,这些方法 [37, 61, 9] 在视觉质量和时间连贯性方面表现出色。这种全片段双向建模也非常适合插帧、补全和有界生成等需要同时考虑多个时间约束的任务。

然而,这种全片段建模通常依赖双向注意力机制实现,即每一帧都能同时访问过去和未来的上下文。虽然这有利于时间一致性,但该设计将整个序列中的帧耦合在一起,使得在低延迟或流式场景中难以逐帧增量生成和输出。这一局限性促使了近期因果或自回归视频扩散方法的出现,这些方法试图将双向视频扩散模型转换或蒸馏为顺序生成器,以牺牲部分全局上下文为代价换取更高效的在线生成能力。

2.2 自回归视频生成

为克服非因果模型的局限性,自回归(AR)视频生成方法 [69, 24, 18, 36, 73] 按顺序逐帧生成,每个新片段仅以先前生成的内容为条件。通过施加因果约束,这些方法实现了低延迟流式生成,并在配合有界上下文或缓存时,降低了长视频合成相关的内存开销。早期的自回归模型主要依赖基于离散 token 的 Transformer,而近期工作 [7, 30, 80, 26, 44] 已将因果结构集成到扩散和流匹配框架 [42, 23, 45] 中,以获得更优的视觉质量。

自回归(AR)生成具备因果结构,天然适合实际的长视频合成任务,因为它支持流式生成。这使得自回归生成成为可扩展视频生成中极具吸引力的范式。因此,在本工作中,我们聚焦于自回归范式,并着力解决提升长时程稳定性这一关键挑战。

2.3 长视频生成

自回归模型在超出训练时域范围后会出现漂移问题,表现为质量逐步退化、身份不一致、运动停滞,或在经过少量自回归滚动生成后坍缩为静态帧。

时间漂移与自回归滚动生成中的曝光偏差和误差累积密切相关。为缓解这一问题,Diffusion Forcing [7]、PA-VDM [71] 和 Rolling Forcing [44] 等方法在训练期间采用异构噪声调度 [8, 60, 35],而 FIFO-Diffusion [32] 等免训练方法则通过滑动潜变量窗口扩展预训练模型,但若缺乏显式的滚动对齐,最终仍会出现质量退化。此外,Self-Forcing 及其变体(如 LongLive [75]、Self-Forcing++ [14])利用因果注意力、KV 缓存复用和知识蒸馏,在模型自身的滚动生成分布下进行监督训练,以支持长视频生成。后续工作进一步解决了细粒度的不匹配问题:Causal Forcing [87] 处理双向教师模型与因果学生模型之间的架构差异,Context Forcing [11] 利用具有慢-快记忆的长上下文教师模型,HiAR [88] 在匹配的噪声水平下执行分层去噪,Diagonal Distillation [43] 则联合优化时间分块与去噪步数。在本工作中,我们采用渐进式双向到因果的流水线:在长动作条件序列上训练的教师模型提供高质量的动态监督,而 LongForcing 将该监督扩展到学生模型的长程自滚动生成中,以减少累积漂移。

即便采用了与 rollout 对齐的目标函数,由于对完整历史进行密集注意力计算不可行,长程漂移问题依然存在。虽然简单截断滑动窗口或 KV cache 往往会导致身份丢失和运动停滞,但近期以记忆为中心的方法通过 RoPE 稳定化、深层注意力汇聚点、结构化 KV 记忆 [15, 77, 85, 34] 提升了稳定性。LongLive-2.0 [12] 进一步利用多镜头注意力汇聚点在提示词切换时保持身份一致性,而免训练扩展方法(如 FLEX [39]、PackForcing [50])则通过位置校正或缓存分区来缓解漂移。因此,长视频生成已从单纯的扩散模型因果化演变为一个涵盖 rollout 对齐、记忆设计、位置外推、知识蒸馏和高效部署的综合性挑战。

2.4 交互式视频生成

交互式视频生成以用户动作为条件来生成视频动态,为交互式世界、类游戏模拟器和具身 AI 基准测试提供了基础 [52, 17, 22, 25]。一种常见方法使用专用网络对 6-DoF 相机外参进行编码 [68, 3, 27],另一种方法则注入与潜在 token 对齐的密集 Plücker 光线图或视锥体特征 [65, 21, 82, 86]。这些方法通常使用全局或初始帧坐标系中的标定轨迹来表示相机运动。在长程 rollout 过程中,累积的位姿可能超出训练分布范围,而周期性重新锚定则可能在不同时间片段之间引入不一致性。相机感知的位置编码方法 [40, 38, 67] 将相机几何信息或位姿融入 token 的位置表示中。相比之下,我们以离散键盘动作为条件进行生成,这些动作指定了角色移动和相机运动的局部增量控制,而非标定的全局相机轨迹。这些动作相对于当前角色或相机状态进行解释,并取自一个固定的动作空间,从而使控制表示保持有界,并在长程 rollout 过程中与实时用户交互自然对齐 [17, 22, 25]。

2.5 实时视频生成

实时交互式视频生成由两个相互耦合的指标共同决定:延迟(latency),即用户操作与对应视觉更新之间的延迟;以及吞吐量(throughput),即系统在长时间生成过程中能够维持的持续帧率 [25, 41, 75, 20]。延迟主要受去噪预算和生成的时间单元影响,因为标准扩散模型每帧需要多次评分网络前向传播,而蒸馏后的少步模型 [79, 78, 58, 80, 26, 41, 75, 12] 可降低这一成本。逐帧自回归设计 [80, 64, 75] 能将操作到像素的延迟降至最低,因为每次新的控制都能影响紧接着生成的下一帧。然而,这类设计每帧都需要一次完整的去噪循环,这严重限制了吞吐量,并增加了整个生成过程中的顺序依赖。分块生成(chunk-wise generation)[63, 35, 56] 则改为联合去噪一个帧块,通过分摊注意力计算和 VAE 解码来实现更高的 FPS 和更强的短时时间一致性,代价是当前块内存在有界的控制延迟。吞吐量则取决于每个时间单元的生成与解码效率:在每个块内跨多帧分摊注意力计算和 VAE 解码可提升 FPS,而低比特权重和 KV 缓存 [70, 12]、内核融合以及序列或张量并行 [25, 28, 74] 可降低内存和执行开销。异步流式解码 [12] 还能将生成与显示过程重叠。在本工作中,我们主张采用一种面向部署的交互式视频生成方案,同时优化延迟、吞吐量和内存效率。我们的方法采用分块流式流水线,并配合渐进式视觉交付。通过协同设计轻量级 VAE 解码、内存感知调度、低比特 DiT 推理、高效注意力机制以及优化的位置编码,我们优化的部署方案可在单块 NVIDIA RTX 5090 桌面 GPU 上,以约 [峰值显存预算] 的显存占用,支持高达 [帧率] 的 720P 交互式流式生成,操作到首帧延迟为 [延迟值]。16FPS1.2s19GiB

3 数据基础设施

Refer to caption
图 2:数据流水线概览。一条端到端流水线将智能体驱动与互联网规模采集、多阶段质量过滤以及结构化多模态标注耦合在一起。经过筛选的数据用于训练世界模型,其评估结果反馈至训练-反馈闭环,从而驱动有针对性的重新采集和持续的数据精炼。

3.1 概述

ABot-World 将数据生产视为模型开发中不可分割的一部分,而非一次性预处理阶段。构建高保真、动作可控的世界模型,从根本上依赖于覆盖多样环境、视角和运动模式的大规模高质量训练数据。我们的训练语料来自三个互补来源:AAA 游戏数据、仿真引擎数据和真实世界互联网数据。每个来源的详细特征和采集方法见第 3.2 节。

如图 2 所示,我们的数据基础设施通过三个递进阶段处理所有三个来源:

采集。游戏和仿真数据通过 WorldExplorer(我们的统一智能体驱动系统,见第 3.2.2 节)采集,该系统在虚拟环境中导航,并以闭环训练反馈捕获同步的多模态信号。互联网数据则经过独立的视频分割和姿态估计流水线处理(见第 3.2.5 节)。

质量过滤。原始采集数据经过多阶段过滤流水线(见第 3.3 节),该流水线将覆盖六个质量维度的 14 项确定性信号检查与基于视觉语言模型(VLM)的语义评估相结合,剔除存在技术缺陷和语义无效的样本。

标注。保留下来的片段被补充以动作标签、结构化自然语言场景描述和语义标签(见第 3.4 节),用于动作条件和文本条件训练。该流水线遵循统一的、与来源无关的采集和处理设计,同时在可用时保留来源原生的原始控制信号,并将特定来源的动作信息转换为规范表示以用于模型训练。

我们的数据基础设施与现有方法相比具有三个关键优势:

  • 全自动智能体驱动的数据采集,结合训练反馈驱动的自适应再平衡,将数据生产从被动的批量处理转变为与训练目标紧密耦合的主动伺服系统。

  • 一套全面的质量控制流水线——涵盖六个质量维度的14项独立检查,并辅以基于VLM的语义评估——被系统性地应用,以最大化有效数据占比。

  • 确定性动作标注(针对游戏和仿真数据,通过直接API访问和轨迹设计实现)与统一的多源处理流程相结合,提供了高质量的标签;而真实世界视频则通过姿态估计生成的伪标签贡献了数据多样性。

3.2 数据采集

3.2.1 数据来源与采集范式

我们的训练数据涵盖三个互补来源。AAA游戏数据提供丰富、高保真的3D环境,具有精确同步的动作和观测信号,但本质上局限于特定游戏作品和视觉风格。仿真引擎数据提供几何精确的合成数据,具有确定性动作标签和完全的环境控制;值得注意的是,我们通过ABot-3DGS [2, 59] 重建的街道航拍和街道扫描数据,生成了源自专有非公开资产的逼真真实世界场景。真实世界互联网数据引入了自然的相机动态、多样的光照以及难以通过合成方式复现的领域泛化信号,但缺乏真实动作标签,需要依赖有噪声的姿态估计。

针对交互式环境数据收集,业界已发展出三种范式,每种范式各有其独特的权衡取舍。人工记录(人类游玩)能产生真实、自然的行为数据,但存在严重的可扩展性瓶颈、轨迹碎片化以及高昂的人力成本。基于规则的自动化收集(在游戏和仿真环境中进行脚本化探索)能够以极低的边际成本持续运行并提供确定性标注,但其根本受限于预设脚本——无法自主发现新场景、无法根据训练反馈调整策略,也无法动态平衡数据分布。智能体驱动的收集方式,即强化学习或模仿学习智能体自主导航于交互式环境中,能够实现有目的、目标导向的探索,并以规模化方式生成平滑连续的轨迹,但这种方式容易陷入探索范围狭窄或奖励黑客(reward hacking)的失败模式,且从根本上不适用于互联网视频等被动消费的数据类型。

3.2.2 WorldExplorer:数据闭环收集系统

为克服现有范式的局限性——尤其是基于规则脚本的僵化性,以及传统智能体驱动方法中探索范围狭窄、缺乏训练反馈的问题——我们开发了 WorldExplorer,这是一个统一的智能体驱动收集系统,适用于游戏和仿真环境。WorldExplorer 提供模块化、与环境无关的架构,并为每个后端配备源特定的适配器,由四个核心组件构成。

导航智能体。导航智能体通过多阶段目标选择策略自主遍历虚拟环境,逐步放宽探索标准——从优先探索完全未涉足的区域,到搜索邻近区域,再到带碰撞检测的前向移动兜底策略——从而以较低的重复访问率实现高场景覆盖率。该策略适用于任何具有可导航网格的交互式虚拟环境,无论是实时游戏世界还是重建的 3DGS 场景。

并行采集流水线。视频帧、相机参数(位置、旋转、视场角(FOV)、焦距)、控制输入、环境状态和元数据通过并行流水线同步获取。所有模态通过毫秒级精度时间戳进行同步,跨模态对齐误差低于设定阈值,每次录制会话在事后被切分为训练片段。33ms30FPS

任务模板系统。采集工作被组织为结构化任务类别,以确保行为分布的完整性——涵盖标准导航、自由探索、地标聚焦观察,以及对自然交互中极少出现但对稳健训练至关重要的长尾场景的定向覆盖。场景配置在多个维度上进行参数化——地理、天气、时段、交通密度、视角模式和车辆类型——从而实现对数据分布的细粒度控制。

训练反馈驱动的闭环。WorldExplorer 最显著的特征是其闭环、分布感知的设计。它并非采用固定的采集比例,而是通过训练监控模块持续跟踪各类别的性能指标,由弱点诊断组件通过跨维度评分识别表现不佳的场景-动作组合,再由自适应策略生成器在维持最低覆盖下限以防止灾难性遗忘的同时更新采集比例。智能体通过加权任务模板选择和实时场景参数调整实现动态自适应,全程无需人工干预。整个闭环——训练反馈→弱点诊断→策略自适应→智能体主导生产——将数据采集从被动的批量生产转变为主动的智能伺服系统,在整个模型开发生命周期中与训练目标紧密耦合。

3.2.3 游戏数据采集

游戏数据构成了我们训练语料库中首要且规模最大的数据来源。WorldExplorer 被应用于多款涵盖不同品类的 AAA 级游戏(开放世界探索、城市驾驶、骑马穿越),天然覆盖第一人称和第三人称两种视角。与我们统一、数据驱动的训练范式一致,该数据管线在共享的采集与处理框架内同时支持第一人称和第三人称视角,并在适用场景下保留各视角特有的标注信息。这种设计使得单一模型架构能够学习跨两种视角的动作条件动力学,而无需针对不同视角分别训练独立模型。每次录制会话都会生成 1920×1080 分辨率的 RGB 视频,并同步记录逐帧相机位姿、控制信号和环境元数据。×

游戏数据的一个独特优势在于其天然提供的视角多样性。第一人称视角提供与相机光轴高度对齐的直接自我运动信号,而第三人称视角则呈现可观察的角色动态和周围空间上下文,丰富了模型对智能体与环境交互的理解。此外,直接通过 API 访问消除了基于姿态估计方法中固有的标注噪声,使游戏数据成为我们训练语料库中质量最高的监督信号。

源生控制信号直接从游戏运行时 API 以真值精度捕获,并与每一帧视频同步。这些特定于数据源的控制信号随后被转换为整个数据管线中使用的规范化动作表示。

3.2.4 仿真数据采集

为了增强轨迹多样性,并在游戏录像所能提供的信号之外补充几何监督信号[10],我们构建了一条合成数据流水线,采用两个互补的渲染后端:Unreal Engine(UE)用于实现完全环境可控的照片级真实感场景渲染,以及由 ABot-3DGS [2, 59] 驱动的 3D 高斯泼溅(3DGS)后端。ABot-3DGS 可从多视角图像重建高度逼真的场景——可选地接受 LiDAR 和预处理后的摄影测量点云作为几何先验——并将其应用于我们专有的街道航拍影像和街道扫描数据,以生成大规模户外城市场景和大量室内场景覆盖。这些几何精确的真实世界场景表示源自专有的非公开资产。

WorldExplorer 通过两种互补模式在这些 3D 资产上执行轨迹:(a)程序化路径生成,采用多点插值的几何模式合成;(b)真实世界轨迹导入,将从物理设备捕获的运动路径映射到 3D 场景中,保留真实的人类浏览行为,如重复扫描和自然的手持抖动。每条轨迹在渲染前都要经过碰撞检测,动作标签通过将平移和旋转位移投影到相机基向量上并二值化为离散动作信号来确定性地推导得出,从而生成帧级对齐的标注。

3.2.5 互联网数据收集

对于真实世界的互联网数据,智能体驱动的采集方式并不适用,因为这类内容是被动消费而非交互式生成的。我们转而采用基于视频的流水线,从多样化的互联网来源中提取训练信号,包括行车录像、步行游览和航拍视频。原始视频首先根据场景边界和内容连贯性被切分为训练片段,确保每个片段捕捉到一致的环境或活动。随后,通过姿态估计方法恢复 6 自由度相机轨迹作为伪标签——方法的选择基于场景特征(如室内/室外环境、静态/动态内容以及纹理丰富度)——以应对互联网视频中遇到的多样化视觉条件。

动作意图标签通过将逐帧的平移和旋转位移投影到相机基向量上,并经由阈值化进行二值化处理而得到,从而产生与视频帧对齐的离散动作信号。尽管这些伪标签带有游戏和仿真真值中不存在的估计噪声,互联网数据通过引入自然的相机动态、真实世界的光照变化以及难以通过合成方式复现的领域泛化信号,大幅扩展了训练多样性。

3.3 质量过滤

原始采集数据不可避免地包含从技术性伪影(丢帧、分辨率不匹配)到语义性问题(用户界面覆盖层、死亡序列、几何故障)的各种质量问题。我们实现了一个统一的多阶段过滤流水线,涵盖六个质量维度上的 14 项独立检查——(1) 文件完整性、(2) 视觉有效性、(3) 几何一致性、(4) 游戏状态正确性、(5) 动作标签对齐以及 (6) 元数据质量——并辅以基于 VLM 的语义评估,以生成最终可用于训练的数据集。该流水线分三个阶段渐进式运行,每个阶段处理一类不同的质量问题。检查按顺序执行——早期阶段的格式验证能够在计算密集型分析之前实现快速剔除。

阶段 1:文件完整性。快速确定性检查——文件对存在性、帧数一致性、分辨率合规性、丢帧检测——以高吞吐量剔除存在根本缺陷的录制数据。格式级错误会触发片段级拒绝,因为这些错误会使样本无法用于下游动作条件模型训练。

阶段 2:视觉有效性、几何一致性与游戏状态正确性。内容级分析通过基于 VLM 的筛查(用户界面叠加层、加载画面、弹窗、渲染异常)、几何异常检测(地形穿透的垂直位移跳变、摄像机穿物体分析)、游戏状态信号处理(死亡序列切除、过场动画和地图边界移除)以及动作标签对齐验证来检测语义无效片段。第三人称角色可见性会被评估并标记(而非拒绝),用于下游加权处理。

阶段 3:元数据质量。通过筛选的片段会获得元数据标注——动作-姿态一致性分数、画面色彩偏移标记——这些作为训练时样本加权和课程调度的软信号,而非硬性拒绝条件,使模型仍能从有缺陷但包含信息的训练样本中有效学习。

3.4 数据标注

通过筛选的片段会被标注,用于动作条件和文本条件的世界模型训练。该流程在设计上尽可能做到数据源无关,同时在可用时充分利用数据源特有的信号。

动作标签。动作标签通过各数据源特有的机制获取,并转换为统一的规范格式。对于游戏数据,源生控制信号直接从游戏运行时 API 以真值精度捕获,并与每个视频帧同步。对于仿真数据,标签从设计轨迹中确定性推导得出(第 3.2.4 节)。对于互联网视频,标签通过位移投影和阈值化从估计姿态中推导得出(第 3.2.5 节)。这些伪标签带有估计噪声,但能够大幅扩展训练数据的多样性。因此,三种数据源都提供统一的动作表示,用于模型统一训练。

场景描述。除了动作标签之外,我们还使用大型视觉语言模型(VLM)为每个片段生成结构化的自然语言描述。这些描述在文本条件生成训练阶段作为条件输入,使模型能够响应高层级语义提示词(例如“沿着海岸公路阳光明媚地行驶”),同时也能响应低层级的动作控制。

VLM 生成的描述能够捕捉整体场景构成、环境特征、天气与光照条件,以及显著的动态事件,同时刻意省略摄像机运动信息,从而将运动控制与场景生成解耦——这一设计选择有助于防止模型将文本描述与摄像机轨迹信号混淆。对于游戏数据,每条描述文本前都会加上一个游戏标识符 token,使模型能够学习特定数据源的视觉风格和渲染惯例。

语义标签。每个片段还会额外标注一组由 VLM 提取的结构化语义标签,包括场景属性(室内/室外、城市/乡村、建筑类型)、天气条件、时段、车辆类型和视角模式。这些标签支持训练过程中的分层采样,确保模型均衡接触多样化的环境条件,并便于在特定子集上进行有针对性的微调或评估。

人物身份。对于第三人称视角数据,我们还会额外提取结构化的人物身份表征:从每个第三人称片段中,我们识别出角色清晰可见且未被遮挡的帧,然后根据摄像机与角色之间的相对角度,裁剪出面向四个基本视角方向(正面、背面、左侧、右侧)的人物缩略图。基于这些方向性缩略图,我们进一步通过基于图像的人脸补全技术合成一张规范的正面肖像,从而生成标准化的身份参考。

这些标注支持第三人称场景下的身份条件生成,并为角色一致的视频合成提供身份参考。综合来看,经过筛选的多源语料库支撑了完整的 ABot-World 训练流程,而模型评估则反哺后续的 WorldExplorer 数据收集,从而闭环了图 2 所示的数据—模型循环。

4 ABot-World-0

本节介绍完整的 ABot-World-0 流程。我们首先介绍总体问题定义(第 4.1 节),该定义界定了交互式世界建模任务,包括动作条件输入和训练目标。随后我们介绍双向教师训练(第 4.2 节),通过大规模交互式视频数据,使预训练视频生成器具备动作条件下的动态建模能力。接下来,我们介绍因果蒸馏(第 4.3 节),将双向生成能力迁移到支持高效在线交互和长程推演的因果自回归模型中。为进一步提升推演稳定性,我们引入了 LongForcing,这是一种长程分布匹配策略,将教师监督扩展到更长的时间上下文,从而缓解累积的自回归漂移。最后,我们详细介绍推理加速流程(第 4.4 节)。

总而言之,本节呈现三大核心技术组件:

  1. 一个用于统一交互式生成的动作可控视频世界模型。ABot-World-0 将原始键盘输入作为场景漫游和第三人称角色交互的唯一动作接口,同时参考角色记忆提供补充的外观条件,以在第三人称交互过程中维持角色身份一致性。

  2. 一套渐进式双向到因果训练流程,实现高效且稳定的推演。教师强制和 ODE 蒸馏逐步将双向教师模型迁移为少步因果学生模型,而 LongForcing 则将学生的长程自推演与扩展时域教师模型对齐,以缓解累积的分布偏移和自回归漂移。

  3. 面向实时单 GPU 部署的全栈推理协同设计。该部署技术栈将少步扩散与轻量级 VAE 解码、低比特 DiT 推理、高效注意力与位置编码,以及内存感知调度相结合,从而在单台桌面级 GPU 的计算与内存约束内实现实时交互式生成。

4.1 问题定义

世界模型的基本目标是从过去的观测和智能体交互中预测环境的未来状态。在我们的设定中,环境状态以视频表示,模型基于先前观测到的帧、用户动作以及多模态条件(如高层级文本指令和参考图像)来预测未来的视觉观测。我们将此任务定义为交互式世界建模问题,它涵盖三个关键需求:长时程视频推演、动作条件控制,以及长时间跨度上的时间一致性。

形式上,设 和 分别表示可用的视觉历史与未来动作序列。设 表示包含文本提示词和参考图像的多模态条件。我们的目标是建模𝐯0:t1𝐚t:t+L1𝐜

pθ(𝐯t:t+L1𝐯0:t1,𝐚t:t+L1,𝐜), (1)

其中 表示长度为 的下一视频片段。通过迭代预测并追加未来片段,模型可以自回归地推演出长时程轨迹。𝐯t:t+L1L

如图 3 所示,我们的训练流程包含两个主要阶段,每个阶段对应不同的条件建模目标:

  1. 双向教师学习。在第一阶段,我们训练一个双向教师模型,使其在给定初始帧、完整动作序列和多模态条件的情况下生成全时程视频。具体而言,给定初始帧 、动作 和多模态条件 ,教师模型被训练来建模v0𝐚1:T𝐜

    pϕbi(𝐯1:Tv0,𝐚1:T,𝐜). (2)

    双向架构联合生成目标序列,使得信息能够在整个时间范围内传播,而非强制施加严格的因果依赖。这种非因果的构建方式允许全范围的信息交换,并为视觉一致性、动作质量和动作对齐提供了强有力的教师模型。我们从预训练的视频生成骨干网络出发,在大规模视频-动作数据上对教师模型进行微调,采用动作条件、参考角色记忆以及长序列训练。

  2. 通过蒸馏实现因果学生模型学习。在第二阶段,我们将训练好的双向教师模型蒸馏为因果自回归生成器,其目标与公式(1)中的在线展开设置相匹配。具体而言,学生模型建模

    pθcausal(𝐯t:t+L1𝐯0:t1,𝐚t:t+L1,𝐜), (3)

    仅利用过去的视觉观测、相应的动作序列以及多模态条件来预测未来的每个视频片段,而无法访问未来帧。

    由于双向教师模型依赖全序列生成和迭代去噪,它无法直接部署用于交互式自回归展开。因此,我们采用渐进式三阶段蒸馏流程。首先,教师强制在因果视觉条件下将教师知识迁移至自回归学生模型。其次,通过 ODE 蒸馏,学习从中间噪声潜变量到干净端点的映射(该端点由冻结的第一阶段因果模型的概率流 ODE 在相同因果输入下定义),从而将多步自回归去噪压缩为少步预测。第三,我们引入 LongForcing,与扩展时域的教师模型进行分布匹配。更长的监督时域覆盖学生自回归展开的较后部分,而预测误差在这些部分有更多机会累积。这提供了超越短时域训练的分布级纠正监督,并减少了自回归展开过程中的长期漂移。

以下各节将详细描述每个阶段。

Refer to caption
图 3:ABot-World-0 的整体训练流程。我们首先将预训练的视频生成模型适配为高质量的双向动作条件教师模型。随后,通过教师强制(Teacher Forcing)、因果 ODE 蒸馏(Causal ODE Distillation)和 LongForcing,将该教师模型逐步转化为因果自回归学生模型,从而实现少步数低延迟推理和稳定的长时程交互式 rollout。

4.2 带动作控制注入的双向教师模型训练

预训练视频生成模型具备丰富的世界先验知识,如视觉外观、物理合理性和场景构图,但缺乏动作条件下的动态知识,即从离散控制输入到相应视觉状态转换的映射。为弥补这一差距,我们通过将动作控制信号和参考图像注入预训练的 Wan2.2 主干网络 [61] 来训练双向视频生成模型。通过在带有时间增强的大规模多源视频-动作数据上进行全参数微调,我们的模型学习了动作与视觉动态之间的对应关系,为后续的因果自回归适配奠定了坚实基础。

4.2.1 动作控制注入

我们使用原始键盘输入作为唯一的交互控制信号。具体而言,每个帧级动作被表示为一个 8 维多热向量,对应 8 个离散按键:W/A/S/D 用于角色或相机移动,I/J/K/L 用于相机旋转。设

𝐚1:T={a1,,aT},at{0,1}8, (4)

表示长度为 的视频的逐帧动作序列。与依赖估计相机位姿或学习潜在动作的方法相比,这种原始键盘信号可直接从游戏录像中获取,并在推理时与用户意图自然对齐。T

为匹配视频分词器的时间压缩率,我们沿通道维度将每 4 个连续的帧级动作打包在一起,与 VAE 的时间 patch 大小 4 保持一致。具体而言,打包后的动作 token 序列为

𝐚~1:T/4={a~1,,a~T/4},a~τ{0,1}32, (5)
a~τ=Concat(a4τ3,a4τ2,a4τ1,a4τ). (6)

因此,每个时间动作 token 的维度为 ,并在 VAE 压缩后与一个潜在帧对齐。8×4=32

随后,我们将打包后的动作序列输入动作控制适配器(Action Control Adapter)。我们采用了一种由PixelUnshuffle、一个卷积层(其卷积核大小和步长均设置为DiT空间补丁大小)以及后续残差卷积块组成的相机适配器架构。PixelUnshuffle的下采样因子被选择为与VAE的空间压缩比相匹配,从而确保适配器输出与DiT补丁化潜在token的时空分辨率严格对齐。将加噪视频潜在变量记作,其补丁嵌入记作,则动作条件化的潜在token由下式给出:ψ𝐳PatchEmbed(𝐳)

𝐳^=PatchEmbed(𝐳)+ψ(𝐚~1:T/4). (7)

这种设计能够将动作信息以逐token加性注入的方式直接引入DiT主干网络。

我们在整个模型中均采用补丁化阶段的加性注入方式。

4.2.2 身份保持条件化

视频世界模型在长时程第三人称推演中可能面临身份漂移问题,即尽管运动动态得以保持,角色外观却会逐渐偏离。为解决这一问题,我们引入了一个由可控角色的多张标准参考图像组成的参考角色记忆模块。

参考图像由与推演帧相同的VAE进行编码,并转换为身份记忆token,这些token在进入DiT主干网络之前被前置到视频token序列中。我们为记忆token分配固定的负时间RoPE索引,而为视频token分配非负索引,从而将静态身份信息与生成的轨迹分离开来。此外,我们采用了一种非对称的记忆-视频注意力模式,其中视频token关注记忆token,而记忆token则与视频token保持隔离。这使得在自回归推演过程中能够持续进行身份检索,并在长时程范围内提升角色一致性。

Refer to caption
图4:ABot-World-0模型架构。ABot-World-0将动作控制和参考角色记忆整合进预训练的视频DiT中。键盘动作引导动态生成,而参考图像则有助于保持角色身份。

4.3 因果渐进式学生蒸馏

双向教师模型因其全序列生成和多步去噪的特性,无法直接部署用于实时交互。因此,我们通过一个三阶段渐进式流程将其蒸馏为因果生成器:(1)教师强制(Teacher forcing),在因果视觉条件下将双向教师模型转化为自回归学生模型;(2)ODE 蒸馏,在保持生成质量的同时将自回归去噪过程缩减为少步推理;(3)LongForcing,通过扩展时域教师模型进行长程分布匹配,以提升推演稳定性并缓解自回归生成过程中的累积漂移。通过让学生模型暴露于更广泛的、可能累积推演误差的长程学生推演上下文中,LongForcing 提供了超越短训练时域范围的纠正式监督。每个阶段都建立在前一阶段的基础上,逐步将高质量但非因果的教师模型转化为适用于实时交互式推演的高效因果世界模型。

4.3.1 第一阶段:教师强制

我们并非从头训练因果学生模型,而是从已训练好的双向教师模型进行初始化,并通过因果训练目标和注意力掩码策略来适配模型。双向教师模型在访问完整时间上下文的情况下联合去噪整个视频序列,而因果学生模型则被训练为仅利用先前观察到的视觉上下文来生成未来的视频块。

具体而言,在教师强制阶段,历史帧以干净的 ground-truth 潜变量形式提供,而目标块则根据扩散过程进行加噪。因果注意力掩码限制模型无法访问超出可用历史范围的未来视觉上下文,从而匹配自回归推理所需的信息结构。这种设计保留了双向教师模型学到的视觉先验和长程动态知识,同时将模型适配为因果生成。

形式上,对于从时间 开始的推演步骤,学生模型建模t

pθcausal(𝐯t:t+L1𝐯0:t1,𝐚t:t+L1,𝐜), (8)

在此阶段,它被用作干净的视觉条件,并被转换为带噪的潜在目标,用于扩散训练。通过在此阶段依赖真实历史信息,该目标函数实现了从双向轨迹建模到因果自回归逐步生成的稳定过渡。𝐯0:t1𝐯t:t+L1

4.3.2 第二阶段:ODE 蒸馏

上一阶段得到的因果扩散模型在每一步自回归生成时仍需要迭代去噪。为降低推理延迟,我们应用了因果 ODE 蒸馏,训练一个少步模型来近似由第一阶段因果模型所诱导的概率流 ODE。

一个关键要求是,参考模型与蒸馏模型必须遵循相同的因果分解方式。因此,我们冻结由 参数化的第一阶段因果扩散模型,并让两个模型基于相同的因果上下文进行条件生成:θc

𝒞t=(𝐯0:t1,𝐚t:t+L1,𝐜), (9)

其中, 表示干净的视觉历史, 表示目标动作序列, 表示包含文本提示词和参考图像的多模态条件。𝐯0:t1𝐚t:t+L1𝐜

设 为第一阶段因果模型概率流 ODE 轨迹上噪声水平 处的中间潜在变量。其对应的干净端点为𝐳scs

𝐳0c=Φθc,s0(𝐳sc;𝒞t), (10)

其中, 表示从噪声水平 到干净端点对因果模型概率流 ODE 的积分。蒸馏模型被训练为直接预测该端点:Φθc,s0s

ODE=𝔼s,𝐳sc,𝒞t[fθ(𝐳sc,s,𝒞t)sg(𝐳0c)22], (11)

其中, 表示停止梯度操作。sg()

由于中间潜在变量及其端点是在相同条件设置下从同一条因果 ODE 轨迹中获得的,它们为每个自回归预测步骤定义了一致的流映射。此外,蒸馏目标仅依赖于部署时可用的因果上下文,不需要未来的视觉观测。因此,所得模型可以用显著更少的去噪步骤逼近原始因果扩散端点映射,同时保持其自回归逐步生成行为。

4.3.3 第三阶段:LongForcing

经过 ODE 蒸馏后,因果学生模型只需少量去噪步骤即可执行自回归 rollout。然而,它仍面临一个根本性的长程挑战:由于每次预测都基于先前生成的帧进行条件化,微小的分布误差会不断累积,并逐渐将 rollout 推向训练期间很少遇到的长程学生 rollout 上下文。这些长程学生 rollout 上下文获得的分布匹配监督有限,导致 rollout 分布逐渐偏离期望的世界动态。

因此,我们引入了 LongForcing,这是一个最终的长程分布匹配阶段,通过扩展教师监督的时间范围来提高 rollout 稳定性。与在固定因果条件化下学习干净端点流映射的 ODE 蒸馏不同,LongForcing 在长程条件视频分布层面将学生模型与教师模型对齐。关键洞察在于,长程稳定性不仅取决于准确的局部转移,还取决于闭环 rollout 分布是否保持在教师监督所覆盖的时间区域内。

更长的学生自 rollout 使模型暴露于长程学生 rollout 上下文中,在这些上下文中,微小的预测误差有更多机会累积。LongForcing 在这些自生成轨迹上进行训练,并在最终的分布匹配蒸馏(DMD)阶段 [79] 应用来自扩展范围教师的分布级纠正监督。这鼓励学生模型保持合理的长程动态,而无需显式的帧级轨迹匹配。与短程教师监督相比,扩展范围在更长的时间跨度上提供分布级指导,旨在缓解视觉质量和动作条件动态的渐进式退化。

4.4 实时世界 Rollout 的全栈协同设计

少步蒸馏显著降低了每次自回归预测的去噪成本,但仅凭这一点还不足以在单块消费级 GPU 上实现实时交互式世界推演。随着去噪预算被压缩,主导系统瓶颈转向了分块潜变量解码、Transformer 计算、注意力与位置编码开销、上下文内存流量以及运行时模型驻留。

因此,我们将实时部署定义为一个全栈协同设计问题,涵盖时间生成粒度、VAE 解码器、低精度 DiT 执行、注意力与 RoPE 内核、有界上下文内存以及运行时模块调度。我们的目标不是优化单个算子,而是联合平衡三个部署关键属性:持续生成吞吐量、动作到首帧延迟以及峰值 GPU 内存占用。这一协同设计的推理栈使得在单块 NVIDIA RTX 5090 GPU 上实现实时、高分辨率、长时程交互式生成成为可能。

4.4.1 部署目标与运行时指标

媒体内容 · 前往原文查看
表 1:ABot-World-0 在单块 NVIDIA RTX 5090 上的部署设置与运行范围
项目 规格
GPU 1×NVIDIA RTX 5090
批大小 1
分辨率 1280×704
推理 分块流式
吞吐量 最高16FPS
动作到首帧延迟 1.2s
峰值显存 19.3GiB

ABot-World-0 采用分块因果生成方式,联合生成一个潜变量帧块,并在将生成的帧交付给流式运行时之前完成整个块的解码。我们将动作到首帧延迟定义为从用户按键到对应推理块完成解码且其首帧响应可用之间的墙钟时间。

该表报告的是整体部署运行范围,而非某个特定精度下的单一运行点。FP8 及更激进的低比特配置下的详细速度与内存权衡见表 2。

4.4.2 分块流式与运行时协同设计

轻量级 VAE 解码器降低了首帧延迟和峰值内存占用。尽管 DiT 仍是计算量最大的组件,但在高分辨率下,VAE 解码对首帧延迟和内存消耗的贡献仍不可忽视。受 TAEHV [5] 启发,我们简化并剪枝了解码器架构,构建了一条轻量级 VAE 解码路径,记为 LightVAE,显著减少了解码时间和峰值内存占用。

由于完整的潜在变量块必须解码完成后,其响应帧才能提供给流式运行时,因此减少块解码时间可直接降低从动作到首帧的延迟。

内存感知调度提升了单 GPU 部署的可行性。为进一步降低 GPU 内存压力,我们借鉴 FramePack [84] 的模块交换工具,采用了内存感知的运行时调度。推理流程的所有组件无需同时驻留在 GPU 上,而是根据执行顺序和内存需求对模型模块进行分阶段加载。该策略在不修改模型架构的情况下降低了峰值显存占用,同时限制了延迟关键推理路径上的数据传输开销。

Fast-RoPE 降低了时间位置编码的开销。长时程自回归生成会在移动的局部注意力上下文上反复应用时间位置编码。我们采用 Fast-RoPE 来改进流式生成过程中的时间位置编码。具体而言,我们在局部注意力窗口内重新锚定时间 RoPE,以减少随着生成推进而对完整可见上下文进行的重复 RoPE 计算。此外,我们还使用了基于 Triton 的 RoPE 内核来加速旋转操作。这些优化共同降低了长时程交互式推理过程中的位置编码开销。

4.4.3 低精度计算与上下文内存协同设计

低比特混合精度推理可提升 DiT 的吞吐量与内存效率。为降低 DiT 推理的计算与内存带宽成本,我们参照 LightX2V [13] 的部署实践,对模型应用低比特量化。FP8 作为我们默认的以质量为导向的工作点,在 GEMM 吞吐量和内存带宽效率方面带来了显著提升。

我们还评估了更激进的低比特格式,以刻画部署包络中高吞吐区域的特性。具体而言,DiT 主干中计算密集的线性层被量化,而数值敏感组件(如 VAE 和文本编码器)则保持较高精度。这种混合精度设计在推理吞吐量和内存占用之间提供了可配置的权衡,同时为数值敏感组件保留了更高精度。

高效注意力内核可加速主导性的 Transformer 算子。注意力计算构成了扩散 Transformer 每步延迟的主要部分,尤其是在长 token 序列的高分辨率视频生成场景中。因此,我们采用 SageAttention2 [83] 作为高效的注意力后端。它无需模型重训练或架构修改即可替代传统注意力执行方式,从而降低这一主导性 Transformer 算子的运行时成本。

有界 KV 缓存可防止上下文无限增长,而缓存量化则能进一步降低其固定开销。对于长时程流式生成,朴素的完整历史 KV 缓存会随生成上下文不断增长,最终成为实际的内存与带宽瓶颈。ABot-World-0 通过带滚动淘汰机制的有界局部上下文 KV 缓存避免了这种无界增长,使缓存占用与总 rollout 时长无关。

然而,即使在有界上下文设计下,驻留的键和值张量在高分辨率下仍然是内存消耗和内存带宽流量的主要来源。为了进一步降低这一成本,我们探索了 KV 缓存量化,它在压缩缓存的键和值张量的同时,保留其用于后续注意力计算的可用性。

借鉴近期在线向量量化 [81] 的进展,该策略可以同时降低固定缓存占用和局部上下文注意力的带宽压力。因此,KV 缓存量化可以补充低比特 DiT 推理,并在受限 GPU 内存下提升长时程生成的扩展性。

4.4.4 端到端系统分析

媒体内容 · 前往原文查看
表 2:在单块 NVIDIA RTX 5090 GPU 上、分辨率和批大小条件下的各优化变体系统级分解。1280×7041
配置 DiT 时间(毫秒/块) VAE 时间(毫秒/块) FPS 显存(GiB)
基线 内存不足 内存不足
+ SageAttention2 内存不足 内存不足
+ SageAttention2 + LightVAE 1191.081 78.276 9.117 20.491
+ SageAttention2 + LightVAE + FP8 845.180 75.980 12.405 15.925
+ SageAttention2 + LightVAE + FP8 + Fast-RoPE 786.871 71.730 13.269 19.281
+ SageAttention2 + LightVAE + MXFP6 + Fast-RoPE 718.281 85.994 14.098 18.287
+ SageAttention2 + LightVAE + MXFP4 + Fast-RoPE 638.843 72.957 15.831 17.148

每个推理块包含潜在帧并生成解码后的视频帧。DiT 和 VAE 时间按每个推理块报告,FPS 表示生成吞吐量,VRAM 表示以 GiB 为单位的峰值 GPU 内存使用量,OOM 表示内存不足。表 2 表明,实时部署源于全栈优化,而非单个算子的加速。基线和仅使用 SageAttention2 的变体均出现内存不足,这表明仅靠更快的注意力内核不足以让完整的高分辨率流水线在单块桌面 GPU 上部署。内存可行性需要联合优化 Transformer 执行、视频解码、数值精度和运行时模型驻留。312

引入 LightVAE 后,我们得到了首个可行的配置,实现了 9.117 FPS 的帧率,峰值显存占用为 20.491 GiB。这一结果表明,原始 VAE 是内存可行性方面的重要瓶颈,而 VAE 解码仍然是分块响应延迟中不可忽视的组成部分。

在此配置基础上,对 DiT 主干进行量化带来了显著收益。FP8 将每个分块的 DiT 处理时间从 1191.1 ms 降至 845.2 ms,生成吞吐量从 9.117 FPS 提升至 12.405 FPS,峰值内存占用从 20.491 GiB 降至 15.925 GiB。加入 Fast-RoPE 后,DiT 处理时间进一步降至 786.9 ms,吞吐量提升至 13.269 FPS。该配置下实测峰值内存升至 19.281 GiB,这凸显出峰值显存由完整运行时配置决定,而非仅由单个算子的开销决定。

我们采用 FP8 作为默认的面向质量的配置,而更激进的低比特格式则扩展了高吞吐量的运行范围。在优化后的低比特配置中,ABot-World-0 最高可达 16 FPS,同时峰值显存保持在 19.3 GiB 以下。

总体而言,这些结果验证了我们的核心系统洞察:少步生成并不会自动转化为实时交互。实时、高分辨率的世界推演需要时间生成、潜变量解码、Transformer 算术运算、注意力与位置编码、上下文内存管理以及运行时调度的全栈协同设计。这些优化共同将蒸馏后的因果模型转变为一个实用的交互式世界模拟器,可在单张桌面级 GPU 上持续运行。

量化感知训练可能进一步改善速度—内存—质量之间的权衡。我们将这一方向留待未来工作。

5 评估

我们通过三个互补视角来评估 ABot-World-0:在 WorldRoamBench 上的定量比较、对 LongForcing 的 60 秒时间消融实验,以及涵盖小时级和天级 rollout、域外控制和物理交互的定性压力测试。WorldRoamBench 衡量动作可控性、轨迹跟随、视觉质量、物理合理性和时间记忆,而扩展 rollout 则考察模型在基准测试范围之外的行为。LongForcing 消融实验直接评估自回归 rollout 过程中的视觉误差累积,定性案例则展示了扩展交互、身份保持、控制泛化和合理的物理效果。综合来看,这些实验刻画了 ABot-World-0 在长时间交互中的可控性、连贯性和状态持久性。

5.1 WorldRoamBench 评估

为了在交互式、长时程场景中评估 ABot-World-0,我们使用 WorldRoamBench [72],这是一个用于可控视频世界模型的开源基准测试。WorldRoamBench 评估四个关键维度:动作可控性、视觉合理性、物理一致性和时间记忆保持。

5.1.1 定量结果

表 3 仅报告了具体的 WorldRoamBench 子维度。我们按照基准测试协议,与 Genie 3 [19]、HappyOyster [1]、LingBot-World [54] 和 HY-World 1.5 [62] 进行了对比。

媒体内容 · 前往原文查看
表 3:WorldRoamBench 在动作、视觉、物理和记忆等选定子维度上的定量比较,表头已按相应维度着色。最佳结果以粗体显示,次佳结果以下划线标出。
模型 规模 严格准确率 部分准确率 轨迹得分 美学 成像 力学 记忆
Genie 3 0.4700 0.6608 0.6719 0.4711 0.4757 0.5454 0.6073
HappyOyster 0.5317 0.7631 0.7737 0.5235 0.4377 0.5395 0.6309
LingBot-World 14B 0.3235 0.4198 0.4094 0.2898 0.2875 0.2777 0.3006
HY-World 1.5 8.3B 0.1640 0.2088 0.2015 0.1400 0.1236 0.1115 0.1562
ABot-World-0 5B 0.5266 0.7290 0.6752 0.5039 0.4651 0.5223 0.5041

ABot-World-0 在动作保真度、轨迹跟随、视觉质量、物理机制和记忆得分方面均取得了强劲表现。

5.1.2 定性分析

除了具有竞争力的量化性能外,ABot-World-0 还展现出三项对实用交互式世界模型至关重要的定性能力:在极长 rollout 中持续的可控性和场景连贯性、可跨不同场景和可控角色泛化的统一控制接口,以及对动作和环境约束的合理物理响应。在评估的所有案例中,ABot-World-0 始终能响应用户指令,同时保持可辨识的场景结构、角色和物体身份以及运动连续性,不会迅速退化为冻结运动、重复纹理或严重的视觉漂移。这些结果表明,ABot-World-0 学习到的是持久且有状态的交互动态,而非仅仅生成局部合理短片段序列。

Refer to caption
图 5:小时级长时程生成示例。每个 rollout 以带时间戳的关键帧条带形式展示,体现了一小时交互式 rollout 中持续的可控性和场景连贯性。
Refer to caption
图 6:天级长时程生成示例,第一组。来自两个天级 rollout 示例的带时间戳关键帧展示了在长时间生成过程中,采样检查点处可辨识的场景结构、视角一致性和活跃运动。
Refer to caption
图 7:天级长时程生成示例,第二组。另外两个带时间戳的 rollout 示例在大量累积误差条件下,于采样检查点处仍保持可辨识的场景结构和活跃运动。

图 5、6 和 7 展示了模型的长时程生成能力。小时级结果包含五个独立的 rollout,以带时间戳的关键帧条带形式可视化。尽管生成时程延长,ABot-World-0 仍能保持连贯的环境、视角和可控角色,同时持续响应输入的动作流。天级压力测试进一步让模型暴露在严重的累积误差条件下,采样检查点仍保留可辨识的场景结构和活跃运动,而不会坍缩为纹理噪声、重复内容或静态帧。

Refer to caption
图 8:跨多样场景与可控角色的域外(OOD)控制泛化。每一行展示一次交互式 rollout,其中环境与可控主体均处于训练分布之外。通过统一的动作接口,ABot-World-0 在生成与动作一致的角色运动的同时,保持与周围场景的连贯性。

图 8 评估了域外(OOD)控制泛化能力,其中环境与可控角色均落在训练分布之外。示例涵盖在统一动作表征下的多样场景与可控角色。在这些 OOD 设定下,生成的运动始终遵循输入动作序列,同时与周围环境保持连贯,表明所学习的动作条件化能够泛化到新颖的场景—角色组合。

Refer to caption
图 9:物理交互示例。这些案例包括物体碰撞、水迹、雪地足迹、墙体阻挡,以及与栏杆碰撞且不发生穿透。

图 9 突出了交互过程中涌现的合理物理后果。例如,一个人推开纸箱,脚步在水面引发时间上一致的扰动,人走过雪地留下持续足迹,第一人称运动被墙体阻挡,以及角色与栏杆碰撞而不穿过它。这些案例涉及碰撞、接触效应、持续性环境变化以及几何约束,而这些都并非仅由动作标签所指定。尽管 ABot-World-0 并未显式地以符号化物理规则或真实世界碰撞标注进行训练,它仍能从大规模交互视频经验中产生合理的物理响应。

5.2 LongForcing 对长时程 Rollout 的影响

我们将 LongForcing 与一种因果强制式(Causal-Forcing-style)基线方法 [87] 进行比较,后者在相同的 rollout 协议下适配到我们的交互式世界模型。两种变体都在学生自身自回归 rollout 产生的历史数据上训练,并在最终后训练阶段应用 DMD。LongForcing 的不同之处在于,该阶段使用扩展时域的教师监督,而非基线所用的较短时域监督。我们使用 HPSv3 分数 [49]、高饱和像素比例、感知模糊分数和 patch 重复比例,对两种变体在 60 秒 rollout 上进行评估。HPSv3 越高越好;其余三项指标则越低越好。

Refer to caption
图 10:我们的因果强制式基线与 LongForcing 在 60 秒 rollout 上的逐帧比较。两种变体均使用学生自 rollout 和最终阶段 DMD;LongForcing 额外使用扩展时域教师监督。标记为 Causal Forcing 的曲线表示本报告中使用的适配后因果强制式基线。HPSv3 值越高越好,而高饱和像素比例、感知模糊分数和 patch 重复比例越低越好。曲线为评估集上的平均值。

如图 10 所示,两种变体之间的差异在 rollout 的后半段变得更加明显。因果强制式基线在 rollout 后半段表现出 HPSv3 逐步下降,同时饱和度、模糊度和 patch 重复度升高。LongForcing 在同一区间内保持更高的 HPSv3 分数和更低的伪影相关指标,表明自回归生成过程中的视觉误差累积更少。

6 讨论与未来工作

显式动作支持简单的条件注入。键盘输入是离散的,在时间上与视频对齐,并直接反映用户意图。对于这些显式控制信号,我们在 patch 嵌入阶段使用加性注入,以在保留预训练模型视觉先验的同时提供可靠控制。对于潜在动作、连续相机轨迹或语义指令等模糊信号,更精细的条件注入方式可能仍然有用。

长时程漂移更适合被理解为一个分布偏移问题。随着自回归生成的推进,微小误差在视觉上下文中不断累积,逐渐将模型推离短时程训练所覆盖的状态范围。基于汇(sink)的上下文稳定化和固定参考坐标系可以延缓这一过程,但过度锚定可能使模型过于贴近其初始观测,从而限制运动与场景演化。LongForcing 走了一条不同的路线:它在学生模型的长程自滚动(self-rollout)上进行训练,并用扩展时程的教师模型来正则化由此产生的分布。这使得模型能够在保持稳定的同时继续想象新内容。我们在天级滚动中采样到的连贯检查点,与“训练时分布对齐是通往长时程生成的一条有前景路径”这一目标是一致的。

实时交互不仅仅是少步采样。另一个实际经验是:单纯减少去噪步数本身并不能带来一个交互式系统。一旦 DiT 完成蒸馏,VAE 解码、注意力计算、内存传输,以及 KV cache 的内存占用和带宽需求,仍然是实实在在的系统成本。将这些组件一起优化,才能使 ABot-World-0 在单张桌面 GPU 上维持实时推理。对于交互式世界模型而言,从动作到首帧的延迟、持续吞吐量和内存占用,比单纯的去噪步数更有意义。

未来工作。这些观察指向了几个自然的扩展方向。更丰富的动作和语义事件可能需要更结构化的条件控制;多尺度 LongForcing 和持久化场景记忆可能进一步提升长时程一致性;而更高效的解码与上下文管理,则有望将高分辨率实时生成扩展到更广泛的消费级硬件上。

7 结论

ABot-World-0 将动作条件视频世界建模带到了实时桌面部署场景。该模型基于涵盖 AAA 游戏、仿真引擎和互联网视频的多源动作-视频数据训练,单一模型即可在不同环境和可控主体上同时支持场景导航与角色控制。参考角色条件机制可在长时程第三人称生成过程中提供持续的外观线索。

训练流程从一个双向教师模型出发,该模型学习动作条件的视觉动力学,随后通过教师强制和 ODE 蒸馏逐步将其转化为高效的因果生成器。LongForcing 进一步将学生的长自回归 rollout 与扩展时程的教师模型对齐,将分布级监督扩展到重复自回归生成过程中遇到的长时程学生 rollout 上下文。60 秒 rollout 评估超出了训练时程范围,结果表明,与 Causal-Forcing 风格基线相比,LongForcing 减少了视觉误差累积,在评估的 rollout 中支持了更好的视觉稳定性。

优化后的部署技术栈结合了轻量级 VAE 解码器、低位推理、高效注意力和内存感知调度,在单张 RTX 5090 上实现了最高 16 FPS 的 720P 流式生成,动作到首帧延迟为 1.2 秒,同时在优化的低位运行点下峰值显存保持在 19.3 GiB 以下。WorldRoamBench 上的结果显示,在动作跟随、轨迹跟随、视觉质量、物理机制和记忆保持方面均具有竞争力的表现。值得注意的是,从日级 rollout 中采样的检查点在评估时间戳上保持了可辨识的视觉质量、活跃动态和场景连贯性,未出现可观察到的崩溃。

ABot-World-0 证明了统一的交互控制、稳定的长时程推理和消费级实时部署可以在单一视频世界模型中同时实现。通过持续将生成的世界扩展到预定义场景边界之外,它为交互式内容创作、游戏仿真、智能体学习和具身 AI 研究提供了一个开放且实用的基础。

8 位贡献者

项目赞助人:Mu Xu 和 Ning Guo。

基础模型团队:Fan Jiang†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\dagger†\

Data Team: Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, and Yongchang.

AI Infra Team: Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, and Di Yang.

Benchmark Team: Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, and Wenjin Yang.

Engineering Team: Junnan Lai, Nianfei Fan, Shufeng Liu, Mengmeng Du, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, and Fei Lu.

Acknowledgements

We sincerely thank Chengzhen Yu, Chong Sun, Chunnuo Gong, Jian Zhang, Qianwei Wang, and Yu Lei (listed alphabetically by first name) for their invaluable support, insightful feedback, and contributions throughout the development of this project.

References

  • [1] Alibaba Cloud (2026) Alibaba launches HappyOyster, a world model product for real-time immersive creation and interaction. Note: Alibaba Cloud Blog Cited by: §5.1.1.
  • [2] AMAP, Alibaba (2023) Yunjing AMAP: AI-powered 3D reconstruction and digital twin platform. Note: https://yunjing.amap.com/Accessed: 2026-07 Cited by: §3.2.1, §3.2.4.
  • [3] J. Bai, M. Xia, X. Fu, X. Wang, L. Mu, J. Cao, Z. Liu, H. Hu, X. Bai, P. Wan, et al. (2025) ReCamMaster: camera-controlled generative rendering from a single video. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 14834–14844. Cited by: §2.4.
  • [4] A. Blattmann, R. Rombach, H. Ling, T. Dockhorn, S. W. Kim, S. Fidler, and K. Kreis (2023) Align your latents: high-resolution video synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 22563–22575. Cited by: §1, §2.1.
  • [5] O. Boer Bohan (2025) TAEHV: tiny AutoEncoder for Hunyuan Video. Note: GitHub repository External Links: Link Cited by: §4.4.2.
  • [6] J. Bruce、M. D. Dennis、A. Edwards、J. Parker-Holder、Y. Shi、E. Hughes、M. Lai、A. Mavalankar、R. Steigerwald、C. Apps 等人(2024)Genie:生成式交互环境。发表于国际机器学习大会(ICML),引用位置:§1、§1。
  • [7] B. Chen、D. Martí Monsó、Y. Du、M. Simchowitz、R. Tedrake 和 V. Sitzmann(2024)Diffusion Forcing:下一 token 预测与全序列扩散的结合。发表于神经信息处理系统进展大会(NeurIPS),引用位置:§2.2、§2.3。
  • [8] G. Chen、D. Li、S. Yang、B. Zhu、B. Tan、M. Wang 等人(2025)SkyReels-V2:无限长度电影生成模型。arXiv 预印本 arXiv:2504.13074。引用位置:§2.3。
  • [9] H. Chen、Y. Zhang、X. Cun、M. Xia、X. Wang、C. Weng 和 Y. Shan(2024)VideoCrafter2:克服数据限制以实现高质量视频扩散模型。发表于 IEEE/CVF 计算机视觉与模式识别大会(CVPR),引用位置:§2.1。
  • [10] J. Chen、H. Zhu、X. He、Y. Wang、J. Zhou、W. Chang、Y. Zhou、Z. Li、Z. Fu、J. Pang 和 T. He(2025)DeepVerse:作为世界模型的 4D 自回归视频生成。arXiv 预印本 arXiv:2506.01103。外部链接:Link,引用位置:§3.2.4。
  • [11] S. Chen、C. Wei、S. Sun、P. Nie、K. Zhou、G. Zhang、M. Yang 和 W. Chen(2026)Context Forcing:长上下文下一致的自回归视频生成。外部链接:2602.06028、Link,引用位置:§2.3。
  • [12] Y. Chen、L. Wang、W. Huang、S. Yang、B. Zhang、Y. Xiao、R. Chu、W. Mao、Q. Hu、S. Liu 等人(2026)LongLive-2.0:面向长视频生成的 NVFP4 并行基础设施。arXiv 预印本 arXiv:2605.18739。引用位置:§2.3、§2.5。
  • [13] L. Contributors(2025)LightX2V:轻量视频生成推理框架。GitHub。注:https://github.com/ModelTC/lightx2v,引用位置:§4.4.3。
  • [14] J. Cui、J. Wu、M. Li、T. Yang、X. Li、R. Wang、A. Bai、Y. Ban 和 C. Hsieh(2025)Self-Forcing++:迈向分钟级高质量视频生成。外部链接:2510.02283、Link,引用位置:§2.3。
  • [15] J. Cui、J. Wu、M. Li、T. Yang、X. Li、R. Wang、A. Bai、Y. Ban 和 C. Hsieh(2026)LoL:比更长还更长,将视频生成扩展到小时级。arXiv 预印本 arXiv:2601.16914。引用位置:§2.3。
  • [16] Decart 与 Etched(2024)《Oasis:Transformer 中的宇宙》。注:https://oasis-model.github.io/ 被引用:§1, §1。
  • [17] R. Feng、H. Zhang、Z. Shu、Z. Yang、L. Tang、Z. Wang、A. Zheng、J. Xiao、Z. Liu、R. Chu 等人(2026)《The Matrix:支持实时移动控制的无限时域世界生成》。神经信息处理系统进展 38,第 87318–87344 页。被引用:§2.4。
  • [18] S. Ge、T. Hayes、H. Yang、X. Yin、G. Pang、D. Jacobs、J. Huang 和 D. Parikh(2022)《基于时间无关 VQGAN 与时间敏感 Transformer 的长视频生成》。载于欧洲计算机视觉会议,第 102–118 页。被引用:§2.2。
  • [19] Google DeepMind(2025)《Genie 3》。注:https://deepmind.google/models/genie/ 被引用:§1, §1, §5.1.1。
  • [20] Y. HaCohen、N. Chiprut、B. Brazowski、D. Shalem、D. Moshe、E. Richardson、E. Levin、G. Shiran、N. Zabari、O. Gordon 等人(2024)《LTX-Video:实时视频潜空间扩散》。arXiv 预印本 arXiv:2501.00103。被引用:§2.5。
  • [21] H. He、Y. Xu、Y. Guo、G. Wetzstein、B. Dai、H. Li 和 C. Yang(2024)《CameraCtrl:为文生视频生成提供相机控制》。arXiv 预印本 arXiv:2404.02101。被引用:§2.4。
  • [22] X. He、C. Peng、Z. Liu、B. Wang、Y. Zhang、Q. Cui、F. Kang、B. Jiang、M. An、Y. Ren 等人(2025)《Matrix-game 2.0:开源实时流式交互世界模型》。arXiv 预印本 arXiv:2508.13009。被引用:§2.4。
  • [23] J. Ho、T. Salimans、A. Gritsenko、W. Chan、M. Norouzi 和 D. J. Fleet(2022)《视频扩散模型》。神经信息处理系统进展 35,第 8633–8646 页。被引用:§1, §2.1, §2.2。
  • [24] W. Hong、M. Ding、W. Zheng、X. Liu 和 J. Tang(2022)《CogVideo:基于 Transformer 的大规模文生视频预训练》。arXiv 预印本 arXiv:2205.15868。被引用:§1, §2.2。
  • [25] Y. Hong、Y. Mei、C. Ge、Y. Xu、Y. Zhou、S. Bi、Y. Hold-Geoffroy、M. Roberts、M. Fisher、E. Shechtman、K. Sunkavalli、F. Liu、Z. Li 和 H. Tan(2025)《RELIC:具备长时记忆的交互式视频世界模型》。arXiv 预印本 arXiv:2512.04040。被引用:§1, §2.4, §2.5。
  • [26] X. Huang、Z. Li、G. He、M. Zhou 和 E. Shechtman(2025)《Self Forcing:弥合自回归视频扩散中的训练-测试差距》。arXiv 预印本 arXiv:2506.08009。引用位置:§2.2、§2.5。
  • [27] Z. Huang、H. Jeong、X. Chen、Y. Gryaditskaya、T. Y. Wang、J. Lasenby 和 C. Huang(2025)《SpaceTimePilot:跨空间与时间的动态场景生成式渲染》。arXiv 预印本 arXiv:2512.25075。引用位置:§2.4。
  • [28] S. A. Jacobs、M. Tanaka、C. Zhang、M. Zhang、S. L. Song、S. Rajbhandari 和 Y. He(2023)《DeepSpeed Ulysses:支持超长序列 Transformer 模型训练的系统优化》。arXiv 预印本 arXiv:2309.14509。引用位置:§2.5。
  • [29] C. M. Jiang、X. Masotto 和 B. Sun(2026)《Waymo 世界模型:自动驾驶仿真的新前沿》。注:Waymo 博客。外部链接:链接。引用位置:§1。
  • [30] Y. Jin、Z. Sun、N. Li、K. Xu、K. Xu、H. Jiang、N. Zhuang、Q. Huang、Y. Song、Y. Mu 和 Z. Lin(2024)《用于高效视频生成建模的金字塔流匹配》。arXiv 预印本 arXiv:2410.05954。引用位置:§2.2。
  • [31] A. Kanervisto、D. Bignell、L. Y. Wen、M. Grayson、R. Georgescu、S. Valcarcel Macua、S. Z. Tan、T. Rashid、T. Pearce、Y. Cao、A. Lemkhenter、C. Jiang、G. Costello、G. Gupta、M. Tot、S. Ishida、T. Gupta、U. Arora、R. W. White、S. Devlin、C. Morrison 和 K. Hofmann(2025)《面向游戏玩法构思的世界与人类动作模型》。Nature 638(8051),第 656–663 页。外部链接:文档、链接。引用位置:§1。
  • [32] J. Kim、J. Kang、J. Choi 和 B. Han(2024)《FIFO-Diffusion:无需训练即可从文本生成无限视频》。收录于《神经信息处理系统进展》(NeurIPS)。引用位置:§2.3。
  • [33] S. W. Kim、Y. Zhou、J. Philion、A. Torralba 和 S. Fidler(2020)《使用 GameGAN 学习模拟动态环境》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR)。引用位置:§1。
  • [34] Y. Kim、Q. Hu、C. J. Kuo 和 P. A. Beerel(2026)《MemRoPE:通过演化记忆 token 实现免训练无限视频生成》。arXiv 预印本 arXiv:2603.12513。引用位置:§2.3。
  • [35] A. Kodaira、T. Hou、J. Hou、M. Georgopoulos、F. Juefei-Xu、M. Tomizuka 和 Y. Zhao(2026)《StreamDiT:实时流式文本生成视频》。外部链接:2507.03745,链接 引用自:§2.3、§2.5。
  • [36] D. Kondratyuk、L. Yu、X. Gu、J. Lezama、J. Huang、G. Schindler、R. Hornung、V. Birodkar、J. Yan、M. Chiu 等人(2024)《VideoPoet:用于零样本视频生成的大语言模型》。发表于国际机器学习大会(ICML),引用自:§1、§2.2。
  • [37] W. Kong、Q. Tian、Z. Zhang、R. Min、Z. Dai、J. Zhou、J. Xiong、X. Li、B. Wu、J. Zhang 等人(2024)《HunyuanVideo:大型视频生成模型的系统框架》。arXiv 预印本 arXiv:2412.03603。引用自:§1、§2.1。
  • [38] C. Li、Y. Yang、J. Shao、H. Zhou、K. Schwarz 和 Y. Liao(2026)《ReRoPE:将 RoPE 重新用于相对相机控制》。arXiv 预印本 arXiv:2602.08068。引用自:§2.4。
  • [39] J. Li、X. Fu、X. Peng、W. Chen、Y. Zheng、T. Zhao、J. Wang、F. Chen、X. Wang 和 H. K. So(2026)《短训练、长推理:自回归视频生成的无训练时域扩展》。arXiv 预印本 arXiv:2602.14027。引用自:§2.3。
  • [40] R. Li、B. Yi、J. Liu、H. Gao、Y. Ma 和 A. Kanazawa(2026)《相机作为相对位置编码》。神经信息处理系统进展 38,第 15984–16009 页。引用自:§2.4。
  • [41] S. Lin、C. Yang、H. He、J. Jiang、Y. Ren、X. Xia、Y. Zhao、X. Xiao 和 L. Jiang(2026)《自回归对抗式后训练用于实时交互式视频生成》。神经信息处理系统进展 38,第 41061–41086 页。引用自:§2.5。
  • [42] Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2022)《用于生成建模的流匹配》。arXiv 预印本 arXiv:2210.02747。引用自:§2.2。
  • [43] J. Liu、X. Liu、K. Mei、Y. Wen、M. Yang 和 W. Liu(2026)《通过对角蒸馏实现流式自回归视频生成》。发表于 ICLR,引用自:§2.3。
  • [44] K. Liu、W. Hu、J. Xu、Y. Shan 和 S. Lu(2025)《滚动强制:实时自回归长视频扩散》。arXiv 预印本 arXiv:2509.25161。引用自:§2.2、§2.3。
  • [45] X. Liu、C. Gong 和 Q. Liu(2022)《Flow straight and fast: learning to generate and transfer data with rectified flow》。arXiv 预印本 arXiv:2209.03003。引用位置:§2.2。
  • [46] H. Lu、G. Yang、N. Fei、Y. Huo、Z. Lu、P. Luo 和 M. Ding(2024)《VDT: general-purpose video diffusion transformers via mask modeling》。发表于国际学习表征会议(ICLR),外部链接:Link。引用位置:§2.1。
  • [47] G. Ma、H. Huang、K. Yan、L. Chen、N. Duan、S. Yin、C. Wan、R. Ming、X. Song、X. Chen 等人(2025)《Step-Video-T2V 技术报告:视频基础模型的实践、挑战与未来》。arXiv 预印本 arXiv:2502.10248。引用位置:§2.1。
  • [48] X. Ma、Y. Wang、G. Jia、X. Chen、Z. Liu、Y. Li、C. Chen 和 Y. Qiao(2024)《Latte: latent diffusion transformer for video generation》。arXiv 预印本 arXiv:2401.03048。引用位置:§2.1。
  • [49] Y. Ma、X. Wu、K. Sun 和 H. Li(2025)《HPSv3: towards wide-spectrum human preference score》。发表于 IEEE/CVF 国际计算机视觉会议(ICCV)论文集,第 15086–15095 页。引用位置:§5.2。
  • [50] X. Mao、S. Rui、K. Ying、B. Zheng、C. Li、M. Chi 和 K. Zhang(2026)《PackForcing: short video training suffices for long video sampling and long context inference》。arXiv 预印本 arXiv:2603.25730。引用位置:§2.3。
  • [51] NVIDIA、N. Agarwal 等人(2025)《Cosmos world foundation model platform for physical AI》。arXiv 预印本 arXiv:2501.03575。引用位置:§1、§1。
  • [52] J. Parker-Holder、P. Ball、J. Bruce、V. Dasagi、K. Holsheimer、C. Kaplanis、A. Moufarek、G. Scully、J. Shar、J. Shi 等人(2024)《Genie 2: a large-scale foundation world model》。备注:Google DeepMind 博客。外部链接:Link。引用位置:§1、§2.4。
  • [53] A. Polyak、A. Zohar、A. Brown、A. Tjandra、A. Sinha、A. Lee、A. Vyas、B. Shi、C. Ma、C. Chuang 等人(2024)《Movie Gen: a cast of media foundation models》。arXiv 预印本 arXiv:2410.13720。引用位置:§1、§2.1。
  • [54] Robbyant Team、Z. Gao、Q. Wang、Y. Zeng、J. Zhu、K. L. Cheng、Y. Li、H. Wang、Y. Xu、S. Ma 等人(2026)《Advancing open-source world models》。arXiv 预印本 arXiv:2601.20540。外部链接:Link。引用位置:§5.1.1。
  • [55] Runway(2025)《Introducing GWM-1》。备注:Runway Research。外部链接:Link。引用位置:§1。
  • [56] J. Shin、Z. Li、R. Zhang、J. Zhu、J. Park、E. Shechtman 和 X. Huang(2025)MotionStream:具有交互式运动控制的实时视频生成。arXiv 预印本 arXiv:2511.01266。引用自:§2.5。
  • [57] U. Singer、A. Polyak、T. Hayes、X. Yin、J. An、S. Zhang、Q. Hu、H. Yang、O. Ashual、O. Gafni 等人(2022)Make-A-Video:无需文本-视频数据的文本到视频生成。arXiv 预印本 arXiv:2209.14792。引用自:§1、§2.1。
  • [58] Y. Song、P. Dhariwal、M. Chen 和 I. Sutskever(2023)一致性模型。发表于国际机器学习大会(ICML),第 32211–32252 页。引用自:§2.5。
  • [59] M. Sun、L. Tang、Y. Liu、X. Yan、Z. Li、Y. Zhang、F. Yu、Z. Ge、Y. Liu、J. Zhang 等人(2026)ABot-3DWorld 0:探索任意 3D 空间的通用世界模型。arXiv 预印本 arXiv:2607.11673。引用自:§3.2.1、§3.2.4。
  • [60] M. Sun、W. Wang、G. Li、J. Liu、J. Sun、W. Feng、S. Lao、S. Zhou、Q. He 和 J. Liu(2025)AR-Diffusion:基于自回归扩散的异步视频生成。外部链接:2503.07418,链接。引用自:§2.3。
  • [61] Team Wan(2025)Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314。引用自:§1、§2.1、§4.2。
  • [62] 腾讯混元(2025)HY-World 1.5:具有实时延迟和几何一致性的交互式世界建模系统框架。腾讯混元技术报告。外部链接:链接。引用自:§5.1.1。
  • [63] H. Teng、H. Jia、L. Sun、L. Li、M. Li、M. Tang、S. Han、T. Zhang、W. Zhang、W. Luo 等人(2025)MAGI-1:大规模自回归视频生成。arXiv 预印本 arXiv:2505.13211。引用自:§2.5。
  • [64] D. Valevski、Y. Leviathan、M. Arar 和 S. Fruchter(2025)扩散模型是实时游戏引擎。发表于国际学习表征会议(ICLR),外部链接:2408.14837,链接。引用自:§1、§1、§2.5。
  • [65] B. Van Hoorick、R. Wu、E. Ozguroglu、K. Sargent、R. Liu、P. Tokmakov、A. Dave、C. Zheng 和 C. Vondrick(2024)生成式相机移动:极端的单目动态新视角合成。发表于欧洲计算机视觉会议(ECCV),第 313–331 页。引用自:§2.4。
  • [66] R. Villegas、M. Babaeizadeh、P. Kindermans、H. Moraldo、H. Zhang、M. T. Saffar、S. Castro、J. Kunze 和 D. Erhan(2023)《Phenaki:基于开放域文本描述的可变长度视频生成》,发表于国际学习表征会议(ICLR),引用自:§1。
  • [67] Y. Wang、Q. Zhang、S. Cai、T. Wu、J. Ackermann、Z. Kuang、Y. Zheng、F. Rajič、S. Tang 和 G. Wetzstein(2026)《BulletTime:视频生成中时间与相机位姿的解耦控制》,发表于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 18319–18330 页。引用自:§2.4。
  • [68] Z. Wang、Z. Yuan、X. Wang、Y. Li、T. Chen、M. Xia、P. Luo 和 Y. Shan(2024)《MotionCtrl:用于视频生成的统一且灵活的运动控制器》,发表于 ACM SIGGRAPH 2024 会议论文,第 1–11 页。引用自:§2.4。
  • [69] C. Wu、L. Huang、Q. Zhang、B. Li、L. Ji、F. Yang、G. Sapiro 和 N. Duan(2021)《GODIVA:从自然语言描述生成开放域视频》,arXiv 预印本 arXiv:2104.14806。引用自:§2.2。
  • [70] H. Xi、S. Yang、Y. Zhao、M. Li、H. Cai、X. Li、Y. Lin、Z. Zhang、J. Zhang、X. Li 等人(2026)《Quant VideoGen:基于 2 位 KV-Cache 量化的自回归长视频生成》,arXiv 预印本 arXiv:2602.02958。引用自:§2.5。
  • [71] D. Xie、Z. Xu、Y. Hong、H. Tan、D. Liu、F. Liu、A. Kaufman 和 Y. Zhou(2025)《渐进式自回归视频扩散模型》,外部链接:2410.08151,链接。引用自:§2.3。
  • [72] T. Xu、J. Sui、Z. Gao、K. Shi、W. Yang、Z. Liu、Z. Sun、M. Sun、H. Pan、F. Jiang、M. Xu、Q. Fan、Y. Gao、Y. Li 和 B. Chen(2026)《WorldRoamBench:交互式世界模型长时程稳定性的开放世界基准》,外部链接:2606.31672,链接。引用自:§5.1。
  • [73] W. Yan、Y. Zhang、P. Abbeel 和 A. Srinivas(2021)《VideoGPT:使用 VQ-VAE 和 Transformer 的视频生成》,arXiv 预印本 arXiv:2104.10157。引用自:§2.2。
  • [74] J. Yang、J. Wu、Y. Ding、Z. Xu、Y. Wang 和 G. Pekhimenko(2026)《SwiftFusion:面向 GPU 上扩散 Transformer 分布式推理的可扩展序列并行》。收录于《ACM 人工智能与智能体系统会议论文集》,CAIS '26,美国纽约州纽约市,第 1037–1050 页。外部链接:ISBN 9798400724152,链接,文档。被引用:§2.5。
  • [75] S. Yang、W. Huang、R. Chu、Y. Xiao、Y. Zhao、X. Wang、M. Li、E. Xie、Y. Chen、Y. Lu 等人(2025)《LongLive:实时交互式长视频生成》。arXiv 预印本 arXiv:2509.22622。被引用:§2.3、§2.5。
  • [76] Z. Yang、J. Teng、W. Zheng、M. Ding、S. Huang、J. Xu、Y. Yang、W. Hong、X. Zhang、G. Feng 等人(2024)《CogVideoX:基于专家 Transformer 的文本到视频扩散模型》。arXiv 预印本 arXiv:2408.06072。被引用:§2.1。
  • [77] J. Yi、W. Jang、P. H. Cho、J. Nam、H. Yoon 和 S. Kim(2025)《Deep Forcing:基于深度汇聚与参与式压缩的无训练长视频生成》。arXiv 预印本 arXiv:2512.05081。外部链接:链接。被引用:§2.3。
  • [78] T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024)《改进的分布匹配蒸馏用于快速图像合成》。《神经信息处理系统进展》37,第 47455–47487 页。被引用:§2.5。
  • [79] T. Yin、M. Gharbi、R. Zhang、E. Shechtman、F. Durand、W. T. Freeman 和 T. Park(2024)《基于分布匹配蒸馏的单步生成》。收录于《IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集》。被引用:§2.5、§4.3.3。
  • [80] T. Yin、Q. Zhang、R. Zhang、W. T. Freeman、F. Durand、E. Shechtman 和 X. Huang(2025)《从慢速双向到快速自回归视频扩散模型》。收录于《IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集》,第 22963–22974 页。被引用:§2.2、§2.5。
  • [81] A. Zandieh、M. Daliri、M. Hadian 和 V. Mirrokni(2025)《TurboQuant:具有近最优失真率的在线向量量化》。arXiv 预印本 arXiv:2504.19874。被引用:§4.4.3。
  • [82] H. Zhang、K. Chen、Z. Zhang、H. H. Chen、Y. Lyu、Y. Zhang、S. Yang、K. Zhou 和 Y. Chen(2025)《DualCamCtrl:用于几何感知相机控制视频生成的双分支扩散模型》。arXiv 预印本 arXiv:2511.23127。引用位置:§2.4。
  • [83] J. Zhang、H. Huang、P. Zhang、J. Wei、J. Zhu 和 J. Chen(2024)《SageAttention2:通过彻底离群值平滑与每线程 INT4 量化实现高效注意力》。arXiv 预印本 arXiv:2411.10958。引用位置:§4.4.3。
  • [84] L. Zhang(2025)《FramePack:基于帧上下文打包的实用视频扩散》。注:GitHub 仓库 外部链接:链接 引用位置:§4.4.2。
  • [85] Z. Zhao、Y. Lu、Z. Liu、J. Song、J. Deng 和 I. Patras(2026)《Relax Forcing:用于一致长视频生成的松弛 KV 内存》。arXiv 预印本 arXiv:2603.21366。引用位置:§2.3。
  • [86] J. Zhou、H. Gao、V. Voleti、A. Vasishta、C. Yao、M. Boss、P. Torr、C. Rupprecht 和 V. Jampani(2025)《Stable Virtual Camera:基于扩散模型的生成式视图合成》。载于《IEEE/CVF 国际计算机视觉大会论文集》,第 12405–12414 页。引用位置:§2.4。
  • [87] H. Zhu、M. Zhao、G. He、H. Su、C. Li 和 J. Zhu(2026)《Causal Forcing:正确实现自回归扩散蒸馏,用于高质量实时交互式视频生成》。载于《国际机器学习大会(ICML)》,注:arXiv:2602.02214。引用位置:§2.3、§5.2。
  • [88] K. Zou、D. Zheng、H. Liu、T. Hang、B. Liu 和 N. Yu(2026)《HiAR:通过分层去噪实现高效自回归长视频生成》。外部链接:2603.08703,链接。引用位置:§2.3。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org