1 引言
人工智能正从生成静态内容迈向生成可进入、可控制且可持续演化的世界。其目标并非生成一系列视觉上合理的片段,而是构建一个持久的生成式环境:在该环境中,动作会改变状态,由此产生的观察结果会指导后续动作,且随着交互的持续,世界始终保持连贯一致。因此,世界模型[33, 6, 19, 64, 16, 51, 25]是迈向通用模拟器的一步:它们必须表征世界的当前状态,预测其在干预下如何演化,并为规划、学习、创造和具身智能提供基础。这是一项系统层面的挑战,而非单一的生成目标。视觉保真度固然必要,但可控性、状态持久性、展开稳定性、延迟、吞吐量和内存占用必须协同优化。大规模视频生成[23, 57, 24, 4, 66, 36, 37, 53, 61]的快速发展提供了日益强大的视觉与动态先验知识,然而,要将这些先验知识转化为响应迅速、可访问的世界,就必须解决闭环问题。
近期已有多个系统在推动这一议程的关键部分。Genie [6] 展示了如何通过推断的潜在动作,从互联网游戏视频中学习可交互环境;而 Genie 2 和 Genie 3 [52, 19] 则进一步证明了更强大的实时动态环境能力。GameNGen [64]、Oasis [16]、WHAM [31]、Runway GWM [55]、Cosmos [51] 和 Waymo World Model [29] 则在游戏、开放世界、物理 AI 和自动驾驶等设计空间的不同方向进行了探索。然而,仅靠扩展视频模型规模,无法解决交互式世界建模中相互耦合的四大瓶颈:获取具有广泛覆盖、时间一致且带有可靠动作监督的数据;在相机导航和具身角色控制两方面同时表达用户意图;防止生成的历史序列在作为下一轮输入时发生漂移;以及在实用硬件上以交互速度部署完整的生成与解码流程。一个系统可能在某一维度上表现强劲,但作为本地、持久的世界模拟器却仍不可用。
数据问题尤为根本。被动式互联网视频提供了视觉多样性,但很少包含同步的控制信号;游戏录像能提供精确的输入,但风格可能较为局限;仿真环境能提供几何结构和可控性,但需要精心设计轨迹。我们将这些来源视为互补而非可互换。我们的数据基础设施融合了 AAA 级游戏数据、仿真引擎数据和真实世界的互联网视频。WorldExplorer 是一个由智能体驱动的采集系统,能够生成同步的多模态游戏与仿真轨迹,并根据训练反馈动态调整采集重点。随后,一个感知来源但统一的处理流水线会执行 14 项确定性检查(覆盖六个质量维度)、基于 VLM 的语义评估、动作标注和结构化语言标注。这使得数据集构建成为世界模型开发中的一个闭环环节:数据分布并非一次性采集完成,而是被主动塑造,以暴露模型在运动、视角、环境和动作模式等方面仍然薄弱的环节。
我们在此基础设施上构建了 ABot-World-0,这是一个以动作条件驱动的视频世界模型,旨在作为控制-一致性-效率耦合的端到端解决方案。该模型采用统一的、帧同步的键盘动作接口,而非独立的潜在动作接口;在数据构建阶段,源生控制与姿态导出的伪动作被映射到同一动作空间,用户在推理时可直接使用该空间。统一的动作表示涵盖了观察者式的场景漫游和演员式的角色运动,而参考角色记忆则为长时间第三人称推演提供了持久的外观信息。这些设计选择使得控制通道成为动力学模型本身的一部分,而非外部后处理接口。
学习流程将视觉动力学质量与在线所需的因果约束分离开来。我们首先在多源动作-视频语料库上训练一个双向教师模型,其中全范围生成为动作条件动力学提供了高质量目标。随后,通过教师强制和 ODE 蒸馏,我们逐步将其转化为因果学生模型,在降低去噪预算的同时保留了可部署的信息模式。关键在于,局部蒸馏本身无法解决闭环生成问题:学生的每一次预测都会改变后续预测的视觉上下文,导致短时训练状态与长时推理状态之间的失配日益加剧。我们引入了 LongForcing,这是一个最终的分布匹配阶段,通过扩展时域的双向教师模型来监督学生的长时自推演。通过对学生自推演施加分布级别的监督,LongForcing 为短时目标仅能微弱覆盖的长时推演上下文提供了修正信号。
实时交互还需要系统层面的协同设计,而不仅仅是几步采样。ABot-World-0 将其因果模型与轻量级 VAE 解码器、内存感知模块调度、低比特 DiT 推理、高效低精度注意力机制以及有界局部上下文 KV 缓存相结合。在其优化的低比特运行范围内,最终的 720P 流式处理管线在单张 NVIDIA RTX 5090 上,峰值显存预算约为 19 GiB 的条件下,可实现高达 16 FPS 的帧率,且动作到首帧延迟为 1.2 秒。所报告的延迟涵盖了从接收用户动作到生成首个解码响应帧的完整生成与解码路径,而非孤立地报告采样速度。
我们的贡献有四个方面:
- •
我们提出了 ABot-World-0,这是一个统一的、以动作条件驱动的视频世界模型,它利用原始键盘输入来支持场景漫游和角色控制,并在第三人称交互过程中,通过参考角色记忆提供补充的外观线索。
- •
我们为交互式世界建模开发了一个多源数据基础设施,包括 WorldExplorer 的训练反馈驱动收集循环、同步多模态采集、多阶段质量控制以及统一的动作和文本标注。
- •
我们引入了一种渐进式的双向到因果训练流程以及 LongForcing 技术,该技术将分布级别的教师监督扩展到长时间的学生自回归生成,以减轻累积的自回归漂移。
- •
我们展示了一个面向部署的流式处理栈,其优化的低比特运行范围可在单张 RTX 5090 上,峰值显存预算约为 19 GiB 的条件下,以高达 16 FPS 的帧率输出 720P 画面,动作到首帧延迟为 1.2 秒。我们在 WorldRoamBench 上,结合扩展的交互式自回归生成,评估了其可控性、视觉质量、物理合理性和时序记忆能力。
这些组件共同将交互式世界建模定义为一整套全栈能力,而不仅仅是单一的生成目标。ABot-World-0 是迈向本地视觉模拟器的一步,这类模拟器可以被持续探索、控制和改进,以服务于交互式创作、智能体学习和具身 AI 研究。
2 相关工作
2.1 双向视频生成
生成式建模的最新进展极大地提升了视频合成的质量,扩散模型已成为主流范式[23, 57, 4]。早期的视频扩散模型普遍采用基于 U-Net 的架构,而近期方法越来越多地使用配备时空注意力机制的扩散 Transformer [46, 48, 37, 53, 47, 76]。通过在整个片段上建模空间和时间依赖关系,这些方法[37, 61, 9]在视觉质量和时间连贯性方面取得了强劲表现。这种全片段双向建模也非常适用于插帧、填充和有界生成等需要同时考虑多个时间约束的任务。
然而,这种全片段建模通常通过双向注意力机制实现,其中每一帧都能访问过去和未来的上下文。虽然这种设计有利于时间一致性,但它将整个序列中的各帧耦合在一起,使得在低延迟或流式场景中难以逐步生成和输出帧。这一局限性促使了近期因果或自回归视频扩散方法的出现,这些方法试图将双向视频扩散模型转换或蒸馏为顺序生成器,以牺牲部分全局上下文为代价,换取更高效的在线生成能力。
2.2 自回归视频生成
为克服非因果模型的局限性,自回归(AR)视频生成方法[69, 24, 18, 36, 73]按顺序逐帧生成,每个新片段仅以先前生成的内容为条件。通过施加因果约束,这些方法实现了低延迟流式传输,并且当与有界上下文或缓存配合使用时,可减少长视频合成相关的内存开销。早期的自回归模型主要依赖基于离散 token 的 Transformer,而近期工作[7, 30, 80, 26, 44]已将因果结构融入扩散和流匹配框架[42, 23, 45]中,以实现更优的视觉质量。
自回归生成的因果结构使其非常适合实际的长视频合成,因为它支持流式生成。这使得自回归生成成为可扩展视频生成的一种有吸引力的范式。因此,在本工作中,我们聚焦于自回归范式,并应对提升长程稳定性的关键挑战。
2.3 长视频生成
自回归模型在超出训练范围后会出现漂移,表现为在少量自回归迭代后,质量逐步退化、身份一致性丢失、运动停滞或坍缩为静态帧。
时间漂移与自回归迭代中的曝光偏差和误差累积密切相关。为缓解这一问题,Diffusion Forcing [7]、PA-VDM [71] 和 Rolling Forcing [44] 等方法在训练期间采用异构噪声调度 [8, 60, 35],而 FIFO-Diffusion [32] 等免训练方法则通过滑动潜变量窗口扩展预训练模型,但若无显式的迭代对齐,最终仍会出现退化。此外,Self-Forcing 及其变体(如 LongLive [75]、Self-Forcing++ [14])利用因果注意力、KV 缓存重利用和知识蒸馏,在模型自身的迭代分布下对其进行监督,以实现长视频生成。后续工作进一步解决了细粒度不匹配问题:Causal Forcing [87] 处理双向教师模型与因果学生模型之间的架构差距,Context Forcing [11] 利用长上下文教师模型与慢-快记忆机制,HiAR [88] 在匹配的噪声水平下进行分层去噪,Diagonal Distillation [43] 则联合优化时间块与去噪步骤。在本工作中,我们采用渐进式双向到因果的流水线:在长动作条件序列上训练的教师模型提供高质量的动态监督,而 LongForcing 将该监督扩展到学生模型的长自回归迭代中,以减少累积漂移。
即便采用了与 rollout 对齐的目标函数,长程漂移依然存在,因为对完整历史进行密集注意力计算是不可行的。虽然对滑动窗口或 KV cache 进行简单截断常常导致身份丢失和运动停滞,但近期以记忆为中心的方法通过 RoPE 稳定化、深层注意力汇聚、结构化 KV 记忆 [15, 77, 85, 34] 改善了稳定性。LongLive-2.0 [12] 进一步利用多轮注意力汇聚,在提示词切换时保持身份一致性,而无需训练的方法(例如 FLEX [39]、PackForcing [50])则通过位置校正或缓存分区来缓解漂移。因此,长视频生成已从单纯的扩散模型因果化,演变为一个涵盖 rollout 对齐、记忆设计、位置外推、知识蒸馏和高效部署的综合挑战。
2.4 交互式视频生成
交互式视频生成根据用户动作来调控视频动态,为交互式世界、类游戏模拟器和具身 AI 基准测试 [52, 17, 22, 25] 奠定了基础。一种常见方法是用专用网络 [68, 3, 27] 编码六自由度相机外参,另一种方法则注入与潜在 token 对齐的密集普吕克射线图或视锥特征 [65, 21, 82, 86]。这些方法通常使用全局或初始帧坐标系中的校准轨迹来表示相机运动。在长 rollout 过程中,累积的位姿可能超出训练分布范围,而周期性重新锚定则可能在时间片段间引入不一致性。相机感知的位置编码方法 [40, 38, 67] 将相机几何或位姿融入 token 位置表示中。相比之下,我们的方法基于离散键盘动作来生成条件,这些动作指定了角色移动和相机运动的局部增量控制,而非校准后的全局相机轨迹。这些动作是相对于当前角色或相机状态来解读的,并取自一个固定的动作空间,从而使得控制表示保持有界,并在长程 rollout [17, 22, 25] 过程中与实时用户交互自然对齐。
2.5 实时视频生成
实时交互式视频生成受两个耦合指标的制约:延迟(用户操作与对应视觉更新之间的延迟)和吞吐量(系统在长时间运行中能维持的持续帧率)[25, 41, 75, 20]。延迟主要取决于去噪预算和生成的时间单元,因为标准扩散模型每帧需要多次评分网络传递,而蒸馏后的少步模型 [79, 78, 58, 80, 26, 41, 75, 12] 降低了这一成本。逐帧自回归设计 [80, 64, 75] 将操作到像素的延迟降至最低,因为每次新控制都能影响紧接着生成的下一帧。然而,它们每帧需要一个完整的去噪周期,这严重限制了吞吐量,并增加了整个运行过程中的顺序依赖性。分块生成 [63, 35, 56] 则联合去噪一个帧块,通过分摊注意力和 VAE 解码来实现更高的 FPS 和更强的短时时间连贯性,代价是当前块内存在有限的控制延迟。吞吐量则取决于每个时间单元生成和解码的效率:在每块内跨多帧分摊注意力和 VAE 解码可提高 FPS,而低位宽权重和 KV 缓存 [70, 12]、内核融合以及序列或张量并行 [25, 28, 74] 可减少内存和计算开销。异步流式解码 [12] 还能将生成与显示重叠。在这项工作中,我们倡导一种面向部署的交互式视频生成方案,该方案联合优化延迟、吞吐量和内存效率。我们的方法采用分块流式流水线,并辅以渐进式视觉交付。通过协同设计轻量级 VAE 解码、内存感知调度、低位宽 DiT 推理、高效注意力机制和优化的位置编码,我们优化的部署方案能够在单张 NVIDIA RTX 5090 桌面级 GPU 上,在约 的峰值 VRAM 预算内,支持 720P 交互式流媒体,实现 的操作到首帧延迟。
3 数据基础设施
3.1 概述
ABot-World 将数据生产视为模型开发中不可分割的一部分,而非一次性的预处理阶段。构建一个高保真、动作可控的世界模型,从根本上依赖于覆盖多样化环境、视角和运动模式的大规模、高质量训练数据。我们的训练语料库来自三个互补来源:AAA 游戏数据、仿真引擎数据和真实世界互联网数据。每个来源的详细特征和采集方法将在第 3.2 节中描述。
如图 2 所示,我们的数据基础设施通过三个渐进阶段处理所有三个来源的数据:
采集。游戏和仿真数据通过我们统一的智能体驱动系统 WorldExplorer(第 3.2.2 节)进行采集,该系统能够在虚拟环境中导航,并捕获带有闭环训练反馈的同步多模态信号。互联网数据则经过一个独立的视频分割和姿态估计流水线(第 3.2.5 节)进行处理。
质量过滤。原始采集数据经过一个多阶段过滤流水线(第 3.3 节),该流水线结合了涵盖六个质量维度的 14 项确定性信号检查与基于视觉语言模型(VLM)的语义评估,从而剔除存在技术缺陷和语义无效的样本。
标注。通过筛选的视频片段会被添加上动作标签、结构化的自然语言场景描述以及语义标签(第 3.4 节),以用于动作条件和文本条件训练。该流水线遵循统一的、与来源无关的采集和处理设计,同时在可用时保留来源原生的原始控制信号,并将特定来源的动作信息转换为用于模型训练的规范表示。
我们的数据基础设施与现有方法相比,具有三个关键优势:
- •
全自动化智能体驱动的数据采集,结合训练反馈驱动的自适应再平衡,将数据生产从被动的批量处理转变为与训练目标紧密耦合的主动伺服系统。
- •
一套全面的质量控制流水线——涵盖六个质量维度的14项独立检查,并辅以基于视觉语言模型的语义评估——被系统性地应用,以最大化有效数据比率。
- •
将确定性动作标注(通过直接API访问和轨迹设计,用于游戏和仿真数据)与统一的多源处理流程相结合,可提供高质量标签,而真实世界视频则通过姿态估计生成的伪标签贡献多样性。
3.2 数据采集
3.2.1 数据源与采集范式
我们的训练数据涵盖三个互补来源。AAA级游戏数据提供丰富、高保真的3D环境,以及精确同步的动作与观测信号,但固有地局限于特定游戏作品和视觉风格。仿真引擎数据提供几何精确的合成数据,带有确定性动作标签和完全的环境控制;值得注意的是,我们通过ABot-3DGS [2, 59] 重建的街道航拍和街景扫描数据,生成了源自专有非公开资产的逼真真实世界场景。真实世界互联网数据引入了自然的相机动态、多样化的光照以及难以通过合成方式复现的领域泛化信号,但缺乏真实动作标签,需要依赖有噪声的姿态估计。
针对交互式环境数据收集,目前已发展出三种范式,各有不同的权衡取舍。人工录制(人类玩家操作)能产生真实、自然的行为,但存在严重的可扩展性瓶颈、轨迹碎片化以及高昂的人力成本。基于规则的自动化收集(在游戏和仿真环境中执行脚本化探索)能以确定性标注持续运行,边际成本低,但其根本受限于预设脚本——无法自主发现新场景、无法根据训练反馈调整策略,也无法动态平衡数据分布。智能体驱动式收集,即让强化学习或模仿学习智能体自主导航交互环境,能够实现有目的、有目标的探索,并大规模生成平滑连续的轨迹,但容易陷入探索范围狭窄或奖励黑客攻击的失败模式,且从根本上不适用于互联网视频等被动消费的数据。
3.2.2 WorldExplorer:数据闭环收集系统
为克服现有范式的局限性——尤其是基于规则脚本的僵化性,以及传统智能体驱动方法中探索范围狭窄、缺乏训练反馈的问题——我们开发了 WorldExplorer,这是一个统一的智能体驱动收集系统,适用于游戏和仿真环境。WorldExplorer 提供模块化、与环境无关的架构,并为每种后端配备特定源适配器,包含四个核心组件。
导航智能体。导航智能体通过多阶段目标选择策略自主遍历虚拟环境,逐步放宽探索标准——从优先探索完全未涉足的区域,到搜索附近区域,再到带有碰撞检测的前进回退机制——从而以低重复率实现高场景覆盖率。该策略适用于任何具有可导航网格的交互式虚拟环境,无论是实时游戏世界还是重建的 3DGS 场景。
并行采集管线。视频帧、相机参数(位置、旋转、视场角、焦距)、控制输入、环境状态及元数据通过并行管线同步获取。所有模态通过毫秒级精度时间戳实现同步,跨模态对齐误差低于指定阈值,每次录制会话事后被分割为训练片段。
任务模板系统。采集过程被组织为结构化任务类别,以确保行为分布完整性——涵盖标准导航、自由探索、地标聚焦观察,以及针对自然交互中罕见但对稳健训练至关重要的长尾场景的定向覆盖。场景配置沿多个维度参数化——地理、天气、时段、交通密度、视角模式及车辆类型——从而实现对数据分布的精细控制。
训练反馈驱动的闭环。WorldExplorer 最显著的特征是其闭环、分布感知设计。该系统并非采用固定采集比例运行,而是通过训练监控模块持续追踪各类别性能指标,由弱点诊断组件通过跨维度评分识别表现不佳的场景-动作组合,再由自适应策略生成器在维持最低覆盖下限以防止灾难性遗忘的同时更新采集比例。智能体通过加权任务模板选择与实时场景参数调整实现动态自适应,全程无需人工干预。完整闭环——训练反馈→弱点诊断→策略自适应→智能体主导生产——将数据采集从被动批量生产转变为主动智能伺服系统,在整个模型开发生命周期中与训练目标紧密耦合。
3.2.3 游戏数据采集
游戏数据构成了我们训练语料库中首要且规模最大的来源。WorldExplorer 被应用于多款涵盖不同品类(开放世界探索、城市驾驶、马术穿越)的 3A 大作,自然覆盖了第一人称和第三人称两种视角。与我们统一、数据驱动的训练范式一致,该流程在同一个采集与处理框架内同时支持第一人称和第三人称视角,同时在适用情况下保留视角特定的标注信息。这种设计使得单一模型架构能够学习两种视角下以动作为条件的动态变化,而无需为每种视角单独训练模型。每次录制会话都会生成 1920×1080 分辨率的 RGB 视频,同时同步记录每帧的相机位姿、控制信号和环境元数据。
游戏数据的一个独特优势在于其天然提供的视角多样性。第一人称视角提供与相机光轴高度对齐的直接自运动信号,而第三人称视角则提供可观察的角色动态及周围空间上下文,从而丰富模型对智能体-环境交互的理解。此外,直接通过 API 访问消除了基于位姿估计的方法中固有的标注噪声,使游戏数据成为我们训练语料库中质量最高的监督信号。
源生控制信号直接从游戏运行时 API 捕获,具备真实标注精度,并与每一帧视频同步。随后,这些特定于来源的控制信号会被转换为数据流程中使用的标准动作表示。
3.2.4 仿真数据采集
为了增强轨迹多样性,并提供游戏录像无法提供的几何监督信号[10],我们构建了一个合成流水线,使用两个互补的渲染后端:用于实现完全环境控制下的逼真场景渲染的虚幻引擎(UE),以及由 ABot-3DGS [2, 59] 驱动的 3D 高斯泼溅(3DGS)后端。ABot-3DGS 能够从多视角图像中重建高度逼真的场景——可选择性地接受 LiDAR 和预处理后的摄影测量点云作为几何先验——并将其应用于我们专有的航拍影像和街景扫描数据,以生成大规模户外城市场景和海量室内场景覆盖。这些几何精确的真实世界场景表示源自专有的、非公开资产。
WorldExplorer 通过两种互补模式在这些 3D 资产上执行轨迹:(a)程序化路径生成,采用多点插值的几何模式合成;(b)真实世界轨迹导入,将从物理设备捕获的运动路径映射到 3D 场景中,保留真实的人类浏览行为,例如重复扫描和自然的手持抖动。每条轨迹在渲染前都会进行碰撞检测,动作标签通过将平移和旋转位移投影到相机基向量上,并将其二值化为离散动作信号来确定性推导,从而生成帧对齐的标注。
3.2.5 互联网数据收集
对于真实世界的互联网数据,基于智能体的采集方法并不适用,因为这类内容是用户被动消费而非交互式生成的。我们转而采用基于视频的流水线,从包括驾驶录像、步行游览和航拍视频在内的多样化互联网来源中提取训练信号。原始视频首先根据场景边界和内容连贯性被分割成训练片段,确保每个片段捕捉到一致的环境或活动。随后,通过姿态估计方法恢复出六自由度相机轨迹作为伪标签——这些方法根据室内/室外场景、静态/动态内容以及纹理丰富度等场景特征进行选择——以应对互联网视频中遇到的多样化视觉条件。
动作意图标签通过将帧间平移和旋转位移投影到相机基向量上,并利用阈值进行二值化处理而得到,从而生成与视频帧对齐的离散动作信号。尽管这些伪标签带有游戏和仿真数据中不存在的估计噪声,但互联网数据通过引入自然相机动态、真实世界光照变化以及难以通过合成方式复现的领域泛化信号,极大地扩展了训练多样性。
3.3 质量过滤
原始采集数据不可避免地包含质量问题,从技术性瑕疵(丢帧、分辨率不匹配)到语义性问题(用户界面叠加、死亡序列、几何故障)不一而足。我们实现了一个统一的多阶段过滤流水线,包含跨六个质量维度的14项独立检查——(1) 文件完整性、(2) 视觉有效性、(3) 几何一致性、(4) 游戏状态正确性、(5) 动作标签对齐性、(6) 元数据质量——并辅以基于VLM的语义评估,以生成最终可用于训练的数据集。该流水线分三个阶段渐进式运行,每个阶段处理不同类别的质量问题。检查按顺序执行——早期阶段的格式验证能够在进行计算密集型分析之前实现快速拒绝。
第一阶段:文件完整性。通过快速确定性检查——文件对是否存在、帧数一致性、分辨率合规性、丢帧检测——以高吞吐量剔除存在根本缺陷的录制内容。格式级别的错误会触发片段级拒绝,因为这些错误会使样本无法用于后续基于动作条件的模型训练。
第二阶段:视觉有效性、几何一致性与游戏状态正确性。内容级分析通过基于 VLM 的筛选(用户界面叠加层、加载画面、弹窗、渲染异常)、几何异常检测(地形穿透的垂直位移跳跃、摄像机穿模分析)、游戏状态信号处理(死亡序列切除、过场动画和地图边界移除)以及动作标签对齐验证,检测语义无效片段。第三人称角色可见性会被评估并标记(而非拒绝),用于后续的权重调整。
第三阶段:元数据质量。通过筛选的片段会获得元数据标注——动作姿态一致性分数、屏幕色彩偏移标记——这些作为软信号用于训练时的样本权重调整和课程学习调度,而非硬性拒绝,使模型仍能从有缺陷但包含信息的训练样本中有效学习。
3.4 数据标注
通过筛选的片段会被标注,用于基于动作条件和文本条件的世界模型训练。该流程在设计上尽可能与数据源无关,同时在有可用数据源特定信号时加以利用。
动作标签。动作标签通过特定数据源的机制获取,并转换为统一的规范格式。对于游戏数据,源生控制信号直接从游戏运行时 API 以真实精度捕获,并与每个视频帧同步。对于仿真数据,标签根据设计轨迹(第 3.2.4 节)确定性推导得出。对于互联网视频,标签通过位移投影和阈值化(第 3.2.5 节)从估计姿态推导得出。这些伪标签带有估计噪声,但能大幅扩展训练数据的多样性。因此,所有三个数据源都提供统一的动作表示,用于统一的模型训练。
场景描述。除了动作标签之外,我们还使用大型视觉语言模型(VLM)为每个片段生成结构化的自然语言描述。这些描述在基于文本条件的生成训练中作为条件输入,使模型能够响应高层语义提示词(例如“沿着海岸公路的晴朗驾驶”),同时也能响应低层动作控制。
VLM 生成的描述能够捕捉整体场景构成、环境特征、天气与光照条件以及显著的动态事件,同时有意省略了摄像机运动信息,从而将运动控制与场景生成解耦——这一设计选择有助于防止模型将文本描述与摄像机轨迹信号混淆。对于游戏数据,每个描述前会加上一个游戏标识符 token,使模型能够学习特定来源的视觉风格和渲染惯例。
语义标签。每个片段还会额外标注一组由 VLM 提取的结构化语义标签,包括场景属性(室内/室外、城市/乡村、建筑类型)、天气条件、时段、车辆类型以及视角模式。这些标签能够在训练过程中实现分层采样,确保模型均衡地接触多样化的环境条件,并便于在特定子集上进行有针对性的微调或评估。
人物身份。对于第三人称视角的数据,我们额外提取了结构化的人物身份表示:从每个第三人称片段中,我们识别出角色清晰可见且未被遮挡的帧,然后根据摄像机与角色之间的相对角度,裁剪出朝向四个主要观察方向(正面、背面、左侧、右侧)的人物缩略图。基于这些方向性缩略图,我们进一步通过基于图像的面部补全技术合成一张标准的正面肖像,从而生成标准化的身份参考。
这些标注支持第三人称场景下的身份条件生成,并为角色一致的视频合成提供身份参考。综合来看,经过整理的多源语料库支撑了完整的 ABot-World 训练流程,而模型评估则反馈给后续的 WorldExplorer 收集工作,并闭合了图 2 所示的数据-模型循环。
4 ABot-World-0
本节介绍完整的 ABot-World-0 流程。我们首先阐述通用问题形式化定义(第 4.1 节),该定义明确了交互式世界建模任务,包括动作条件输入和训练目标。接着描述双向教师训练(第 4.2 节),通过大规模交互视频数据,使预训练视频生成器具备动作条件动态建模能力。然后介绍因果蒸馏(第 4.3 节),将双向生成能力迁移至支持高效在线交互和长程推演的因果自回归模型。为进一步提升推演稳定性,我们引入 LongForcing,这是一种长程分布匹配策略,可在更长时间上下文范围内扩展教师监督,并缓解累积的自回归漂移。最后,我们详细阐述推理加速流程(第 4.4 节)。
综上所述,本节呈现三项核心技术组件:
- 1.
一个用于统一交互式生成的动作可控视频世界模型。ABot-World-0 将原始键盘输入作为场景漫游和第三人称角色交互的唯一动作接口,同时参考角色记忆提供补充的外观条件,以支持第三人称交互过程中的角色身份一致性。
- 2.
一个用于高效稳定推演的渐进式双向到因果训练流程。教师强制和 ODE 蒸馏逐步将双向教师模型迁移为因果少步学生模型,而 LongForcing 则将学生的长程自推演与扩展时域上的教师模型对齐,以缓解累积的分布偏移和自回归漂移。
- 3.
一种面向实时单GPU部署的全栈推理协同设计方案。该部署栈将少步扩散模型与轻量级VAE解码、低位DiT推理、高效注意力与位置编码、以及内存感知调度相结合,从而在单台桌面级GPU的计算与内存限制内实现实时交互式生成。
4.1 问题形式化
世界模型从根本上旨在根据过去的观测结果和智能体交互来预测环境的未来状态。在我们的设定中,环境状态由视频表示,模型根据先前观测到的帧、用户动作以及多模态条件(如高层级文本指令和参考图像)来预测未来的视觉观测结果。我们将此任务形式化为一个交互式世界建模问题,该问题包含三个关键需求:长程视频推演、动作条件控制,以及长时域上的一致性。
形式上,设 和 分别表示可用的视觉历史信息和未来的动作序列。设 表示包含文本提示词和参考图像的多模态条件。我们的目标是建模
| (1) |
其中 表示长度为 的下一个视频块。通过迭代预测并追加未来的视频块,模型可以自回归地推演出长程轨迹。
我们的训练流程包含两个主要阶段,如图3所示,每个阶段对应不同的条件建模目标:
- 1.
双向教师学习。在第一阶段,我们训练一个双向教师模型,使其能够根据初始帧、完整动作序列和多模态条件生成全时域视频。具体来说,给定初始帧 、动作序列 和多模态条件 ,教师模型被训练来建模
(2) 双向架构联合生成目标序列,允许信息在整个时间范围内传播,而非强制施加严格的因果依赖关系。这种非因果的公式化设计实现了全范围信息交换,并为视觉一致性、运动质量及动作对齐提供了强大的教师模型。我们从预训练的视频生成主干网络出发,在大规模视频-动作数据上对教师模型进行微调,其中包含动作条件、参考角色记忆以及长序列训练。
- 2.
基于知识蒸馏的因果学生模型学习。在第二阶段,我们将训练好的双向教师模型蒸馏到一个因果自回归生成器中,其目标函数与公式(1)中的在线展开设定相匹配。具体而言,学生模型
(3) 仅利用过去的视觉观测、对应的动作序列以及多模态条件来预测未来的视频片段,而无法访问未来的帧。
由于双向教师模型依赖于全序列生成和迭代去噪,因此无法直接部署用于交互式自回归展开。为此,我们采用了一种渐进式的三阶段蒸馏流程。首先,教师强制(Teacher Forcing)在因果视觉条件下将教师模型的知识迁移至自回归学生模型。其次,通过学习从中间噪声潜变量到由冻结的第一阶段因果模型在相同因果输入下的概率流常微分方程所定义的干净端点的映射,常微分方程蒸馏将多步自回归去噪压缩为少步预测。第三,我们引入了长程强制(LongForcing),该方法针对扩展时间范围的教师模型进行分布匹配。更长的监督范围覆盖了学生模型自回归展开的后期部分,此时预测误差有更多机会累积。这提供了超越短时训练范围的分布级修正监督,并减少了自回归展开过程中的长期漂移。
以下各节将详细描述每个阶段。
4.2 带动作控制注入的双向教师模型训练
预训练视频生成模型拥有丰富的世界先验知识,例如视觉外观、物理合理性和场景构图,但缺乏动作条件的动态知识,即从离散控制输入到相应视觉状态转换的映射。为弥补这一差距,我们通过将动作控制信号和参考图像注入预训练的 Wan2.2 主干网络 [61],训练了一个双向视频生成模型。通过对大规模多源视频-动作数据(含时间增强)进行全参数微调,我们的模型学习了动作与视觉动态之间的对应关系,为后续的因果自回归适配奠定了坚实基础。
4.2.1 动作控制注入
我们使用原始键盘输入作为唯一的交互控制信号。具体而言,每个帧级动作被表示为一个 8 维的多热向量,对应 8 个离散按键:W/A/S/D 用于角色或摄像机移动,I/J/K/L 用于摄像机旋转。设
| (4) |
表示长度为 的视频的逐帧动作序列。与依赖估计摄像机姿态或学习到的潜在动作的方法相比,这种原始键盘信号可直接从游戏录制中获取,并在推理时与用户意图自然对齐。
为匹配视频分词器的时间压缩,我们将每 4 个连续的帧级动作沿通道维度打包,这与 VAE 的时间补丁大小 4 保持一致。具体而言,打包后的动作 token 序列为
| (5) |
| (6) |
因此,每个时间动作 token 的维度为 ,并与 VAE 压缩后的一个潜在帧对齐。
随后,我们将打包后的动作序列输入动作控制适配器。我们采用了一种由PixelUnshuffle、一个卷积层(其卷积核大小和步长均设置为DiT空间补丁大小)以及后续残差卷积块组成的相机适配器架构。PixelUnshuffle的下采样因子选择为与VAE的空间压缩比相匹配,从而使适配器输出与DiT分块化潜变量token的时空分辨率严格对齐。将加噪后的视频潜变量记作,其补丁嵌入记作,则动作条件化的潜变量token由下式给出:
| (7) |
这种设计能够将动作信息以逐token加性注入的方式直接输入DiT主干网络。
我们在整个模型中均采用分块化阶段的加性注入方式。
4.2.2 身份保持条件化
视频世界模型在长程第三人称展开过程中可能出现身份漂移问题,即尽管运动动态得以保持,但角色外观会逐渐偏离。为解决此问题,我们引入了一个由可控角色的多张标准参考图像组成的参考角色记忆模块。
参考图像由与展开帧相同的VAE编码,并转换为身份记忆token,这些token在进入DiT主干网络之前被前置到视频token序列中。我们为记忆token分配固定的负时间RoPE索引,为视频token分配非负索引,从而将静态身份信息与生成的轨迹分离开来。此外,我们采用了一种非对称的记忆-视频注意力模式,其中视频token会关注记忆token,而记忆token则与视频token保持隔离。这使得在自回归展开过程中能够持续进行身份检索,并提升了长程场景下的角色一致性。
4.3 因果渐进式学生蒸馏
双向教师模型由于采用全序列生成和多步去噪,无法直接部署用于实时交互。因此,我们通过一个三阶段渐进式流程将其蒸馏为因果生成器:(1) 教师强制(Teacher forcing),将双向教师模型在因果视觉条件下转换为自回归学生模型;(2) ODE 蒸馏,在保持生成质量的同时,将自回归去噪过程缩减为少步推理;(3) LongForcing,通过扩展视界的教师模型进行长程分布匹配,以提高推演稳定性并缓解自回归生成过程中的累积漂移。通过让学生模型暴露于推演误差可能累积的更广泛长程学生推演上下文中,LongForcing 提供了超越短训练视界的纠正性监督。每个阶段都建立在前一阶段的基础上,逐步将高质量但非因果的教师模型转化为适用于实时交互式推演的高效因果世界模型。
4.3.1 阶段一:教师强制
我们并非从头训练因果学生模型,而是从已训练好的双向教师模型初始化,并通过因果训练目标和注意力掩码策略对模型进行适配。双向教师模型利用完整的时间上下文对整个视频序列进行联合去噪,而因果学生模型则被训练为仅使用先前观察到的视觉上下文来生成未来的视频片段。
具体来说,在教师强制过程中,历史帧作为干净的 ground-truth 潜变量提供,而目标片段则根据扩散过程被加噪。因果注意力掩码限制模型无法访问历史帧之外的未来视觉上下文,从而匹配自回归推理所需的信息结构。这种设计保留了双向教师模型学习到的视觉先验和长程动态知识,同时使模型适应因果生成。
形式上,对于从时间点开始的推演步骤,学生模型建模
| (8) |
在此阶段,干净的视觉信息被用作条件输入,并转换为带噪声的潜在目标,用于扩散训练。通过依赖该阶段的真实历史数据,该目标函数实现了从双向轨迹建模到因果自回归逐步生成的稳定适配。
4.3.2 第二阶段:常微分方程蒸馏
上一阶段获得的因果扩散模型在每个自回归逐步生成步骤中仍需进行迭代去噪。为降低推理延迟,我们应用了因果常微分方程蒸馏,训练一个少步模型来近似第一阶段因果模型所诱导的概率流常微分方程。
一个关键要求是,参考模型与蒸馏模型遵循相同的因果分解方式。因此,我们冻结由参数化的第一阶段因果扩散模型,并将两个模型置于相同的因果上下文中:
| (9) |
其中表示干净的视觉历史,表示目标动作序列,表示包含文本提示词和参考图像的多模态条件。
令表示沿第一阶段因果模型概率流常微分方程轨迹上、处于噪声水平的中间潜在变量。其对应的干净端点为
| (10) |
其中表示从噪声水平到干净端点对因果模型概率流常微分方程的积分。蒸馏模型被训练为直接预测该端点:
| (11) |
其中表示停止梯度操作。
由于中间潜在变量及其端点是在相同条件下从同一因果常微分方程轨迹中获得的,它们为每个自回归预测步骤定义了一致的流映射。此外,蒸馏目标仅依赖于部署时可用的因果上下文,不需要未来的视觉观测。因此,得到的模型能够以显著更少的去噪步骤逼近原始因果扩散端点映射,同时保持其自回归逐步生成行为。
4.3.3 第三阶段:长程强制
经过 ODE 蒸馏后,因果学生模型仅需少量去噪步骤即可执行自回归 rollout。然而,它仍然面临一个根本性的长程挑战:由于每次预测都基于先前生成的帧,微小的分布误差会逐渐累积,使 rollout 逐步偏移至训练期间极少遇到的长程学生 rollout 上下文。这些长程学生 rollout 上下文获得的分布匹配监督有限,导致 rollout 分布逐渐偏离期望的世界动态。
因此,我们引入了 LongForcing,这是一个最终的长程分布匹配阶段,通过扩展教师监督的时间范围来提高 rollout 稳定性。与学习固定因果条件下干净端点流映射的 ODE 蒸馏不同,LongForcing 在长程条件视频分布层面将学生模型与教师模型对齐。其关键洞察在于,长程稳定性不仅依赖于准确的局部转移,还取决于闭环 rollout 分布是否保持在教师监督所覆盖的时间范围内。
更长的学生自 rollout 使模型暴露于长程学生 rollout 上下文,在此类上下文中,微小预测误差有更多机会累积。LongForcing 在这些自生成轨迹上进行训练,并在最终的分布匹配蒸馏(DMD)阶段 [79] 应用来自扩展时间范围教师的分布级纠正监督。这鼓励学生模型保持合理的长期动态,而无需显式的帧级轨迹匹配。与短程教师监督相比,扩展的时间范围在更长的时间跨度上提供分布级指导,旨在缓解视觉质量和动作条件动态的逐步退化。
4.4 面向实时世界 Rollout 的全栈协同设计
少步知识蒸馏显著降低了每次自回归预测的去噪成本,但仅凭这一点还不足以在单块消费级 GPU 上实现实时交互式世界推演。随着去噪预算被压缩,主要的系统瓶颈转向了分块潜在解码、Transformer 计算、注意力机制与位置编码开销、上下文内存流量以及运行时模型驻留。
因此,我们将实时部署定义为一个全栈协同设计问题,涵盖时间生成粒度、VAE 解码器、低精度 DiT 执行、注意力与 RoPE 内核、有界上下文内存以及运行时模块调度。我们的目标不是优化单个算子,而是联合平衡三个对部署至关重要的特性:持续生成吞吐量、操作到首帧延迟以及峰值 GPU 内存使用量。这种协同设计的推理栈使得在单块 NVIDIA RTX 5090 GPU 上实现实时、高分辨率、长程交互式生成成为可能。
4.4.1 部署目标与运行时指标
| 项目 | 规格 |
|---|---|
| GPU | NVIDIA RTX 5090 |
| 批大小 | |
| 分辨率 | |
| 推理 | 分块流式处理 |
| 吞吐量 | 最高可达 |
| 操作到首帧延迟 | |
| 峰值显存 |
ABot-World-0 采用分块因果生成方式,联合生成一个潜在帧块,并在将生成的帧交付给流式运行时之前对整个块进行解码。我们将操作到首帧延迟定义为从用户按键到相应的推理块被解码且其第一帧响应可用之间的挂钟时间。
该表报告的是整体部署范围,而非某个特定精度下的运行点。关于 FP8 及更激进的低比特配置下的详细速度与内存权衡,请参见表 2。
4.4.2 分块流式处理与运行时协同设计
一个轻量级 VAE 解码器降低了首帧延迟和峰值内存占用。尽管 DiT 仍然是主要的计算组件,但在高分辨率下,VAE 解码对首帧延迟和内存消耗的贡献仍不可忽视。受 TAEHV [5] 启发,我们对解码器架构进行了简化和剪枝,构建了一条轻量级 VAE 解码路径,称为 LightVAE,大幅减少了解码时间和峰值内存占用。
由于必须将完整的潜在变量块解码后,其响应帧才能被流式运行时使用,因此减少块解码时间可直接降低从操作到首帧的延迟。
内存感知调度提升了单 GPU 部署的可行性。为了进一步降低 GPU 内存压力,我们采用了受 FramePack [84] 模块交换功能启发的内存感知运行时调度。推理流程的所有组件无需同时常驻 GPU,而是根据其执行顺序和内存需求对模型模块进行分阶段调度。这种策略在不修改模型架构的情况下降低了峰值显存使用量,同时限制了延迟关键推理路径上的数据传输开销。
Fast-RoPE 降低了时序位置编码的开销。长程自回归生成会在移动的局部注意力上下文中反复应用时序位置编码。我们采用 Fast-RoPE 来改进流式生成过程中的时序位置编码。具体来说,我们在局部注意力窗口内重新锚定时序 RoPE,以减少随着生成推进而在整个可见上下文上重复计算 RoPE 的开销。此外,我们还使用了一个基于 Triton 的 RoPE 内核来加速旋转操作。这些优化共同降低了长程交互式推理过程中的位置编码开销。
4.4.3 低精度计算与上下文内存协同设计
低位混合精度推理可提升 DiT 的吞吐量与内存效率。为降低 DiT 推理的计算与内存带宽成本,我们遵循 LightX2V [13] 的部署实践,应用低位量化技术。FP8 作为我们默认的面向质量的工作点,在 GEMM 吞吐量和内存带宽效率方面带来了显著提升。
我们还评估了更激进的低位格式,以刻画部署包络中的高吞吐区域。具体而言,对 DiT 主干中计算密集的线性层进行量化,而 VAE 和文本编码器等数值敏感组件则保持较高精度。这种混合精度设计在推理吞吐量和内存使用方面提供了可配置的权衡,同时为数值敏感组件保留了更高精度。
高效注意力核可加速主要的 Transformer 算子。注意力计算构成了扩散 Transformer 每步延迟的主要部分,尤其是在生成长 token 序列的高分辨率视频时。因此,我们采用 SageAttention2 [83] 作为高效的注意力后端。它无需模型重新训练或架构修改即可替代传统注意力执行,从而降低主要 Transformer 算子的运行时成本。
有界 KV 缓存可防止上下文无限制增长,而缓存量化能进一步降低其固定成本。对于长时流式生成,朴素的完整历史 KV 缓存会随生成上下文持续增长,最终成为实际的内存与带宽瓶颈。ABot-World-0 通过采用带有滚动淘汰机制的有界局部上下文 KV 缓存,避免了这种无界增长,使缓存占用与总生成时长无关。
然而,即使在有限上下文的设计下,常驻的键和值张量在高分辨率下仍然是内存消耗和内存带宽流量的主要来源。为了进一步降低这一成本,我们探索了 KV 缓存量化,该方法在压缩缓存的键和值张量的同时,保留其在后续注意力计算中的可用性。
借鉴近期在线向量量化 [81] 的进展,该策略既能减少固定的缓存占用,也能降低局部上下文注意力的带宽压力。因此,KV 缓存量化可以补充低位宽 DiT 推理,并在受限 GPU 内存下提升长时程生成的扩展性。
4.4.4 端到端系统分析
| 配置 | DiT 时间(毫秒/块) | VAE 时间(毫秒/块) | FPS | 显存(GiB) |
|---|---|---|---|---|
| 基础 | – | – | 内存不足 | 内存不足 |
| + SageAttention2 | – | – | 内存不足 | 内存不足 |
| + SageAttention2 + LightVAE | 1191.081 | 78.276 | 9.117 | 20.491 |
| + SageAttention2 + LightVAE + FP8 | 845.180 | 75.980 | 12.405 | 15.925 |
| + SageAttention2 + LightVAE + FP8 + Fast-RoPE | 786.871 | 71.730 | 13.269 | 19.281 |
| + SageAttention2 + LightVAE + MXFP6 + Fast-RoPE | 718.281 | 85.994 | 14.098 | 18.287 |
| + SageAttention2 + LightVAE + MXFP4 + Fast-RoPE | 638.843 | 72.957 | 15.831 | 17.148 |
每个推理块包含若干潜在帧,并生成解码后的视频帧。DiT 和 VAE 时间按每个推理块报告,FPS 表示生成吞吐量,显存表示以 GiB 为单位的峰值 GPU 内存使用量,OOM 表示内存不足。表 2 表明,实时部署源于全栈优化,而非单个算子的加速。基础配置和仅使用 SageAttention2 的变体均出现内存不足,这说明仅靠更快的注意力内核不足以使完整的高分辨率流水线在单块桌面级 GPU 上部署。内存可行性需要对 Transformer 执行、视频解码、数值精度以及运行时模型驻留进行联合优化。
引入 LightVAE 后,我们得到了首个可行的配置,实现了 9.117 FPS 的帧率,峰值显存占用为 20.491 GiB。这一结果表明,原始 VAE 是影响内存可行性的一个重要瓶颈,同时 VAE 解码在分块响应延迟中仍是一个不可忽视的组成部分。
在此配置基础上,对 DiT 主干网络进行量化带来了显著提升。FP8 将每分块的 DiT 处理时间从 1191.1 毫秒降至 845.2 毫秒,生成吞吐量从 9.117 FPS 提升至 12.405 FPS,峰值内存占用从 20.491 GiB 降至 15.925 GiB。加入 Fast-RoPE 后,DiT 处理时间进一步缩短至 786.9 毫秒,吞吐量提升至 13.269 FPS。在此配置下,测得的峰值内存增加至 19.281 GiB,这表明峰值显存由完整的运行时配置决定,而非单个算子的开销。
我们采用 FP8 作为默认的面向质量的配置,而更激进的低位宽格式则扩展了高吞吐量的运行范围。在优化后的低位宽配置中,ABot-World-0 的帧率最高可达 16 FPS,同时峰值显存保持在 19.3 GiB 以下。
总体而言,这些结果验证了我们的核心系统洞察:少步生成并不会自动转化为实时交互。要实现实时、高分辨率的世界推演,需要对时序生成、潜在空间解码、Transformer 算术运算、注意力机制与位置编码、上下文内存管理以及运行时调度进行全栈协同设计。这些优化共同将经过蒸馏的因果模型转变为一个实用的交互式世界模拟器,使其能够在单张桌面级 GPU 上持续运行。
量化感知训练有望进一步改善速度、内存与质量之间的权衡。我们将这一方向留待未来工作探索。
5 评估
我们通过三个互补视角对 ABot-World-0 进行评估:在 WorldRoamBench 上的定量比较、针对 LongForcing 的 60 秒时间消融实验,以及涵盖小时级和天级规模展开、域外控制和物理交互的定性压力测试。WorldRoamBench 衡量动作可控性、轨迹跟随、视觉质量、物理合理性和时间记忆,而扩展展开则考察模型在基准测试范围之外的行为。LongForcing 消融实验直接评估自回归展开过程中的视觉误差累积,定性案例则展示了扩展交互、身份持久性、控制泛化和合理的物理效果。这些实验共同刻画了 ABot-World-0 在长时间交互中的可控性、连贯性和状态持久性。
5.1 WorldRoamBench 评估
为了在交互式、长时程场景中评估 ABot-World-0,我们使用 WorldRoamBench [72],这是一个面向可控视频世界模型的开源基准测试。WorldRoamBench 评估四个关键维度:动作可控性、视觉合理性、物理一致性和时间记忆保持能力。
5.1.1 定量结果
表 3 仅报告了 WorldRoamBench 的具体子维度。我们按照基准测试协议,将 ABot-World-0 与 Genie 3 [19]、HappyOyster [1]、LingBot-World [54] 和 HY-World 1.5 [62] 进行了比较。
| 模型 | 参数量 | 严格准确率 | 部分准确率 | 轨迹分数 | 美学 | 成像 | 力学 | 记忆 |
|---|---|---|---|---|---|---|---|---|
| Genie 3 | – | 0.4700 | 0.6608 | 0.6719 | 0.4711 | 0.4757 | 0.5454 | 0.6073 |
| HappyOyster | – | 0.5317 | 0.7631 | 0.7737 | 0.5235 | 0.4377 | 0.5395 | 0.6309 |
| LingBot-World | 14B | 0.3235 | 0.4198 | 0.4094 | 0.2898 | 0.2875 | 0.2777 | 0.3006 |
| HY-World 1.5 | 8.3B | 0.1640 | 0.2088 | 0.2015 | 0.1400 | 0.1236 | 0.1115 | 0.1562 |
| ABot-World-0 | 5B | 0.5266 | 0.7290 | 0.6752 | 0.5039 | 0.4651 | 0.5223 | 0.5041 |
ABot-World-0 在动作保真度、轨迹跟随、视觉质量、物理力学和记忆分数方面均取得了强劲表现。
5.1.2 定性分析
除了具有竞争力的量化性能外,ABot-World-0 还展现出三种对实用型交互式世界模型至关重要的定性能力:在极长展开过程中保持持续可控性与场景连贯性;一个统一的控制接口,可泛化至多种不同场景与可控角色;以及对动作和环境约束产生合理的物理响应。在所评估的案例中,ABot-World-0 在保持可识别的场景结构、角色与物体身份以及运动连续性的同时,始终响应用户指令,而不会迅速退化为动作停滞、纹理重复或严重的视觉漂移。这些结果表明,ABot-World-0 学习的是持久且带状态的交互动态,而不仅仅是生成一系列局部合理的短片段。
图 5、6 和 7 展示了该模型的长程生成能力。小时级结果包含五个独立的展开过程,以带时间戳的关键帧条带形式呈现。尽管生成时间跨度很长,ABot-World-0 仍能保持连贯的环境、视角和可控角色,同时持续响应输入的动作流。天级压力测试进一步让模型暴露在严重的累积误差条件下,采样检查点仍能保留可识别的场景结构与活跃运动,而不会崩溃为纹理噪声、重复内容或静态帧。
图 8 评估了域外(OOD)控制泛化能力,其中环境和可控角色均落在训练分布之外。这些示例涵盖了在统一动作表征下的多样场景与可控角色。在这些 OOD 设定下,生成的运动始终遵循输入的动作序列,同时与周围环境保持连贯,表明所学到的动作条件能够泛化到新颖的场景–角色组合中。
图 9 展示了交互过程中涌现出的合理物理后果。例如,一个人推开纸箱,脚步在水面上引起时间上连续的扰动,人在雪地中行走留下持久的脚印,第一人称运动被墙壁阻挡,以及角色与栏杆碰撞而不穿透过去。这些案例涉及碰撞、接触效果、持续性环境变化以及几何约束,而这些都并非仅由动作标签所指定。尽管 ABot-World-0 并未显式地使用符号化物理规则或真实世界碰撞标注进行训练,但它通过大规模交互视频经验产生了合理的物理响应。
5.2 LongForcing 对长程推演的影响
我们将 LongForcing 与一种基于因果强制风格的基线方法 [87] 进行比较,该基线方法在相同的展开协议下适配到我们的交互式世界模型中。两种变体都在学生模型自身自回归展开产生的历史数据上进行训练,并在最终的后训练阶段应用 DMD。LongForcing 的不同之处在于,在此阶段使用了更长视野的教师监督,而非基线方法使用的较短视野监督。我们使用 HPSv3 评分 [49]、高饱和度像素比率、感知模糊评分和图像块重复比率,对两种变体在 60 秒展开上进行评估。HPSv3 越高越好;其他三项指标则越低越好。
如图 10 所示,两种变体之间的差异在展开的后半部分变得更加明显。因果强制风格基线方法在展开的后半段表现出 HPSv3 的逐步下降,同时伴随着更高的饱和度、模糊度和图像块重复。LongForcing 在同一时间段内保持了更高的 HPSv3 评分和更低的伪影相关指标,表明在自回归生成过程中视觉误差累积更少。
6 讨论与未来工作
显式动作支持简单的条件控制。键盘输入是离散的,在时间上与视频对齐,并直接反映用户意图。对于这些显式控制信号,我们在图像块嵌入阶段使用加法注入,以提供可靠的控制,同时保留预训练模型的视觉先验。对于潜在动作、连续相机轨迹或语义指令等模糊信号,更复杂的条件控制方法可能仍然有用。
长期漂移更应被理解为一种分布偏移问题。随着自回归生成的推进,微小误差在视觉上下文中逐渐累积,使模型逐步偏离短程训练所覆盖的状态。基于汇点的上下文稳定化与固定参考帧可以延缓这一过程,但过度锚定可能使模型过于贴近初始观测,从而限制运动与场景演化。LongForcing 另辟蹊径:它在学生模型的长程自展开轨迹上进行训练,并利用扩展视野的教师模型来正则化由此产生的分布。这使得模型既能持续想象新内容,又能保持稳定。我们在以天为单位的展开轨迹中获得的连贯采样检查点,与“训练时分布对齐是迈向长程生成的一条有前景路径”这一目标是一致的。
实时交互远不止是少步采样。另一个实际经验是,减少去噪步骤本身并不能构建出一个交互式系统。一旦 DiT 完成蒸馏,VAE 解码、注意力计算、内存传输,以及 KV cache 的内存占用与带宽需求,仍然是实质性的系统成本。将这些组件协同优化,使得 ABot-World-0 能够在单张桌面级 GPU 上维持实时推理。对于交互式世界模型而言,动作到首帧的延迟、持续吞吐量以及内存占用,因此比单纯的去噪步数更有意义。
未来工作。上述观察指向了几个自然的扩展方向。更丰富的动作与语义事件可能需要更结构化的条件控制;多尺度 LongForcing 与持久场景记忆有望进一步提升长程一致性;而更高效的解码与上下文管理,则可能将高分辨率实时生成扩展到更广泛的消费级硬件上。
7 结论
ABot-World-0 将动作条件视频世界建模带到了实时桌面部署中。该模型在涵盖 AAA 游戏、模拟引擎和互联网视频的多源动作-视频数据上训练,单个模型即可支持不同环境和可控主体下的场景导航与角色控制。参考角色条件化在长程第三人称生成过程中提供持久的表观线索。
训练流程从一个学习动作条件视觉动态的双向教师模型开始,并通过教师强制和 ODE 蒸馏逐步将其转化为高效的因果生成器。LongForcing 进一步将学生的长程自回归输出与扩展时域的教师模型对齐,将分布级监督扩展到重复自回归生成中遇到的长程学生自回归上下文。在超出训练时域的 60 秒自回归评估中,LongForcing 相比 Causal-Forcing 风格的基线减少了视觉误差累积,从而在评估的自回归过程中提升了视觉稳定性。
优化后的部署栈结合了轻量级 VAE 解码器、低位推理、高效注意力机制和内存感知调度,在单张 RTX 5090 上实现了高达 16 FPS 的 720P 流式输出,动作到首帧延迟为 1.2 秒,同时优化后的低位运行点的峰值显存保持在 19.3 GiB 以下。在 WorldRoamBench 上的结果显示,该模型在动作跟随、轨迹跟随、视觉质量、物理机制和记忆保持方面均具有竞争力。值得注意的是,从持续数天的自回归中采样的检查点在评估时间戳上保持了可识别的视觉质量、活跃的动态和场景连贯性,未出现可观察到的崩溃。
ABot-World-0 证明了统一的交互控制、稳定的长程推理以及消费级实时部署可以在单个视频世界模型中实现。通过持续将生成的世界扩展到预定义的场景边界之外,它为交互式内容创作、游戏模拟、智能体学习和具身 AI 研究提供了一个开放且实用的基础。
8 位贡献者
项目赞助人:穆旭与郭宁。
基础模型团队:蒋凡†\dagger†\dagger表示各团队技术负责人、孙兆旭、王梦超、朱子宇、王驰宇、张云鹏、刘文林、王云、郑雪、孙锐、倪俊峰。
数据团队:潘宏宇、孙忠旭、余飞、葛增业、杜萌萌、范念飞、孙明超、刘宇、杨永昌。
AI 基础设施团队:朱彦青、王嘉航、应宁、宣宇泽、杨迪。
基准测试团队:刘志诚、高哲、徐廷兵、隋佳成、杨文进。
工程团队:赖俊男、范念飞、刘树峰、杜萌萌、刘源、周正、彭英亮、曹大伟、盛开峰、蔡宇翔、卢飞。
致谢
我们衷心感谢程臻宇、孙冲、龚春诺、张健、王倩薇、雷宇(按姓氏拼音首字母排序)在整个项目开发过程中提供的宝贵支持、深刻反馈与贡献。
参考文献
- [1] 阿里云 (2026) 阿里巴巴发布 HappyOyster,一款用于实时沉浸式创作与交互的世界模型产品。注:阿里云博客 引用自:§5.1.1。
- [2] 高德地图,阿里巴巴 (2023) 云境高德:AI 驱动的三维重建与数字孪生平台。注:https://yunjing.amap.com/ 访问日期:2026年7月 引用自:§3.2.1, §3.2.4。
- [3] J. Bai, M. Xia, X. Fu, X. Wang, L. Mu, J. Cao, Z. Liu, H. Hu, X. Bai, P. Wan, 等 (2025) ReCamMaster:基于单段视频的相机可控生成式渲染。收录于:IEEE/CVF 国际计算机视觉大会论文集,第 14834–14844 页。引用自:§2.4。
- [4] A. Blattmann, R. Rombach, H. Ling, T. Dockhorn, S. W. Kim, S. Fidler, 和 K. Kreis (2023) 对齐你的潜变量:基于潜变量扩散模型的高分辨率视频合成。收录于:IEEE/CVF 计算机视觉与模式识别大会论文集,第 22563–22575 页。引用自:§1, §2.1。
- [5] O. Boer Bohan (2025) TAEHV:用于混元视频的微型自编码器。注:GitHub 仓库 外部链接:链接 引用自:§4.4.2。
- [6] J. Bruce, M. D. Dennis, A. Edwards, J. Parker-Holder, Y. Shi, E. Hughes, M. Lai, A. Mavalankar, R. Steigerwald, C. Apps 等人 (2024) 《Genie:生成式交互环境》。发表于国际机器学习大会(ICML),引用自:§1, §1。
- [7] B. Chen, D. Martí Monsó, Y. Du, M. Simchowitz, R. Tedrake 和 V. Sitzmann (2024) 《扩散强制:下一 token 预测遇上全序列扩散》。发表于神经信息处理系统大会(NeurIPS),引用自:§2.2, §2.3。
- [8] G. Chen, D. Li, S. Yang, B. Zhu, B. Tan, M. Wang 等人 (2025) 《SkyReels-V2:无限长度电影生成模型》。arXiv 预印本 arXiv:2504.13074。引用自:§2.3。
- [9] H. Chen, Y. Zhang, X. Cun, M. Xia, X. Wang, C. Weng 和 Y. Shan (2024) 《VideoCrafter2:克服高质量视频扩散模型的数据限制》。发表于 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,引用自:§2.1。
- [10] J. Chen, H. Zhu, X. He, Y. Wang, J. Zhou, W. Chang, Y. Zhou, Z. Li, Z. Fu, J. Pang 和 T. He (2025) 《DeepVerse:作为世界模型的 4D 自回归视频生成》。arXiv 预印本 arXiv:2506.01103。外部链接:Link 引用自:§3.2.4。
- [11] S. Chen, C. Wei, S. Sun, P. Nie, K. Zhou, G. Zhang, M. Yang 和 W. Chen (2026) 《上下文强制:基于长上下文的一致性自回归视频生成》。外部链接:2602.06028, Link 引用自:§2.3。
- [12] Y. Chen, L. Wang, W. Huang, S. Yang, B. Zhang, Y. Xiao, R. Chu, W. Mao, Q. Hu, S. Liu 等人 (2026) 《LongLive-2.0:面向长视频生成的 NVFP4 并行基础设施》。arXiv 预印本 arXiv:2605.18739。引用自:§2.3, §2.5。
- [13] L. Contributors (2025) 《LightX2V:轻量级视频生成推理框架》。GitHub。注:https://github.com/ModelTC/lightx2v 引用自:§4.4.3。
- [14] J. Cui, J. Wu, M. Li, T. Yang, X. Li, R. Wang, A. Bai, Y. Ban 和 C. Hsieh (2025) 《Self-Forcing++:迈向分钟级高质量视频生成》。外部链接:2510.02283, Link 引用自:§2.3。
- [15] J. Cui, J. Wu, M. Li, T. Yang, X. Li, R. Wang, A. Bai, Y. Ban 和 C. Hsieh (2026) 《LoL:比长更长,将视频生成扩展至小时级》。arXiv 预印本 arXiv:2601.16914。引用自:§2.3。
- [16] Decart 与 Etched (2024) 《Oasis:Transformer 架构中的宇宙》。注:https://oasis-model.github.io/ 引用自:§1, §1。
- [17] R. Feng, H. Zhang, Z. Shu, Z. Yang, L. Tang, Z. Wang, A. Zheng, J. Xiao, Z. Liu, R. Chu 等 (2026) 《The Matrix:具备实时移动控制的无限视界世界生成》。Advances in Neural Information Processing Systems 38, 第 87318–87344 页。引用自:§2.4。
- [18] S. Ge, T. Hayes, H. Yang, X. Yin, G. Pang, D. Jacobs, J. Huang 与 D. Parikh (2022) 《基于时间无关 VQGAN 与时间敏感 Transformer 的长视频生成》。收录于:European Conference on Computer Vision, 第 102–118 页。引用自:§2.2。
- [19] Google DeepMind (2025) 《Genie 3》。注:https://deepmind.google/models/genie/ 引用自:§1, §1, §5.1.1。
- [20] Y. HaCohen, N. Chiprut, B. Brazowski, D. Shalem, D. Moshe, E. Richardson, E. Levin, G. Shiran, N. Zabari, O. Gordon 等 (2024) 《LTX-Video:实时视频潜在扩散模型》。arXiv 预印本 arXiv:2501.00103。引用自:§2.5。
- [21] H. He, Y. Xu, Y. Guo, G. Wetzstein, B. Dai, H. Li 与 C. Yang (2024) 《CameraCtrl:为文生视频实现相机控制》。arXiv 预印本 arXiv:2404.02101。引用自:§2.4。
- [22] X. He, C. Peng, Z. Liu, B. Wang, Y. Zhang, Q. Cui, F. Kang, B. Jiang, M. An, Y. Ren 等 (2025) 《Matrix-Game 2.0:开源实时流式交互世界模型》。arXiv 预印本 arXiv:2508.13009。引用自:§2.4。
- [23] J. Ho, T. Salimans, A. Gritsenko, W. Chan, M. Norouzi 与 D. J. Fleet (2022) 《视频扩散模型》。Advances in Neural Information Processing Systems 35, 第 8633–8646 页。引用自:§1, §2.1, §2.2。
- [24] W. Hong, M. Ding, W. Zheng, X. Liu 与 J. Tang (2022) 《CogVideo:基于 Transformer 的文生视频大规模预训练》。arXiv 预印本 arXiv:2205.15868。引用自:§1, §2.2。
- [25] Y. Hong, Y. Mei, C. Ge, Y. Xu, Y. Zhou, S. Bi, Y. Hold-Geoffroy, M. Roberts, M. Fisher, E. Shechtman, K. Sunkavalli, F. Liu, Z. Li 与 H. Tan (2025) 《RELIC:具备长视界记忆的交互式视频世界模型》。arXiv 预印本 arXiv:2512.04040。引用自:§1, §2.4, §2.5。
- [26] X. Huang, Z. Li, G. He, M. Zhou, 和 E. Shechtman (2025) 《自强制:弥合自回归视频扩散中的训练-测试差距》。arXiv 预印本 arXiv:2506.08009。引用于:§2.2, §2.5。
- [27] Z. Huang, H. Jeong, X. Chen, Y. Gryaditskaya, T. Y. Wang, J. Lasenby, 和 C. Huang (2025) 《SpaceTimePilot:跨空间与时间的动态场景生成式渲染》。arXiv 预印本 arXiv:2512.25075。引用于:§2.4。
- [28] S. A. Jacobs, M. Tanaka, C. Zhang, M. Zhang, S. L. Song, S. Rajbhandari, 和 Y. He (2023) 《DeepSpeed Ulysses:实现超长序列 Transformer 模型训练的系统优化》。arXiv 预印本 arXiv:2309.14509。引用于:§2.5。
- [29] C. M. Jiang, X. Masotto, 和 B. Sun (2026) 《Waymo 世界模型:自动驾驶仿真的新前沿》。注释:Waymo 博客 外部链接:链接 引用于:§1。
- [30] Y. Jin, Z. Sun, N. Li, K. Xu, K. Xu, H. Jiang, N. Zhuang, Q. Huang, Y. Song, Y. Mu, 和 Z. Lin (2024) 《金字塔流匹配用于高效视频生成建模》。arXiv 预印本 arXiv:2410.05954。引用于:§2.2。
- [31] A. Kanervisto, D. Bignell, L. Y. Wen, M. Grayson, R. Georgescu, S. Valcarcel Macua, S. Z. Tan, T. Rashid, T. Pearce, Y. Cao, A. Lemkhenter, C. Jiang, G. Costello, G. Gupta, M. Tot, S. Ishida, T. Gupta, U. Arora, R. W. White, S. Devlin, C. Morrison, 和 K. Hofmann (2025) 《面向游戏玩法构思的世界与人类动作模型》。Nature 638 (8051), 第 656–663 页。外部链接:文献, 链接 引用于:§1。
- [32] J. Kim, J. Kang, J. Choi, 和 B. Han (2024) 《FIFO-Diffusion:无需训练即可从文本生成无限视频》。收录于:神经信息处理系统进展 (NeurIPS)。引用于:§2.3。
- [33] S. W. Kim, Y. Zhou, J. Philion, A. Torralba, 和 S. Fidler (2020) 《学习使用 GameGAN 模拟动态环境》。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)。引用于:§1。
- [34] Y. Kim, Q. Hu, C. J. Kuo, 和 P. A. Beerel (2026) 《MemRoPE:通过演化记忆 token 实现无需训练的无限视频生成》。arXiv 预印本 arXiv:2603.12513。引用于:§2.3。
- [35] A. Kodaira、T. Hou、J. Hou、M. Georgopoulos、F. Juefei-Xu、M. Tomizuka 和 Y. Zhao(2026 年)《StreamDiT:实时流式文本生成视频》。外部链接:2507.03745,链接 引用自:§2.3、§2.5。
- [36] D. Kondratyuk、L. Yu、X. Gu、J. Lezama、J. Huang、G. Schindler、R. Hornung、V. Birodkar、J. Yan、M. Chiu 等人(2024 年)《VideoPoet:用于零样本视频生成的大语言模型》。收录于:国际机器学习大会(ICML),引用自:§1、§2.2。
- [37] W. Kong、Q. Tian、Z. Zhang、R. Min、Z. Dai、J. Zhou、J. Xiong、X. Li、B. Wu、J. Zhang 等人(2024 年)《HunyuanVideo:大型视频生成模型的系统框架》。arXiv 预印本 arXiv:2412.03603。引用自:§1、§2.1。
- [38] C. Li、Y. Yang、J. Shao、H. Zhou、K. Schwarz 和 Y. Liao(2026 年)《ReRoPE:重新利用 RoPE 实现相对相机控制》。arXiv 预印本 arXiv:2602.08068。引用自:§2.4。
- [39] J. Li、X. Fu、X. Peng、W. Chen、Y. Zheng、T. Zhao、J. Wang、F. Chen、X. Wang 和 H. K. So(2026 年)《短训练、长推理:自回归视频生成的无训练时域扩展》。arXiv 预印本 arXiv:2602.14027。引用自:§2.3。
- [40] R. Li、B. Yi、J. Liu、H. Gao、Y. Ma 和 A. Kanazawa(2026 年)《相机作为相对位置编码》。神经信息处理系统进展 38,第 15984–16009 页。引用自:§2.4。
- [41] S. Lin、C. Yang、H. He、J. Jiang、Y. Ren、X. Xia、Y. Zhao、X. Xiao 和 L. Jiang(2026 年)《自回归对抗后训练用于实时交互式视频生成》。神经信息处理系统进展 38,第 41061–41086 页。引用自:§2.5。
- [42] Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2022 年)《用于生成式建模的流匹配》。arXiv 预印本 arXiv:2210.02747。引用自:§2.2。
- [43] J. Liu、X. Liu、K. Mei、Y. Wen、M. Yang 和 W. Liu(2026 年)《通过对角蒸馏实现流式自回归视频生成》。收录于:ICLR,引用自:§2.3。
- [44] K. Liu、W. Hu、J. Xu、Y. Shan 和 S. Lu(2025 年)《Rolling Forcing:实时自回归长视频扩散》。arXiv 预印本 arXiv:2509.25161。引用自:§2.2、§2.3。
- [45] X. Liu, C. Gong, 和 Q. Liu (2022) 流直且快:利用整流流学习生成与迁移数据。arXiv 预印本 arXiv:2209.03003。引用于:§2.2。
- [46] H. Lu, G. Yang, N. Fei, Y. Huo, Z. Lu, P. Luo, 和 M. Ding (2024) VDT:基于掩码建模的通用视频扩散 Transformer。收录于国际学习表征会议,外部链接:链接。引用于:§2.1。
- [47] G. Ma, H. Huang, K. Yan, L. Chen, N. Duan, S. Yin, C. Wan, R. Ming, X. Song, X. Chen, 等 (2025) Step-Video-T2V 技术报告:视频基础模型的实践、挑战与未来。arXiv 预印本 arXiv:2502.10248。引用于:§2.1。
- [48] X. Ma, Y. Wang, G. Jia, X. Chen, Z. Liu, Y. Li, C. Chen, 和 Y. Qiao (2024) Latte:用于视频生成的潜在扩散 Transformer。arXiv 预印本 arXiv:2401.03048。引用于:§2.1。
- [49] Y. Ma, X. Wu, K. Sun, 和 H. Li (2025) HPSv3:迈向广谱人类偏好评分。收录于 IEEE/CVF 国际计算机视觉大会 (ICCV) 论文集,第 15086–15095 页。引用于:§5.2。
- [50] X. Mao, S. Rui, K. Ying, B. Zheng, C. Li, M. Chi, 和 K. Zhang (2026) PackForcing:短视频训练足以支撑长视频采样与长上下文推理。arXiv 预印本 arXiv:2603.25730。引用于:§2.3。
- [51] NVIDIA, N. Agarwal, 等 (2025) Cosmos 世界基础模型平台:面向物理 AI。arXiv 预印本 arXiv:2501.03575。引用于:§1, §1。
- [52] J. Parker-Holder, P. Ball, J. Bruce, V. Dasagi, K. Holsheimer, C. Kaplanis, A. Moufarek, G. Scully, J. Shar, J. Shi, 等 (2024) Genie 2:大规模基础世界模型。Google DeepMind 博客。外部链接:链接。引用于:§1, §2.4。
- [53] A. Polyak, A. Zohar, A. Brown, A. Tjandra, A. Sinha, A. Lee, A. Vyas, B. Shi, C. Ma, C. Chuang, 等 (2024) Movie Gen:一组媒体基础模型。arXiv 预印本 arXiv:2410.13720。引用于:§1, §2.1。
- [54] Robbyant 团队, Z. Gao, Q. Wang, Y. Zeng, J. Zhu, K. L. Cheng, Y. Li, H. Wang, Y. Xu, S. Ma, 等 (2026) 推进开源世界模型。arXiv 预印本 arXiv:2601.20540。外部链接:链接。引用于:§5.1.1。
- [55] Runway (2025) 推出 GWM-1。Runway 研究。外部链接:链接。引用于:§1。
- [56] J. Shin、Z. Li、R. Zhang、J. Zhu、J. Park、E. Shechtman 和 X. Huang(2025)《MotionStream:具有交互式运动控制的实时视频生成》。arXiv 预印本 arXiv:2511.01266。引用于 §2.5。
- [57] U. Singer、A. Polyak、T. Hayes、X. Yin、J. An、S. Zhang、Q. Hu、H. Yang、O. Ashual、O. Gafni 等人(2022)《Make-A-Video:无需文本-视频数据的文本到视频生成》。arXiv 预印本 arXiv:2209.14792。引用于 §1、§2.1。
- [58] Y. Song、P. Dhariwal、M. Chen 和 I. Sutskever(2023)《一致性模型》。收录于《国际机器学习大会》,第 32211–32252 页。引用于 §2.5。
- [59] M. Sun、L. Tang、Y. Liu、X. Yan、Z. Li、Y. Zhang、F. Yu、Z. Ge、Y. Liu、J. Zhang 等人(2026)《ABot-3DWorld 0:探索任意三维空间的通用世界模型》。arXiv 预印本 arXiv:2607.11673。引用于 §3.2.1、§3.2.4。
- [60] M. Sun、W. Wang、G. Li、J. Liu、J. Sun、W. Feng、S. Lao、S. Zhou、Q. He 和 J. Liu(2025)《AR-Diffusion:基于自回归扩散的异步视频生成》。外部链接:2503.07418,链接。引用于 §2.3。
- [61] Team Wan(2025)《Wan:开放且先进的大规模视频生成模型》。arXiv 预印本 arXiv:2503.20314。引用于 §1、§2.1、§4.2。
- [62] 腾讯混元(2025)《HY-World 1.5:具有实时延迟和几何一致性的交互式世界建模系统框架》。腾讯混元技术报告。外部链接:链接。引用于 §5.1.1。
- [63] H. Teng、H. Jia、L. Sun、L. Li、M. Li、M. Tang、S. Han、T. Zhang、W. Zhang、W. Luo 等人(2025)《MAGI-1:大规模自回归视频生成》。arXiv 预印本 arXiv:2505.13211。引用于 §2.5。
- [64] D. Valevski、Y. Leviathan、M. Arar 和 S. Fruchter(2025)《扩散模型是实时游戏引擎》。收录于《国际学习表征大会(ICLR)》,外部链接:2408.14837,链接。引用于 §1、§1、§2.5。
- [65] B. Van Hoorick、R. Wu、E. Ozguroglu、K. Sargent、R. Liu、P. Tokmakov、A. Dave、C. Zheng 和 C. Vondrick(2024)《生成式摄影车:极端的单目动态新视角合成》。收录于《欧洲计算机视觉大会》,第 313–331 页。引用于 §2.4。
- [66] R. Villegas、M. Babaeizadeh、P. Kindermans、H. Moraldo、H. Zhang、M. T. Saffar、S. Castro、J. Kunze 和 D. Erhan(2023)《Phenaki:基于开放域文本描述的可变长度视频生成》。发表于国际学习表征会议(ICLR),引用自第1节。
- [67] Y. Wang、Q. Zhang、S. Cai、T. Wu、J. Ackermann、Z. Kuang、Y. Zheng、F. Rajič、S. Tang 和 G. Wetzstein(2026)《BulletTime:视频生成中时间与相机姿态的解耦控制》。发表于 IEEE/CVF 计算机视觉与模式识别会议论文集,第18319–18330页。引用自第2.4节。
- [68] Z. Wang、Z. Yuan、X. Wang、Y. Li、T. Chen、M. Xia、P. Luo 和 Y. Shan(2024)《MotionCtrl:一种统一且灵活的视频生成运动控制器》。发表于 ACM SIGGRAPH 2024 会议论文集,第1–11页。引用自第2.4节。
- [69] C. Wu、L. Huang、Q. Zhang、B. Li、L. Ji、F. Yang、G. Sapiro 和 N. Duan(2021)《GODIVA:基于自然描述的开放域视频生成》。arXiv 预印本 arXiv:2104.14806。引用自第2.2节。
- [70] H. Xi、S. Yang、Y. Zhao、M. Li、H. Cai、X. Li、Y. Lin、Z. Zhang、J. Zhang、X. Li 等(2026)《Quant VideoGen:基于2比特 KV-Cache 量化的自回归长视频生成》。arXiv 预印本 arXiv:2602.02958。引用自第2.5节。
- [71] D. Xie、Z. Xu、Y. Hong、H. Tan、D. Liu、F. Liu、A. Kaufman 和 Y. Zhou(2025)《渐进式自回归视频扩散模型》。外部链接:2410.08151,链接。引用自第2.3节。
- [72] T. Xu、J. Sui、Z. Gao、K. Shi、W. Yang、Z. Liu、Z. Sun、M. Sun、H. Pan、F. Jiang、M. Xu、Q. Fan、Y. Gao、Y. Li 和 B. Chen(2026)《WorldRoamBench:面向交互式世界模型长程稳定性的开放世界基准》。外部链接:2606.31672,链接。引用自第5.1节。
- [73] W. Yan、Y. Zhang、P. Abbeel 和 A. Srinivas(2021)《VideoGPT:基于 VQ-VAE 和 Transformer 的视频生成》。arXiv 预印本 arXiv:2104.10157。引用自第2.2节。
- [74] J. Yang, J. Wu, Y. Ding, Z. Xu, Y. Wang, 和 G. Pekhimenko (2026) SwiftFusion:面向 GPU 上扩散模型 Transformer 分布式推理的可扩展序列并行方法。收录于《ACM 人工智能与智能体系统会议论文集》,CAIS '26,纽约州纽约市,美国,第 1037–1050 页。外部链接:ISBN 9798400724152,链接,文献。被 §2.5 引用。
- [75] S. Yang, W. Huang, R. Chu, Y. Xiao, Y. Zhao, X. Wang, M. Li, E. Xie, Y. Chen, Y. Lu 等人 (2025) LongLive:实时交互式长视频生成。arXiv 预印本 arXiv:2509.22622。被 §2.3、§2.5 引用。
- [76] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng 等人 (2024) CogVideoX:基于专家 Transformer 架构的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072。被 §2.1 引用。
- [77] J. Yi, W. Jang, P. H. Cho, J. Nam, H. Yoon, 和 S. Kim (2025) Deep Forcing:基于深度汇聚与参与式压缩的无训练长视频生成方法。arXiv 预印本 arXiv:2512.05081。外部链接:链接。被 §2.3 引用。
- [78] T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 W. T. Freeman (2024) 改进的分布匹配蒸馏方法用于快速图像合成。《神经信息处理系统进展》37,第 47455–47487 页。被 §2.5 引用。
- [79] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park (2024) 基于分布匹配蒸馏的单步图像生成。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》。被 §2.5、§4.3.3 引用。
- [80] T. Yin, Q. Zhang, R. Zhang, W. T. Freeman, F. Durand, E. Shechtman, 和 X. Huang (2025) 从慢速双向到快速自回归视频扩散模型。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》,第 22963–22974 页。被 §2.2、§2.5 引用。
- [81] A. Zandieh, M. Daliri, M. Hadian, 和 V. Mirrokni (2025) TurboQuant:具有近最优失真率的在线向量量化方法。arXiv 预印本 arXiv:2504.19874。被 §4.4.3 引用。
- [82] H. Zhang, K. Chen, Z. Zhang, H. H. Chen, Y. Lyu, Y. Zhang, S. Yang, K. Zhou, 与 Y. Chen (2025) 《DualCamCtrl:面向几何感知的相机可控视频生成的双分支扩散模型》。arXiv 预印本 arXiv:2511.23127。引用于 §2.4。
- [83] J. Zhang, H. Huang, P. Zhang, J. Wei, J. Zhu, 与 J. Chen (2024) 《SageAttention2:通过彻底异常值平滑与每线程 INT4 量化的高效注意力机制》。arXiv 预印本 arXiv:2411.10958。引用于 §4.4.3。
- [84] L. Zhang (2025) 《FramePack:基于帧上下文打包的实用视频扩散》。注:GitHub 仓库 外部链接:链接 引用于 §4.4.2。
- [85] Z. Zhao, Y. Lu, Z. Liu, J. Song, J. Deng, 与 I. Patras (2026) 《Relax Forcing:面向一致长视频生成的松弛 KV 内存》。arXiv 预印本 arXiv:2603.21366。引用于 §2.3。
- [86] J. Zhou, H. Gao, V. Voleti, A. Vasishta, C. Yao, M. Boss, P. Torr, C. Rupprecht, 与 V. Jampani (2025) 《Stable Virtual Camera:基于扩散模型的生成式视图合成》。收录于《IEEE/CVF 国际计算机视觉大会论文集》,第 12405–12414 页。引用于 §2.4。
- [87] H. Zhu, M. Zhao, G. He, H. Su, C. Li, 与 J. Zhu (2026) 《Causal Forcing:面向高质量实时交互式视频生成的自回归扩散蒸馏正确方法》。收录于《国际机器学习大会 (ICML)》,注:arXiv:2602.02214。引用于 §2.3, §5.2。
- [88] K. Zou, D. Zheng, H. Liu, T. Hang, B. Liu, 与 N. Yu (2026) 《HiAR:通过分层去噪实现高效自回归长视频生成》。外部链接:2603.08703,链接 引用于 §2.3。