摘要
我们提出 PhiZero,一个围绕“物理语言”构建的物理世界模型。“物理语言”是一种对世界状态转移的紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象出预测结构、并将其组织为自然语言以进行显式推理的能力启发,我们通过自监督方式从野外视频中学习物理语言,并利用它显式地推理物理世界如何演化。据此,PhiZero 采用“先推理、后渲染”的范式:它首先将未来世界演化推断为物理语言序列,然后将推断出的转移渲染为视频。在生成与理解基准上的大量实验验证了 PhiZero 对物理一致的世界演化进行建模的能力。我们进一步展示了它在真实感与交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。
1 引言
“你看见了,但并未观察。”——夏洛克·福尔摩斯,《波希米亚丑闻》
视频世界模型能够生成具有高视觉保真度的未来视频,因此日益被视为有前景的物理世界模拟器(OpenAI,2025;Google DeepMind,2026)。要让此类模型支撑 Physical AI,其核心目标必须超越视觉保真度,转向学习物理世界如何演化。然而,主流方法主要通过像素空间中的直接预测进行训练,将底层动态隐含在高维视觉表征中,往往导致物理上不一致的结果。
我们从人类智能中汲取灵感。人类并非机械记忆每一个视觉结果,而是从视觉经验中抽象出规律,将其转化为关于世界如何演化的可泛化知识。自然语言是人类组织和表达这类知识的主要媒介,它提供了一个符号空间,使人类能够进行显式推理。语言模型在数字领域的成功进一步证明了语言作为学习与推理基质的可扩展性。然而,当建模目标从数字世界转向物理世界时,自然语言往往过于粗糙,难以忠实表征视觉经验中观察到的复杂状态转移。因此我们不禁要问:我们能否超越自然语言,学习一种更细粒度的物理世界状态转移表征,从而实现显式推理?
为此,我们提出 PhiZero——一个围绕“物理语言”构建的物理世界模型*。*此处“物理”泛指物理世界,而非物理定律的符号体系。这种语言通过自监督学习从无标注的真实世界视频中习得,能够捕获多样化视觉经验中的状态转移模式(图 1)。一旦习得,物理语言便提供了一种中间表征,用于在渲染成视频之前推断世界演化。这种“先推理、后渲染”的范式将动力学推断与像素级合成相分离,使世界演化成为显式推理的目标,而非直接的像素空间预测。
学习一种能够捕捉世界演化方式的物理语言,需要将世界动态与视觉外观分离开来。为此,我们开发了一种物理语言分词器(Physical Language Tokenizer),通过自监督视频重建来学习这种表征。给定一段视频,该分词器将其状态转移编码为离散的物理语言序列,该序列与首帧一起,作为预训练扩散解码器的条件输入,用于重建视频。解码器预训练生成先验能够恢复细粒度的视觉细节,而首帧则锚定静态场景外观,从而使离散瓶颈层能够专注于状态变化,而非冗余的外观信息。我们进一步引入了一个基于预训练VLM初始化的物理语言推理器(Physical Language Reasoner)。该推理器利用VLM的视觉语义知识和常识先验,从当前视觉状态和动作意图出发,自回归地预测物理语言序列。随后,该预测序列由扩散解码器渲染成视频。
大量实验在评估物理保真度的视频生成基准和评估物理合理性的视频理解基准上验证了PhiZero。我们进一步证明,物理语言为表示、控制和转移物理世界中的状态转移提供了一种通用接口,支持在顺序控制输入下的交互式推演、细粒度的动作条件世界建模以及零样本运动迁移(图1)。综合来看,这些结果使PhiZero成为可控且可迁移的物理世界建模的一个有前景的框架,在物理AI领域具有广阔潜力。
- •
我们引入了物理语言(physical language),这是一种状态转移模式的紧凑离散表征,可以通过自监督学习从野外视频中大规模习得。
- •
我们开发了PhiZero,一个围绕物理语言构建的物理世界模型。PhiZero采用“先推理后渲染”(reason-then-render)范式,首先在物理语言空间中推断未来的世界演化,然后将推断出的转移渲染为视频。
- •
大量实验验证了 PhiZero 在物理生成与物理理解两个方面的表现。我们进一步展示了其在交互式推演、动作条件世界模拟以及零样本动作迁移方面的潜力。
2 相关工作
2.1 物理世界模型
近期研究越来越多地通过扩展视频生成与预测的规模来构建物理世界模型,从而在语言或动作条件下模拟未来的视觉状态。Yang 等人(2023)从异构真实世界数据中学习交互式模拟器,而 Wang 等人(2024);Xiang 等人(2024)则通过离散视觉预测和语言条件视频生成来建模世界演化。Agarwal 等人(2025);Ali 等人(2025);Agarwal 等人(2026)进一步通过预训练世界基础模型、统一多模态条件以及面向 Physical AI 的全模态建模推进了这一范式。其他系统则通过自回归去噪或潜在状态预测后再进行视频渲染来改进长时程模拟(Zhu 等人,2025;Xiang 等人,2025)。这些方法主要是在像素空间中表示世界演化。相比之下,PhiZero 将状态转移显式表示为一种紧凑的离散物理语言,在该转移空间中进行世界演化的推理,然后将推理得到的演化过程渲染为视频。
2.2 从无标注视频中学习世界动态
已有大量研究工作探索如何从无标注视频中学习具有预测性和可操作性的世界动态表征。Bruce 等人(2024)和 Gao 等人(2025)从互联网视频中观察到的逐帧变化中发现了可控的潜在动作空间。在机器人和自动驾驶领域,Schmidt & Jiang(2024)、Ye 等人(2025)、Chen 等人(2025)、Bu 等人(2025b)以及 Shang 等人(2026)学习了潜在动作,并将由此产生的运动先验迁移到下游控制任务中。Wu 等人(2023;2024)学习了能够捕捉跨场景可迁移的时间变化的潜在动态。Bardes 等人(2024)和 Assran 等人(2025)在表征空间中预测被掩蔽的时空区域,证明了大规模视频预训练可以产生有助于理解物理世界并对其进行规划的表征。Ren 等人(2025;2026)进一步研究了规划能力是否可以直接从面向任务的视频中习得。与这些方法不同,我们学习了一种紧凑的物理语言,用于捕捉物理世界中的状态转移模式,而不是与特定领域或任务绑定的潜在动作。
3 方法
如图 2 所示,PhiZero 由两个互补的组件构成。物理语言分词器将视频中的状态转移压缩为离散的物理语言序列,而扩散解码器则学习以首帧和提取出的物理语言为条件来渲染未来视频(第 3.2 节)。随后,物理语言推理器根据首帧和文本动作意图预测相应的物理语言序列(第 3.3 节)。
3.1 问题定义
形式上,设 为未来视频, 为表示当前世界状态的首帧, 为文本动作意图, 为描述从 到 转移的离散物理语言。物理语言作为状态转移的紧凑中间表征,捕捉了世界演化方式的共享模式。我们将未来预测建模为物理语言序列与未来视频的联合建模,该联合建模可分解为物理语言推理和视频渲染两部分:
| (1) |
物理语言推理器推断当前状态在物理语言空间中应如何演化,随后扩散解码器将推断出的状态转移渲染为未来视频。这种“先推理、后渲染”的分解方式,将状态转移推理与像素级合成分离开来。
3.2 物理语言分词器
带转移级 Q-Former 的编码器
给定一段视频,我们首先使用时空编码器获取潜在特征。我们并非从整个视频中提取全局表示,而是显式建模每对相邻潜在状态之间的转移。这引入了局部时间归纳偏置,既降低了每个压缩转移的复杂度,又保留了完整序列的时间顺序。设 为时间步 处的潜在状态。对于每对相邻状态,我们使用共享的 Q-Former(Li 等人,2023)提取转移表示:
| (2) |
其中 包含共享的可学习转移查询。通过联合关注两个相邻潜在状态,Q-Former 为每个时间间隔生成转移特征。我们按时间顺序拼接所有相邻间隔的特征,得到 ,其中 。随后,我们使用有限标量量化(FSQ)(Mentzer 等人,2024)对转移特征进行离散化。具体而言,特征被投影到低维量化空间中,并按如下方式量化:
| (3) |
其中 表示最终得到的离散物理-语言序列。FSQ 通过标量量化级别的笛卡尔积来构建其词表,因此无需单独学习的码本。最后,量化表示被投影到扩散 Transformer 的隐藏维度,从而得到物理-语言上下文 。
扩散先验解码器
有限容量的物理-语言瓶颈应专注于表示状态转移,而非编码视频重建所需的全部细粒度外观细节。因此,我们采用预训练的视频扩散模型(Wan et al., 2025)作为解码器,其强大的生成先验能够从紧凑的状态转移表示中恢复逼真的外观和视觉细节。为保留这一预训练生成先验,我们保持原始模型架构不变,仅将其文本条件替换为物理-语言上下文 。我们进一步将首帧作为干净的视觉条件,并将其视为静态外观的来源。通过首帧直接提供外观信息,离散瓶颈被引导去编码未来的状态变化,而非冗余的静态视觉细节。在物理-语言上下文 、首帧 、干净潜变量 和扩散时间步 的条件下,解码器使用标准流匹配(Liu et al., 2023b)目标重建目标视频:
| (4) |
纯噪声预热
预训练的扩散解码器最初可能会忽略新引入的物理语言上下文,转而依赖部分损坏的目标信息及其已有的去噪先验。为防止这种走捷径的行为,我们引入了一个纯噪声预热阶段,在该阶段中,所有未来帧的潜变量均从纯噪声初始化。因此,解码器必须依赖物理语言上下文和首帧来重建未来视频。预热结束后,我们恢复标准的流匹配噪声调度。该策略缓解了去噪捷径问题,并为学习信息丰富的物理语言表征提供了更强的监督信号。
数据整理流水线
我们分两个阶段训练物理语言分词器:大规模预训练,随后进行有针对性的 SFT。如图 3 所示,对于预训练,我们从包含约 5 万小时素材的真实世界视频池开始。我们去除重复内容,并过滤掉存在技术缺陷的片段,包括压缩伪影、损坏帧和水印,以及不满足分辨率或时长要求、或包含突兀镜头切换的片段。该流程最终产生约 1 万小时的无标注视频用于分词器预训练。在后续的 SFT 阶段,我们基于美学质量、运动幅度以及由 VLM 评判器评估的状态转换可观测性,应用更严格的第二轮过滤程序。与此同时,我们通过移除渲染质量低、时长无效或物体运动不足的样本,筛选出约 1 千小时的仿真视频。将所得的真实世界数据与仿真数据合并,可产生约 500 万个四秒视频片段用于分词器 SFT。更多数据细节见附录 A.1。
课程式训练方案
我们将这种两阶段训练方案与联合时间与空间课程学习相结合。在预训练阶段,我们以较低分辨率处理视频,并逐步将片段时长从 1 秒增加到 2 秒,最终增加到 4 秒。这使得分词器能够先学习局部状态变化,再对更长范围的世界演化进行建模。随后,我们提高重建分辨率,并在精心筛选的 500 万片段语料库上进行 SFT。最后,我们冻结分词器,仅微调扩散解码器以进一步提升重建质量。更多训练细节见附录 A.1。
3.3 物理语言推理器
基于预训练 VLM 的物理语言推理
预测未来状态转换需要在当前视觉状态的语境中解读文本动作意图,并推断世界应如何演化。预训练的 VLM 从大规模图像-文本数据中编码了丰富的视觉语义和常识性世界知识,为这一任务提供了强有力的先验。因此,我们从预训练的 VLM(Bai et al., 2025a)初始化物理语言推理器。为使其适应物理语言分词器所学习的物理语言空间,我们为每个 FSQ 索引扩展了一个独特的原子符号到其词汇表中。给定首帧和文本提示词,物理语言推理器在 FSQ 诱导的词汇表上自回归地预测一个长度为的物理语言序列。其条件分布按时间顺序分解为
| (5) |
我们通过使用冻结的物理语言分词器对每个训练视频进行编码,离线生成监督信号。在教师强制下,物理语言推理器以自回归交叉熵目标进行优化
| (6) |
数据筛选流程
我们分两个专业化程度逐步提升的阶段来构建物理语言推理器的训练数据。如图 3 所示,在继续预训练阶段,我们复用了用于物理语言分词器 SFT 的约 500 万个精选四秒真实世界与仿真片段。对于每个片段,VLM 生成的描述和首帧作为输入,而冻结的物理语言分词器则提供目标物理语言序列。为防止文本条件泄露结果,如表 14 所示,我们提示 VLM 仅概括每个片段中高层次的起始动作或交互,而非叙述细粒度的状态转变细节。为构建后续的 SFT 语料,我们进一步使用基于 VLM 的丰富运动过滤器与物理过滤器对该通用数据集进行筛选,保留具有显著状态变化和富含物理信息交互的片段。结合精选的仿真器生成样本,该流程最终产出约 100 万个运动丰富且富含物理信息的四秒片段,用于推理器的 SFT。更多数据细节见附录 A.2。
两阶段训练方案
我们采用两阶段方式训练物理语言推理器,数据分布逐步专业化。在第一阶段,我们从预训练的 VLM(Bai 等,2025a)初始化模型,并在 500 万片段的通用语料上进行继续预训练。该阶段使 VLM 适应自回归物理语言预测,并建立文本意图、当前视觉状态与结果状态转变之间的对应关系。在第二阶段,我们在约 100 万个运动丰富且富含物理信息的片段语料上进行 SFT。通过将训练集中于具有显著运动与物理意义后果的交互,该阶段提升了推断状态转变的物理合理性与精确度,同时保留了继续预训练阶段习得的建模世界转变的广泛能力。更多训练细节见附录 A.2。
| 模型 | S-IoU | ST-IoU | WS-IoU | IQ-Score |
|---|---|---|---|---|
| Wan2.2-5B(Wan 等,2025) | 24.7 | 22.6 | 13.3 | 21.2 |
| Sora 2(OpenAI,2025) | 37.3 | 27.0 | 26.9 | 26.5 |
| Cosmos3-Nano(Agarwal 等人,2026) | 40.4 | 22.0 | 24.6 | 29.1 |
| Wan2.2-14B(Wan 等人,2025) | 51.1 | 20.5 | 28.5 | 32.2 |
| 混元视频(Kong 等人,2024) | 47.1 | 26.9 | 29.7 | 33.4 |
| Grok-Video(xAI,2026) | 52.7 | 21.4 | 35.7 | 34.8 |
| Cosmos3-Super(Agarwal 等人,2026) | – | – | – | 39.5 |
| PhiZero(本文) | 58.2 | 36.8 | 27.6 | 41.2 |
| 模型 | 综合质量 | 物理评分 | 总体 |
|---|---|---|---|
| LTX-Video-19B(HaCohen 等人,2026) | 2.56 | 2.54 | 2.55 |
| LTX-Video-22B(HaCohen 等人,2026) | 2.59 | 2.56 | 2.57 |
| Wan2.2-5B(Wan 等人,2025) | 2.67 | 2.65 | 2.66 |
| Cosmos2.5-2B(Gu,2025) | 2.79 | 2.70 | 2.74 |
| OmniWeaving(Pan 等人,2026) | 2.89 | 2.78 | 2.84 |
| Veo3.1(Google DeepMind,2026) | 3.01 | 2.85 | 2.93 |
| Wan2.2-14B(Wan 等人,2025) | 3.00 | 2.90 | 2.95 |
| PhiZero(本文) | 2.93 | 3.01 | 2.97 |
| 模型 | 物理遵循度 | 常识 | 总计 |
|---|---|---|---|
| Pandora(Xiang 等人,2024) | 4.05 | 0.95 | 6.57 |
| OpenSora-Plan(Lin 等人,2024) | 3.85 | 1.01 | 6.62 |
| CogVideoX(Yang 等人,2025c) | 3.88 | 0.99 | 6.75 |
| Mochi(Genmo AI,2025) | 4.14 | 1.26 | 7.62 |
| Luma(Luma AI,2024) | 4.13 | 1.57 | 7.72 |
| Wan2.2-5B(Wan 等人,2025) | 4.51 | 1.41 | 7.98 |
| Runway(Runway ML,2024) | 4.27 | 1.65 | 8.08 |
| PhiZero(本文) | 4.88 | 1.71 | 8.19 |
| 模型 | 简单 | 中等 | 困难 | 总体 |
|---|---|---|---|---|
| Cosmos-4B(Agarwal 等人,2025) | 46.00 | 52.00 | 48.05 | 49.41 |
| Qwen2.5-VL(Bai 等人,2025b) | 50.96 | 53.25 | 51.49 | 52.27 |
| Gemini-1.5 Pro(Gemini Team,2023) | 58.65 | 53.00 | 52.67 | 52.27 |
| GPT-4o(Achiam 等人,2023) | 57.69 | 54.75 | 54.17 | 53.75 |
| VideoMAEv2(Wang 等人,2023b) | 46.00 | 58.50 | 52.73 | 53.75 |
| V-JEPA(Bardes 等人,2024) | 52.00 | 53.00 | 57.42 | 53.75 |
| Gemini-2.5 Flash(Gemini Team,2023) | 64.42 | 56.75 | 54.46 | 55.63 |
| PhiZero(本文) | 60.98 | 60.50 | 52.38 | 56.34 |
| 模型 | 刚体 | 流体 | 光学 | 平均误差 |
|---|---|---|---|---|
| AnimateDiff-SDXL(Guo 等人,2023) | 61.44 | 53.33 | 37.65 | 56.0 |
| ZeroScope(Wang 等人,2023a) | 57.32 | 49.23 | 41.00 | 53.3 |
| ModelScope(Wang 等人,2023a) | 59.46 | 47.23 | 35.65 | 52.9 |
| Mochi(Genmo AI,2025) | 54.22 | 47.33 | 49.15 | 51.9 |
| CogVideoX-5B(Yang 等人,2025c) | 59.00 | 43.10 | 26.65 | 49.8 |
| CogVideoX-2B(Yang 等人,2025c) | 56.98 | 42.00 | 25.15 | 48.2 |
| Wan2.1-1.3B(Wan 等人,2025) | 44.66 | 57.10 | 41.65 | 48.0 |
| LTX-Video-2B(HaCohen 等人,2026) | 43.44 | 33.43 | 61.50 | 44.7 |
| CogVideoX1.5-5B(Yang 等人,2025c) | 44.14 | 47.90 | 42.65 | 43.8 |
| Wan2.1-14B(Wan 等人,2025) | 43.34 | 45.00 | 38.35 | 43.8 |
| 混元视频(Kong 等人,2024) | 36.34 | 48.67 | 41.15 | 43.6 |
| PhiZero(本文) | 29.14 | 53.15 | 37.50 | 41.7 |
| 模型 | RSI (%) | CCI (%) | 综合排名 |
|---|---|---|---|
| CogVideoX-2B (Yang et al., 2025c) | 41.50 | 0.93 | 10.0 |
| Wan2.2-5B (Wan et al., 2025) | 51.91 | -2.12 | 9.0 |
| Hunyuan-Video (Kong et al., 2024) | 52.05 | -0.29 | 8.0 |
| Wan2.1-1.3B (Wan et al., 2025) | 45.51 | 5.36 | 7.5 |
| Mochi (Genmo AI, 2025) | 49.12 | 3.85 | 8.0 |
| CogVideoX1.5-5B (Yang et al., 2025c) | 46.83 | 4.85 | 8.0 |
| CogVideoX-5B (Yang et al., 2025c) | 49.92 | 5.09 | 6.5 |
| LTX-Video-13B (HaCohen et al., 2026) | 56.48 | -4.32 | 7.0 |
| LTX-Video-2B (HaCohen et al., 2026) | 58.86 | -0.20 | 5.0 |
| Wan2.1-14B (Wan et al., 2025) | 53.24 | 5.91 | 3.5 |
| Wan2.2-14B (Wan et al., 2025) | 54.19 | 5.51 | 3.5 |
| PhiZero(我们的方法) | 55.54 | 6.20 | 2.0 |
4 实验
4.1 实现细节
对于物理语言分词器,时空编码器遵循 Wan2.2 VAE 编码器架构(Wan et al., 2025),并以其预训练权重进行初始化,而扩散解码器则以 Wan2.2-5B(Wan et al., 2025)进行初始化。我们优化时空编码器和过渡级 Q-Former 的所有参数,同时使用秩为 32 的 LoRA(Hu et al., 2022)对扩散解码器进行微调。我们使用标量量化级别配置 FSQ,生成包含 25K 个离散符号的词汇表,并在过渡级 Q-Former 中使用 32 个可学习查询。一段 33 帧的视频被编码为九个时间潜在状态;从每个相邻对中提取 32 个过渡符号,因此产生长度为 的物理语言序列。对于物理语言推理器,我们从预训练的 Qwen3-VL-4B(Bai et al., 2025a)初始化模型,并为每个 FSQ 索引扩展一个原子符号到其词汇表中。其他训练配置和数据细节见附录 A。
| 模型 | Token 数量 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|
| Wan2.2-5B VAE (Wan et al., 2025) | 44800 | 37.7 | 0.957 | 0.042 |
| Video-LaVIT(Jin 等人,2024) | 270 | 23.6 | 0.835 | 0.175 |
| VideoFlexTok(Atanov 等人,2026)() | 288 | 25.2 | 0.858 | 0.177 |
| VideoFlexTok(Atanov 等人,2026)() | 576 | 26.5 | 0.870 | 0.167 |
| 我们的方法 | 256 | 28.9 | 0.903 | 0.087 |
4.2 主要结果
视频生成结果
我们在三个面向世界模型的视频生成基准上评估了 PhiZero。Physics-IQ Verified(Rädsch 等人,2026)通过基于规则的指标,将生成的视频与真实参考视频进行对比,来衡量物理结果保真度。PhyGround(Lin 等人,2026)使用物理领域专用的 VLM 评测模型来评估物理定律遵循程度,而 WorldModelBench(Li 等人,2026a)则从物理遵循度和整体视频质量两方面评估通用世界建模能力。关于生成基准、评估协议和指标的更多细节见附录 B.1。如表 2、表 2 和表 4 所示,PhiZero 在全部三个生成基准上均取得了强劲表现。它在 Physics-IQ Verified 上取得了最佳 IQ-Score,在 PhyGround 上取得了最高的 Physics Score 和 Overall 分数,并在 WorldModelBench 上取得了最佳的 Physics Adherence 和 Total 分数。这些结果表明,PhiZero 生成的状态转换在多样化的开放域现象中与真实世界的物理结果高度吻合。
视频理解结果
我们进一步在三个视频理解基准上评估了 PhiZero。IntPhys2(Bordes 等人,2025)评估直觉物理理解,LikePhys(Yuan 等人,2025)评估模拟场景中的物理合理性判别,YoCausal(Xie 等人,2026)考察真实世界视频中的时间与因果理解。这三个基准均采用成对比较协议,要求模型区分物理或因果上有效的视频与其对应的无效版本。对于每一对视频,我们将两个视频都编码为物理语言序列,在物理语言推理器下计算它们的对数似然,并选择似然较高的视频作为有效结果。关于理解基准及我们基于似然的评估协议的更多细节见附录 B.2。如表 4、表 6 和表 6 所示,PhiZero 在所有三个理解基准上均取得了具有竞争力的表现,展示了其识别物理不一致性和因果违反的能力。
定性结果
如图 4 所示,我们将 PhiZero 与 Wan2.2-5B 基线(Wan 等人,2025)在来自 Physics-IQ Verified(Rädsch 等人,2026)的四个代表性案例上进行了比较。尽管 Wan2.2-5B 经常生成视觉上合理的交互,但它无法生成这些交互所预期的物理后果。例如,网球击中了橡皮鸭,但鸭子并未受到碰撞的影响。相比之下,PhiZero 生成了连贯的下游效应,包括碰撞引起的物体位移、重力作用下的形变、连锁反应以及变化的阴影。
物理语言分词器的重建性能
我们进一步评估了物理语言分词器在500段四秒真实世界视频上的重建性能,这些视频以8 FPS采样,并在分辨率下进行评估。我们报告的是排除首帧条件下的表示token数量。如表7所示,Wan2.2 VAE实现了较高的重建质量,但需要44,800个连续视觉token。相比之下,我们的物理语言分词器仅用256个离散的物理语言符号即可表示每段视频中的未来状态转移,并且在高度压缩的分词器中取得了最佳重建质量。这些结果表明,物理语言能够紧凑地编码状态转移,同时保留足够的信息用于高质量的视频重建。
4.3 消融实验
| 模型 | PSNR | SSIM | LPIPS |
|---|---|---|---|
| 无扩散解码器 | 26.6 | 0.875 | 0.119 |
| 无转移级Q-Former | 28.2 | 0.896 | 0.089 |
| 无纯噪声预热 | 27.9 | 0.894 | 0.091 |
| 完整模型 | 28.9 | 0.903 | 0.087 |
物理语言分词器设计消融实验
我们在表8中对物理语言分词器的关键设计组件进行了消融实验。将预训练的扩散解码器替换为传统的确定性解码器会导致最大的性能下降,这表明扩散先验能够恢复细粒度的外观细节,并使紧凑的瓶颈层专注于状态转移。将转移级Q-Former替换为全局Q-Former同样会降低重建质量,这验证了通过显式建模相邻潜在状态之间的转移所引入的局部时间归纳偏置的有效性。最后,移除纯噪声预热会持续降低重建性能,这表明预热机制促使解码器依赖物理语言条件,而非主要依赖其预训练的去噪先验。
(a) 自动驾驶
(b)机器人操作
| 方法 | IQ-Score |
|---|---|
| Wan2.2-5B(基线) | 21.2 |
| + 提示词增强 | 26.6 |
| 我们的方法(不含仿真数据) | 37.7 |
| 我们的方法(不含两阶段训练) | 39.2 |
| 我们的方法(完整版) | 41.2 |
物理语言推理器设计消融实验
我们在 Physics-IQ Verified 上评估了物理语言推理器。如表 9 所示,提示词增强提升了 Wan2.2-5B 基线的表现,但仍明显低于 PhiZero,这表明仅靠自然语言推理不足以建模细粒度的状态转移。移除仿真数据同样导致性能下降,证实了仿真器生成的交互能够改善对物理合理转移的预测,并有益于真实世界视频生成。这一结果进一步凸显了利用仿真器生成数据扩展物理语言推理的潜力。最后,将两阶段训练替换为联合训练会降低性能,表明在精心筛选的、富含运动且物理信息丰富的视频语料上进行专门的 SFT,有助于模型推断更精确且物理合理的状态转移。
4.4 物理语言分析
物理语言的迁移性
我们研究物理语言是否能够将状态转移与视觉外观分离开来。给定一个源视频,我们使用物理语言分词器(Physical Language Tokenizer)对其状态转移进行编码,编辑第一帧以指定不同的目标外观,然后基于编辑后的帧对不变的物理语言序列进行解码。如图 5 所示,迁移后的视频在外观和背景变化中保留了转移模式,包括倾倒、粘性扩散和液体流动。这些结果表明,物理语言捕获了可复用的转移信息,这些信息可以跨视觉外观进行迁移。
物理语言的语义结构
我们在两个具有明确定义运动学模式的领域——自动驾驶和机器人操作——中分析物理语言的语义结构。我们使用适应相应领域的物理语言分词器,并选择四个类别,每个类别 300 个样本。对于自动驾驶,我们从 nuScenes(Caesar 等人,2020)中选择左转、右转、直行和静止片段。对于机器人操作,我们从 AGI-Bot RealRobot(Bu 等人,2025a)中选择四种夹爪转移模式:闭合时向下移动、闭合时向上移动、张开时向下移动和扫掠。我们将转移特征聚合成片段级表示,使用 PCA 将其降维至 20 维,再使用 UMAP(McInnes 等人,2018)进一步投影至 3D 空间。如图 6 所示,学习到的表示展现出清晰的运动学结构。在自动驾驶中,静止片段形成独立的簇,而不同的转向模式沿连续流形排列。在机器人操作中,四种夹爪转移模式形成紧凑且基本分离的簇。这些结果表明,物理语言捕获了有意义的状态转移语义,并根据世界如何变化而非视觉内容来组织视频。
4.5 更广泛的应用
我们进一步展示了 PhiZero 更广泛的应用潜力。通过显式表征物理世界如何演化,物理语言提供了一种外观解耦的接口,用于跨视觉外观和域表征、控制及迁移状态转移。该接口支持物理逼真的视频生成、细粒度动作条件世界建模、交互式推演,以及跨具身和视觉域的零样本迁移。
物理逼真的视频世界模型
PhiZero 可作为通用视频世界模型,从当前视觉状态预测物理一致的未来演化。如图 7(a) 所示,它建模了多种真实世界动态,包括海浪拍击岩石、液体倒入容器、物体落入热油中产生飞溅,以及金属罐爆炸成火焰和碎片。这些示例既捕捉了复杂事件的完整时间演化,也捕捉了其细粒度后果,展示了 PhiZero 以强物理一致性建模开放域世界动态的能力。
可控且交互式的世界模型
现有的基于动作条件的世界模型通常直接将控制信号映射到未来视频,这使得对状态演变的精确控制变得困难。相比之下,PhiZero 将状态转换推理与像素合成分离开来:给定一条轨迹或动作信号,物理语言推理器(Physical Language Reasoner)首先预测相应的物理语言,然后将其解码为未来视频。我们在 nuScenes(Caesar 等人,2020)和 AGI-Bot RealRobot(Bu 等人,2025a)上验证了这一能力。如图 7(b) 和 (c) 所示,PhiZero 能够捕捉驾驶轨迹中的细微变化,例如不同的转向幅度,并准确跟随动作信号生成精确的夹爪运动。它还支持在连续控制输入下的交互式世界建模。如图 7(d) 所示,模型根据连续的控制指令更新相机视角和位置,同时保持时间一致性。这些结果展示了 PhiZero 在细粒度、可控和交互式世界建模方面的潜力。可控和交互式世界模型的更多训练与推理细节见附录 C.1。
零样本跨具身迁移与仿真到现实迁移
由于物理语言将状态转移与视觉外观解耦,PhiZero 支持跨具身形态和视觉领域的零样本迁移。如图 8(a) 和 (b) 所示,我们将人类运动视频的状态转移编码为物理语言,通过将人体替换为 Unitree G1 人形机器人或将人手替换为 Sharpa 灵巧手来编辑其首帧,并在编辑后的首帧条件下解码不变的物理语言序列。这实现了将全身和手部运动模式迁移到差异显著的具身形态,而无需针对目标形态进行训练。同样的公式还支持仿真到现实的迁移。如图 8(c) 所示,我们将 LIBERO(Liu 等人,2023a)视频的首帧转换为逼真的视觉领域,并在新外观下渲染原始的仿真状态转移。这些结果表明,物理语言提供了一种跨具身形态和视觉领域的可迁移接口,在演示重定向、跨形态迁移以及从仿真低成本生成逼真交互数据方面具有潜力。零样本跨具身和仿真到现实迁移的更多适配与推理细节见附录 C.2。
5 结论
我们提出了 PhiZero,一个围绕物理语言构建的物理世界模型。与直接在像素空间中预测未来视频的传统视频模型不同,PhiZero 学习物理语言:一种通过自监督学习从无标注的真实世界视频中提取的状态转移模式的紧凑离散表示。基于这一表示,PhiZero 遵循“先推理、后渲染”的范式:它首先在物理语言空间中预测未来的世界演化,然后将推断出的转移过程渲染为视频。在生成和理解的多个基准上的大量实验表明,PhiZero 能够生成物理上连贯的结果,并识别出物理上不合理的事件。物理语言还为进一步提供了细粒度动作条件模拟、交互式 rollout 以及跨具身形态和视觉领域的零样本运动迁移的接口。这些结果凸显了物理语言在可扩展、可控和可迁移的物理世界建模方面的潜力。我们还在附录 E 中进一步讨论了局限性和未来工作。
附录 A 附加训练细节
A.1 物理语言分词器
我们分两个阶段训练物理语言分词器:大规模预训练,随后进行有针对性的 SFT,并采用时间与空间联合课程。对于预训练,我们汇总了表 10 中列出的数据集。去重后,我们过滤掉存在技术缺陷的片段,包括压缩伪影、损坏帧和水印,以及那些不满足分辨率或时长要求或包含突兀镜头切换的片段。这一过程产生了约 10K 小时的无标注真实世界视频,用于分词器预训练。
| 数据集 | 时长(小时) |
|---|---|
| 内部数据 | 3329 |
| HOIGen-1M (Liu et al., 2025b) | 2200 |
| OpenVid-1M (Nan et al., 2025) | 2051 |
| Moments in Time (Monfort et al., 2019) | 844 |
| Kinetics-710 (Li et al., 2022) | 840 |
| Sekai-walking (Li et al., 2026b) | 288 |
| SSV2 (Goyal et al., 2017) | 245 |
| UltraVideo (Xue et al., 2025) | 142 |
| WISA-80K (Wang et al., 2026b) | 141 |
| 总计 | 10K |
在前三个预训练阶段,我们保持输入和重建分辨率不变,并逐步将片段时长从 1 秒(9 帧)增加到 2 秒(17 帧),最终达到 4 秒(33 帧)。在第四个预训练阶段,分词器继续接收原始分辨率的输入,而扩散解码器则重建目标分辨率。这种跨分辨率重建机制促使紧凑的物理语言瓶颈专注于状态转换,同时允许扩散解码器依赖其生成先验来恢复高频外观细节。
对于分词器的 SFT,我们基于美学质量、运动幅度以及 VLM 评估的状态转换可观测性,对真实世界语料库应用了更严格的第二轮过滤流程。在过滤掉渲染质量低、时长无效或物体运动不足的样本后,我们进一步纳入了仿真视频。由此产生的语料库包含约 500 万个四秒片段,详见表 11。我们首先在此精选语料库上微调完整模型。在最后的优化阶段,我们冻结时空编码器、转换级 Q-Former 和 FSQ 量化器,仅优化扩散解码器。此外,我们还应用了熵正则化损失(Yu et al., 2023)以促进 FSQ 词汇表的均衡利用,以及 REPA 损失(Yu et al., 2024a)以提高扩散表示的语义质量。所有训练阶段均使用 128 块 NVIDIA A100 GPU。表 12 总结了完整的训练计划。
| 数据集 | 类型 | 片段数 |
|---|---|---|
| 内部数据 | 真实 | 2545K |
| HOIGen-1M (Liu et al., 2025b) | 真实 | 574K |
| Moments in Time (Monfort et al., 2019) | 真实 | 528K |
| OpenVid-1M (Nan et al., 2025) | 真实 | 516K |
| SSV2 (Goyal et al., 2017) | 真实 | 180K |
| Sekai-walking (Li et al., 2026b) | 真实 | 173K |
| Kinetics-710 (Li et al., 2022) | 真实 | 128K |
| UltraVideo (Xue et al., 2025) | 真实 | 82K |
| WISA-80K (Wang et al., 2026b) | 真实 | 44K |
| Physics101 (Wu et al., 2016) | 仿真 | 1K |
| Phyco (Narayanan et al., 2026) | 仿真 | 126K |
| ComPhy (Chen et al., 2022) | 仿真 | 60K |
| Cosmos3(Agarwal 等人,2026) | 仿真 | 51K |
| CLEVRER(Yi 等人,2019) | 仿真 | 20K |
| Physion++(Tung 等人,2023) | 仿真 | 10K |
| Physion(Bear 等人,2021) | 仿真 | 9K |
| 总计 | – | 5M |
| 配置 | 预训练阶段 1 | 预训练阶段 2 | 预训练阶段 3 | 预训练阶段 4 | 全量 SFT | 仅解码器 SFT |
|---|---|---|---|---|---|---|
| 帧数 | 9 | 17 | 33 | 33 | 33 | 33 |
| 时长 | 1秒 | 2秒 | 4秒 | 4秒 | 4秒 | 4秒 |
| 全局批大小 | 256 | |||||
| 输入分辨率 | ||||||
| 输出分辨率 | ||||||
| 训练步数 | 150K | 100K | 100K | 50K | 50K | 50K |
| 初始纯噪声步数 | 50K | 20K | 20K | 0 | 0 | 0 |
| 预热步数 | 1K | |||||
| LoRA 秩 | 32 | |||||
| FSQ 熵损失权重 | 0.005 | |||||
| REPA 损失权重 | 0.1 | |||||
| 学习率 | ||||||
| AdamW 贝塔参数 | ||||||
| 最大梯度范数 | 1.0 | |||||
A.2 物理语言推理器
我们分两个阶段训练物理语言推理器。在阶段 1,我们在用于物理语言分词器 SFT 的同一 5M 四秒片段上继续进行预训练。对于每个片段,提供首帧和 VLM 生成的高层动作描述作为输入,而冻结的物理语言分词器将完整视频编码为目标物理语言序列。在阶段 2,我们在约 1M 片段的语料库上进行以运动为重点的 SFT,该语料库包含使用基于 VLM 的运动质量和物理交互过滤器从 5M 片段语料库中选出的 800K 样本,以及 200K 个额外的模拟器生成样本。此阶段将训练集中在显著且物理信息丰富的状态转换上。首帧以 分辨率提供,动作描述使用表 14 中的提示词生成。两个训练阶段均使用 128 块 NVIDIA A100 GPU,其超参数汇总于表 13。
| 配置 | 继续预训练 | 以运动为重点的 SFT |
|---|---|---|
| 全局批大小 | 512 | |
| 首帧分辨率 | ||
| 训练步数 | 50K | 10K |
| 预热步数 | 1K | |
| 学习率 | ||
| AdamW 贝塔参数 | ||
| 最大梯度范数 | 1.0 | |
系统提示词 你是一名专业的视频字幕专家。你的任务是为视频片段生成一条简洁、高层级的动作条件描述,用于训练物理世界模型。• 写出一句或一段简洁流畅的英文句子。• 控制在25-60个单词之间。• 使用现在时态,只描述可见内容。• 在可观察的情况下,涵盖主要主体、动作、场景、镜头/构图、光线、色彩和视觉风格。关键规则:• 优先保证空间精度。• 聚焦于高层级的起始动作或交互意图,而不是叙述完整的时间演变过程。避免细粒度的中间动作、状态变化和次要物理效果。用户提示词 请仔细观看此视频,并严格按照你的指令生成一条字幕。
附录 B 附加评估细节
B.1 物理视频生成评估
我们在三个物理视频生成基准上评估 PhiZero。对于所有基准,模型将提供的第一帧和文本条件作为输入,我们遵循官方评估协议并使用已发布的评估器。
Physics-IQ Verified
Physics-IQ Verified(Rädsch 等人,2026)评估生成的视频是否复现了66个受控真实物理实验的结果。生成的视频与真实参考视频通过空间IoU(S-IoU)、时空IoU(ST-IoU)和加权空间IoU(WS-IoU)进行比较,这三项指标分别评估场景变化的位置、时间和时间频率。IQ-Score 在通过重复真实实验之间的差异进行归一化后,聚合这些指标。
PhyGround
PhyGround(Lin 等人,2026)包含250个精选的图像-文本条件,涵盖固体力学、流体动力学和光学中的13条物理定律。我们遵循官方协议,使用已发布的 PhyJudge-9B 评估器,并以4 FPS 采样生成的视频。每个视频根据特定标准的评分细则按1到5分进行评分。General Quality 评估提示词对齐、时间有效性和物体一致性,而 Physics Score 衡量对每个样本适用的物理定律的遵循程度。Overall 是 General Quality 和 Physics Score 的平均值。
WorldModelBench
WorldModelBench(Li 等人,2026a)通过来自七个领域和 56 个子领域的 350 个图像-文本条件来评估通用世界建模能力,涵盖自动驾驶、机器人、人类活动、工业场景、游戏、动画和自然环境。我们遵循官方协议,使用已发布的 2B-VLM 评判模型。物理一致性(Physics Adherence)评估五项物理一致性标准,评分范围为 0 到 5;常识(Common Sense)评估空间和时间视觉质量,评分范围为 0 到 2。总分由该基准评估的所有指标求和得出。
B.2 物理视频理解评估
IntPhys2
IntPhys2(Bordes 等人,2025)通过匹配的可能与不可能视频对来评估直觉物理,涉及物体恒存性、不可变性、时空连续性和固态性。其主集包含 1,012 个视频,组织为 253 个四元组,每个场景包含两个可能结果和两个不可能结果。我们比较每对匹配的可能-不可能组合的物理语言似然度,并报告可能视频获得更高似然度的组合所占百分比。结果分别在 Easy、Medium 和 Hard 子集上报告,同时给出完整主集上的总体准确率。
LikePhys
LikePhys(Yuan 等人,2025)包含来自 12 个场景的受控有效-无效视频对。每次比较中的视频在视觉外观上匹配,主要区别在于相关物理原理是否得到满足。遵循其似然偏好协议,合理性偏好误差(PPE)是指无效视频获得与有效视频相同或更高似然度的比较所占的百分比;因此,数值越低表示物理理解能力越强。我们报告刚体力学、流体力学和光学效应的 PPE,以及所有 12 个场景的平均误差(Avg. Error)。
YoCausal
YoCausal(Xie 等人,2026)包含 1,232 对真实世界视频。每个自然正向视频都与其时间反转版本配对,且两个方向使用相同的文本描述。反转惊奇指数(RSI)是四个源数据集中正向视频偏好率的平均值,其中当自然视频获得更高的物理语言似然时即为正向偏好;50% 对应随机水平。该基准进一步利用 VLM 标注将视频划分为因果子集和非因果子集,并定义了因果认知指数。综合排名结合了模型在 RSI 和 CCI 上的排名,排名越低表示整体性能越好。
评估协议
所有三个基准均通过共享文本条件下的成对似然比较进行评估。遵循官方评估协议,对于 LikePhys,我们使用官方为每个场景提供的提示词模板,该模板由该场景的所有有效和无效变体共享;对于 YoCausal,我们使用基准为正向视频及其时间反转版本提供的提示词。IntPhys2 不提供实例级别的文本描述。因此,我们使用 VLM 为每个视频四元组生成一条场景级描述。该 VLM 仅观察四个视频的首帧,无法访问未来帧或有效性标签,并被指示仅描述它们共享的可见场景和初始配置。我们还将生成的描述原样应用于四元组中的所有四个视频。形式上,设表示一个匹配对及其共享文本条件。对于每个视频,我们使用其自身的首帧和相同的文本条件,将其编码为物理语言序列,并计算
| (7) |
因此,每次比较中的两个似然仅在所评估的视频及其对应的首帧上有所不同,而文本条件保持相同。具有更高序列似然的视频被选为物理有效或时间上自然的那个。
附录 C 更广泛应用的训练与推理细节
C.1 可控且交互式的世界模型
机器人世界模型
在机器人操作方面,我们在 AGI-Bot RealRobot 数据集(Bu 等人,2025a)上对 PhiZero 进行了适配。我们首先在 RealRobot 视频上对物理语言分词器(Physical Language Tokenizer)进行微调,使学习到的物理语言能够捕捉特定领域的机械臂和夹爪状态变化。对于每段四秒的片段,所有机械臂关节和夹爪位姿的对应轨迹均以 8 FPS 采样。在每个时间步,这些数值按固定顺序排列并序列化为数值文本,用作物理语言推理器(Physical Language Reasoner)微调的动作条件。在推理时,期望的关节和夹爪轨迹被转换为相同的文本格式,并与当前观测一起输入。推理器将该动作序列转换为物理语言,领域适配的解码器则将由此产生的机器人交互渲染为未来视频。
驾驶世界模型
我们采用相同流程,在 nuScenes(Caesar 等人,2020)上构建了轨迹条件化的驾驶世界模型。我们首先在 nuScenes 视频上对物理语言分词器进行微调,使表征和解码器适配驾驶场景的演化。未来四秒的自车轨迹以 8 FPS 采样,并序列化为按时间排序的数值文本序列。随后,使用首帧和文本化的自车轨迹对物理语言推理器进行微调,而从对应未来视频中提取的物理语言序列则作为预测目标。在推理时,候选自车轨迹被转换为相同的数值文本格式。推理器在物理语言空间中预测场景在该轨迹下应如何演化,随后解码器渲染出相应的未来驾驶视频。这种设计使模型能够遵循细粒度的轨迹变化,包括不同的转向方向和幅度,而无需修改通用的“先推理后渲染”架构。
交互式世界模型
对于交互式世界建模,控制输入直接以自然语言形式表达,作为描述摄像机视角或摄像机位置所需变化的指令。由于当前模型生成四秒长的片段,我们通过滑动窗口自回归推演(sliding-window autoregressive rollout)将生成扩展到这一固定时长之外。从当前帧开始,模型预测下一个四秒视频片段,生成片段的最后一帧随后用作下一个窗口的首帧条件。重复这一过程可生成更长的视频,并允许通过连续的自然语言控制逐步修改摄像机轨迹。
C.2 动作迁移
迁移协议
我们的动作迁移流程不需要成对视频。相反,我们在每个源域的视频上对物理语言分词器(Physical Language Tokenizer)进行简短微调,使其能够更准确地将相应的动作模式编码为物理语言。完成源域适配后,动作迁移可直接执行,无需进一步训练。给定一个源视频,我们首先将其状态转换编码为物理语言序列。然后使用 GPT-Image 2.0 编辑首帧,将原始主体或视觉外观替换为所需的目标具身形态或目标域。随后,未改变的物理语言序列以编辑后的首帧为条件进行解码。通过这种方式,首帧指定目标场景应呈现的外观,而物理语言则指定其应如何随时间演化。
人体动作迁移
针对人体运动迁移,我们构建了一个包含多样且显著全身人体运动的子集。源视频收集自(Chen et al., 2026c; Allshire et al., 2025)。我们在此子集上对物理语言分词器(Physical Language Tokenizer)进行简要微调,使其适配人体运动。在推理阶段,源人体运动视频被编码为物理语言,同时其首帧被编辑,将人体主体替换为目标人形机器人。从编辑后的首帧解码原始物理语言序列,即可将全身运动迁移至人形机器人本体,且无需配对的人-机器人训练数据。
人手运动迁移
针对人手到灵巧手的迁移,我们从(Lim et al., 2026)构建了一个包含丰富手部运动和物体交互的人手视频子集。尽管该数据集提供了配对的人与机器人数据,我们仅使用人手视频进行分词器适配,不使用其提供的配对关系或跨本体对应关系。在推理阶段,我们编辑首帧,将人手替换为目标灵巧手,并在该编辑后的外观条件下解码源物理语言序列。这实现了细粒度手部运动及交互模式的迁移,且无需配对监督。
仿真到现实迁移
针对仿真到现实的迁移,我们在来自 LIBERO(Liu et al., 2023a)的仿真交互视频上对物理语言分词器进行简要微调。适配过程中不使用任何配对的真实世界视频。给定一个仿真源视频,我们将其状态转移编码为物理语言,并使用 GPT-Image 2.0 将首帧转换为逼真的视觉外观。随后,我们在编辑后的逼真帧条件下解码不变的物理语言序列,生成一个保留仿真中演示交互的逼真视频。
附录 D 补充相关工作
D.1 潜在动作世界模型
潜在动作模型从观测序列中推断紧凑的转移变量,通常通过逆向动力学瓶颈结合前向预测器来实现。早期方法从相邻观测中学习离散的潜在动作,并利用它们预训练可控世界模型或下游策略(Cui & Gao, 2023; Schmidt & Jiang, 2024; Bruce et al., 2024; Ye et al., 2025; Gao et al., 2025)。近期工作沿着若干互补方向扩展了这一范式。Garrido 等人(2026)将潜在动作世界模型扩展到异构的真实世界视频,并研究了受约束的连续表示。Jiang 等人(2026b)通过控制效果对齐来对齐跨视觉上下文的潜在动作语义,而 Wang 等人(2026c)将场景动态分解为面向多实体环境的逐因子潜在动作。Zhang 等人(2026a)明确地将动态相关结构与视觉内容解耦。其他方法将潜在动作与混合数据控制或统一建模联系起来:Alles 等人(2025)对齐无动作和有动作条件的轨迹以用于离线强化学习,Wang 等人(2025a)联合演化潜在动作推断和预训练视频世界模型,Bi 等人(2025)在统一架构中整合了理解、视频生成和动作预测。Chen 等人(2026a)引入了一种统一的物理语言,通过视觉锚定的交叉重建来对齐人类和人形机器人的动作,用于策略学习和世界建模。尽管取得了这些进展,潜在动作世界模型主要用于控制,通常针对特定具身形态和任务或相对受限的环境。相比之下,PhiZero 利用这种转移建模范式来表示物理世界本身的开放域演化,从多样化的真实世界视频中学习一种物理语言,并显式地对其进行推理,既用于未来视频生成,也用于状态转移理解。
D.2 视频分词器
视频 tokenizer 通过利用空间和时间冗余,将视频压缩为紧凑的表示。一条主要的研究路线是将持久的视觉内容与时间变化分离开来。Sun 等人(2023)将视频分解为场景、物体和运动 token,而 Jin 等人(2024)则将关键帧与运动 token 交错排列。Yu 等人(2024b);Tian 等人(2025);Wang 等人(2025b);Liu 等人(2025a)通过内容帧、参考图像或分层潜变量对视频进行分解,Wang 等人(2026a);Chen 等人(2026b)则进一步用关键帧或时间不变 token 来概括共享外观,同时对时间残差进行紧凑编码。近期工作越来越多地采用基于扩散的解码器,使紧凑表示能够省略细微的视觉细节,这些细节可由生成先验恢复。Ge 等人(2025);Li 等人(2024)将预训练的视频扩散模型以压缩的时空特征为条件,而 Yang 等人(2025a)则用条件因果扩散解码器重建视频。Atanov 等人(2026)用生成流解码器学习可变长度的由粗到细 token,Teng 等人(2026)则将基于查询的 1D 潜变量与像素空间扩散解码器相结合,实现自适应压缩。与此密切相关的是,Ressler-Antal 等人(2025)通过视频重建学习外观解耦的运动表示,用于开放世界运动迁移和运动理解。我们的物理语言 tokenizer 同样采用生成式解码器,但所学习的物理语言并不仅仅用于视频重建。它还作为一个显式的预测目标,模型通过它先对未来的世界演化进行推理,再将推断出的转变渲染为视频。
D.3 物理逼真的视频生成
现有提升视频生成物理一致性的方法大致沿三个方向展开。第一类引入源自物理模拟器的显式约束。例如,Montanaro 等人(2024)使用模拟器生成的光流,Liu 等人(2024)执行刚体模拟,Foo 等人(2026)集成三维物理模拟器。第二类通过外部模型或模拟数据迁移物理先验,通常借助表征对齐实现(Zhang 等人,2026b;Bhowmik 等人,2025;Kim 等人,2026)。在这一研究脉络中,Xiong 等人(2026)引入从模拟中获取的三维几何线索,而 Jiang 等人(2026a)从 VAE 潜变量中学习运动先验。第三类将显式物理知识或中间推理引入视频生成。Wang 等人(2026b)和 Zhang 等人(2025)在训练期间注入物理知识,而 Yang 等人(2025b)在生成前使用 VLM 推理物体轨迹。相比之下,PhiZero 不依赖模拟器导出的约束、预定义的物理变量或显式物理规则作为监督信号。相反,它通过自监督从大规模无标注视频中学习物理语言,抽象出状态转移的模式。
附录 E 局限性与未来工作
局限性
尽管取得了令人鼓舞的成果,但仍存在若干局限性。首先,物理语言目前是作为状态转换的经验性表征来学习的,而非符号化物理定律的显式表述。这种数据驱动的方式能够从多样化的无标注视频中进行可扩展学习,但由此产生的离散符号尚未直接锚定于可解释的物理变量或形式化定律。其次,由于物理语言主要从观测视频中学习,其覆盖范围受限于训练数据中可被视觉观测到的内容。因此,视觉上模糊或视觉手段难以触及的世界转换过程(例如触觉交互和微观粒子动力学)可能更难建模。最后,受限于数据和计算资源,我们当前的实现采用了相对小规模的模型,且训练语料相对于物理世界的多样性仍显有限。尽管如此,在此规模下取得的强劲表现表明,更大的模型和更多样化的训练数据有望进一步提升基于物理语言的世界建模能力。
未来工作
未来工作可以在多个方向上扩展物理语言。首先,除了视频生成之外,物理语言可以作为显式的中间表示,用于提升视觉语言模型(VLM)中的时空理解能力,并支持具身策略中更有效的规划。其次,它在不同外观和具身形态之间的可迁移性,为缓解真实机器人交互数据稀缺的问题开辟了一条有前景的路径。特别是,从大规模人类视频中学习到的状态转移模式,有可能迁移到机器人具身形态上,使具身系统能够在有限的机器人特定监督下,受益于丰富的人类数据。第三,我们计划通过分层或循环预测,将物理语言建模扩展到当前固定时长片段之外,从而在保持时间一致性和忠实追踪不断演化的场景状态的同时,实现长时程世界建模。最后,我们将进一步扩展 PhiZero,采用更强的骨干网络、增加计算资源,并使用更大更多样化的训练语料库,以提升基于物理语言的世界建模性能。
参考文献
- Achiam 等人(2023)Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, 等。Gpt-4 技术报告。arXiv 预印本 arXiv:2303.08774,2023 年。
- Agarwal 等人(2025)Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, 等。面向物理 AI 的 Cosmos 世界基础模型平台。arXiv 预印本 arXiv:2501.03575,2025 年。
- Agarwal 等人(2026)Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, 等。Cosmos 3:面向物理 AI 的全模态世界模型。arXiv 预印本 arXiv:2606.02800,2026 年。
- Ali 等人(2025)Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, 等。基于视频基础模型的物理 AI 世界模拟。arXiv 预印本 arXiv:2511.00062,2025 年。
- Alles 等人(2025)Marvin Alles、Xingyuan Zhang、Patrick van der Smagt 和 Philip Becker-Ehmck。利用未标注轨迹进行控制的潜在动作世界模型。arXiv 预印本 arXiv:2512.10016,2025 年。
- Allshire 等人(2025)Arthur Allshire、Hongsuk Choi、Junyi Zhang、David McAllister、Anthony Zhang、Chung Min Kim、Trevor Darrell、Pieter Abbeel、Jitendra Malik 和 Angjoo Kanazawa。视觉模仿实现情境化人形机器人控制。arXiv 预印本 arXiv:2505.03729,2025 年。
- Assran 等人(2025)Mido Assran、Adrien Bardes、David Fan、Quentin Garrido、Russell Howes、Matthew Muckley、Ammar Rizvi、Claire Roberts、Koustuv Sinha、Artem Zholus 等人。V-jepa 2:自监督视频模型实现理解、预测与规划。arXiv 预印本 arXiv:2506.09985,2025 年。
- Atanov 等人(2026)Andrei Atanov、Jesse Allardice、Roman Bachmann、Oğuzhan Fatih Kar、R Devon Hjelm、David Griffiths、Peter Fu、Afshin Dehghan 和 Amir Zamir。Videoflextok:可变长度的由粗到细视频分词化。第四十三届国际机器学习大会,2026 年。
- Bai 等人(2025a)Shuai Bai、Yuxuan Cai、Ruizhe Chen、Keqin Chen、Xionghui Chen、Zesen Cheng、Lianghao Deng、Wei Ding、Chang Gao、Chunjiang Ge 等人。Qwen3-VL 技术报告。arXiv 预印本 arXiv:2511.21631,2025a。
- Bai 等人(2025b)Shuai Bai、Keqin Chen、Xuejing Liu、Jialin Wang、Wenbin Ge、Sibo Song、Kai Dang、Peng Wang、Shijie Wang、Jun Tang、Humen Zhong、Yuanzhi Zhu、Mingkun Yang、Zhaohai Li、Jianqiang Wan、Pengfei Wang、Wei Ding、Zheren Fu、Yiheng Xu、Jiabo Ye、Xi Zhang、Tianbao Xie、Zesen Cheng、Hang Zhang、Zhibo Yang、Haiyang Xu 和 Junyang Lin。Qwen2.5-VL 技术报告。arXiv 预印本 arXiv:2502.13923,2025b。
- Bardes 等人(2024)Adrien Bardes、Quentin Garrido、Jean Ponce、Xinlei Chen、Michael Rabbat、Yann LeCun、Mido Assran 和 Nicolas Ballas。V-JEPA:用于视觉表征学习的潜在视频预测。载于 URL https://openreview.net/forum,2024 年。
- Bear 等人(2021)Daniel M Bear、Elias Wang、Damian Mrowca、Felix J Binder、Hsiao-Yu Fish Tung、RT Pramod、Cameron Holdaway、Sirui Tao、Kevin Smith、Fan-Yun Sun 等。Physion:评估人类与机器从视觉进行物理预测的能力。arXiv 预印本 arXiv:2106.08261,2021 年。
- Bhowmik 等人(2025)Aritra Bhowmik、Denis Korzhenkov、Cees GM Snoek、Amirhossein Habibian 和 Mohsen Ghafoorian。Moalign:面向视频扩散模型的以运动为中心的表征对齐。arXiv 预印本 arXiv:2510.19022,2025 年。
- Bi 等人(2025)Hongzhe Bi、Hengkai Tan、Shenghao Xie、Zeyuan Wang、Shuhe Huang、Haitian Liu、Ruowen Zhao、Yao Feng、Chendong Xiang、Yinze Rong 等。Motus:统一潜动作世界模型。arXiv 预印本 arXiv:2512.13030,2025 年。
- Bordes 等人(2025)Florian Bordes、Quentin Garrido、Justine T Kao、Adina Williams、Michael Rabbat 和 Emmanuel Dupoux。Intphys 2:在复杂合成环境中基准测试直觉物理理解能力。arXiv 预印本 arXiv:2506.09849,2025 年。
- Bruce 等人(2024)Jake Bruce、Michael D Dennis、Ashley Edwards、Jack Parker-Holder、Yuge Shi、Edward Hughes、Matthew Lai、Aditi Mavalankar、Richie Steigerwald、Chris Apps 等。Genie:生成式交互环境。载于第四十一届国际机器学习大会,2024 年。
- Bu 等人(2025a)Qingwen Bu、Jisong Cai、Li Chen、Xiuqi Cui、Yan Ding、Siyuan Feng、Shenyuan Gao、Xindong He、Xuan Hu、Xu Huang 等。Agibot World Colosseo:面向可扩展智能具身系统的大规模操作平台。arXiv 预印本 arXiv:2503.06669,2025a。
- Bu 等人(2025b)Qingwen Bu、Yanting Yang、Jisong Cai、Shenyuan Gao、Guanghui Ren、Maoqing Yao、Ping Luo 和 Hongyang Li。UniVLA:以任务为中心的潜动作实现随处行动。arXiv 预印本 arXiv:2505.06111,2025b。
- Caesar 等人(2020)Holger Caesar、Varun Bankiti、Alex H Lang、Sourabh Vora、Venice Erin Liong、Qiang Xu、Anush Krishnan、Yu Pan、Giancarlo Baldan 和 Oscar Beijbom。nuScenes:用于自动驾驶的多模态数据集。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 11621–11631 页,2020 年。
- Chen 等人(2026a)Boyu Chen、Yi Chen、Lu Qiu、Jerry Bai、Yuying Ge 和 Yixiao Ge。Unit:迈向用于人形机器人策略学习与世界建模的统一物理语言。arXiv 预印本 arXiv:2604.19734,2026a。
- Chen 等人(2026b)Weiliang Chen、Yuanhui Huang、Xuebo Wang 和 Yueqi Duan。Tivtok:广播时间不变 token 以实现可扩展视频分词。arXiv 预印本 arXiv:2606.17590,2026b。
- Chen 等人(2025)Yi Chen、Yuying Ge、Weiliang Tang、Yizhuo Li、Yixiao Ge、Mingyu Ding、Ying Shan 和 Xihui Liu。Moto:以潜在运动 token 作为桥接语言,从视频中学习机器人操作。载于 IEEE/CVF 国际计算机视觉大会论文集,第 19752–19763 页,2025。
- Chen 等人(2022)Zhenfang Chen、Kexin Yi、Yunzhu Li、Mingyu Ding、Antonio Torralba、Joshua B Tenenbaum 和 Chuang Gan。Comphy:从视频中对物体与事件进行组合式物理推理。arXiv 预印本 arXiv:2205.01089,2022。
- Chen 等人(2026c)Zhenyang Chen、Chuizheng Kong、Chuye Zhang、Yuanshao Yang、Lawrence Y Zhu、Shreyas Kousik 和 Danfei Xu。Warp:面向离线人类示教学习的全身重定向。arXiv 预印本 arXiv:2606.29940,2026c。
- Cui 与 Gao(2023)Hanchen Cui 和 Yang Gao。从大规模多样化视频中学习通用世界模型。载于 NeurIPS 2023 决策基础模型研讨会,2023。
- Foo 等人(2026)Lin Geng Foo、Mark He Huang、Alexandros Lattas、Stylianos Moschoglou、Thabo Beeler 和 Christian Theobalt。物理模拟器在环视频生成。载于 IEEE/CVF 计算机视觉与模式识别大会论文集,第 4301–4311 页,2026。
- Gao 等人(2025)Shenyuan Gao、Siyuan Zhou、Yilun Du、Jun Zhang 和 Chuang Gan。Adaworld:学习带潜在动作的自适应世界模型。arXiv 预印本 arXiv:2503.18938,2025。
- Garrido 等人(2026)Quentin Garrido、Tushar Nagarajan、Basile Terver、Nicolas Ballas、Yann LeCun 和 Michael Rabbat。在真实环境中学习潜在动作世界模型。arXiv 预印本 arXiv:2601.05230,2026。
- Ge 等人(2025)Yuying Ge、Yizhuo Li、Yixiao Ge 和 Ying Shan。Divot:扩散模型驱动的视频分词器,用于理解与生成。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 13606–13617 页,2025 年。
- Gemini 团队(2023)Gemini 团队。Gemini:一系列能力强大的多模态模型。arXiv 预印本 arXiv:2312.11805,2023 年。URL:https://arxiv.org/abs/2312.11805。
- Genmo AI(2025)Genmo AI。Genmo AI 博客。https://www.genmo.ai/blog,2025 年。访问日期:2026 年 4 月 29 日。
- Google DeepMind(2026)Google DeepMind。Veo 3.1。https://deepmind.google/models/veo/,2026 年。访问日期:2026 年 4 月 29 日。
- Goyal 等人(2017)Raghav Goyal、Samira Ebrahimi Kahou、Vincent Michalski、Joanna Materzynska、Susanne Westphal、Heuna Kim、Valentin Haenel、Ingo Fruend、Peter Yianilos、Moritz Mueller-Freitag 等人。“something something”视频数据库:用于学习和评估视觉常识。载于《IEEE 国际计算机视觉会议论文集》,第 5842–5850 页,2017 年。
- Gu(2025)Jinwei Gu。Cosmos 世界基础模型,面向物理 AI。载于《第三届富媒体与生成式 AI 国际研讨会论文集》,第 39–39 页,2025 年。
- Guo 等人(2023)Yuwei Guo、Ceyuan Yang、Anyi Rao、Zhengyang Liang、Yaohui Wang、Yu Qiao、Maneesh Agrawala、Dahua Lin 和 Bo Dai。AnimateDiff:无需特定微调即可让个性化文生图扩散模型动起来。arXiv 预印本 arXiv:2307.04725,2023 年。
- HaCohen 等人(2026)Yoav HaCohen、Benny Brazowski、Nisan Chiprut、Yaki Bitterman、Andrew Kvochko、Avishai Berkowitz、Daniel Shalem、Daphna Lifschitz、Dudu Moshe、Eitan Porat 等人。Ltx-2:高效的联合音视频基础模型。arXiv 预印本 arXiv:2601.03233,2026 年。
- Hu 等人(2022)Edward J Hu、Yelong Shen、Phillip Wallis、Zeyuan Allen-Zhu、Yuanzhi Li、Shean Wang、Liang Wang、Weizhu Chen 等人。LoRA:大语言模型的低秩适配。ICLR,1(2):3,2022 年。
- Jiang 等人(2026a)Bo Jiang、Depu Meng、Yihan Hu、Yichen Xie、Tianshuo Xu 和 Wei Zhan。LaMo:用于视频生成物理真实感的自监督潜在运动先验。arXiv 预印本 arXiv:2605.23878,2026a。
- Jiang 等人(2026b)Yuxin Jiang、Yuchao Gu、Ivor W Tsang 和 Mike Zheng Shou。Olaf-world:面向视频世界模型的潜在动作定向。arXiv 预印本 arXiv:2602.10104,2026b。
- Jin 等人(2024)Yang Jin、Zhicheng Sun、Kun Xu、Liwei Chen、Hao Jiang、Quzhe Huang、Chengru Song、Yuliang Liu、Di Zhang、Yang Song 等。Video-lavit:基于解耦视觉-运动 token 化的统一视频语言预训练。arXiv 预印本 arXiv:2402.03161,2024。
- Kim 等人(2026)Manjin Kim、Suha Kwak 和 Minsu Cho。用于物理合理视频生成的温和自相似性对齐。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 5148–5158 页,2026。
- Kong 等人(2024)Weijie Kong、Qi Tian、Zijian Zhang、Rox Min、Zuozhuo Dai、Jin Zhou、Jiangfeng Xiong、Xin Li、Bo Wu、Jianwei Zhang 等。HunyuanVideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024。
- Li 等人(2026a)Dacheng Li、Yunhao Fang、Yukang Chen、Shuo Yang、Shiyi Cao、Justin Wong、Michael Luo、Xiaolong Wang、Hongxu Yin、Joseph Gonzalez 等。Worldmodelbench:将视频生成模型作为世界模型进行评测。神经信息处理系统进展,第 38 卷,2026a。
- Li 等人(2023)Junnan Li、Dongxu Li、Silvio Savarese 和 Steven Hoi。BLIP-2:利用冻结图像编码器和大语言模型引导语言-图像预训练。载于国际机器学习会议,第 19730–19742 页。PMLR,2023。
- Li 等人(2022)Kunchang Li、Yali Wang、Yinan He、Yizhuo Li、Yi Wang、Limin Wang 和 Yu Qiao。UniFormerV2:用视频 UniFormer 武装图像 ViT 进行时空学习。arXiv 预印本 arXiv:2211.09552,2022。
- Li 等人(2024)Yizhuo Li、Yuying Ge、Yixiao Ge、Ying Shan 和 Ping Luo。DiCoDe:用于语言模型自回归视频生成的扩散压缩深度 token。arXiv 预印本 arXiv:2412.04446,2024。
- Li 等人(2026b)Zhen Li、Chuanhao Li、Xiaofeng Mao、Shaoheng Lin、Ming Li、Shitian Zhao、Zhaopan Xu、Xinyue Li、Yukang Feng、Jianwen Sun 等。Sekai:面向世界探索的视频数据集。神经信息处理系统进展,第 38 卷,2026b。
- Lim 等人(2026)Jongbin Lim、Taeyun Ha、Mingi Choi、Jisoo Kim、Byungjun Kim、Subin Jeon 和 Hanbyul Joo。Hrdexdb:用于跨具身灵巧抓取的人-机器人配对数据集。arXiv 预印本 arXiv:2604.14944,2026。
- Lin 等人(2024)Bin Lin、Yunyang Ge、Xinhua Cheng、Zongjian Li、Bin Zhu、Shaodong Wang、Xianyi He、Yang Ye、Shenghai Yuan、Liuhan Chen 等。Open-sora plan:开源大型视频生成模型。arXiv 预印本 arXiv:2412.00131,2024。
- Lin 等人(2026)Juyi Lin、Arash Akbari、Yumei He、Lin Zhao、Haichao Zhang、Arman Akbari、Xingchen Xu、Zoe Y Lu、Enfu Nan、Hokin Deng 等。Phyground:生成式世界模型中的物理推理基准测试。arXiv 预印本 arXiv:2605.10806,2026。
- Liu 等人(2023a)Bo Liu、Yifeng Zhu、Chongkai Gao、Yihao Feng、Qiang Liu、Yuke Zhu 和 Peter Stone。Libero:终身机器人学习知识迁移的基准测试。神经信息处理系统进展,36:44776–44791,2023a。
- Liu 等人(2025a)Huaize Liu、Wenzhang Sun、Qiyuan Zhang、Donglin Di、Biao Gong、Hao Li、Chen Wei 和 Changqing Zou。Hi-vae:具有全局和细节运动的高效视频自编码。arXiv 预印本 arXiv:2506.07136,2025a。
- Liu 等人(2025b)Kun Liu、Qi Liu、Xinchen Liu、Jie Li、Yongdong Zhang、Jiebo Luo、Xiaodong He 和 Wu Liu。Hoigen-1m:用于人-物交互视频生成的大规模数据集。载于计算机视觉与模式识别会议论文集,第 24001–24010 页,2025b。
- Liu 等人(2024)Shaowei Liu、Zhongzheng Ren、Saurabh Gupta 和 Shenlong Wang。Physgen:基于刚体物理的图像到视频生成。载于欧洲计算机视觉会议,第 360–378 页。Springer,2024。
- Liu 等人(2023b)Xingchao Liu、Chengyue Gong 和 Qiang Liu。Flow straight and fast:利用修正流学习生成和迁移数据。载于国际学习表征会议(ICLR),2023b。
- Luma AI(2024)Luma AI。Luma Dream Machine:AI 视频生成器。https://dream-machine.lumalabs.ai/,2024。访问日期:2026 年 4 月 29 日。
- McInnes 等人(2018)Leland McInnes、John Healy 和 James Melville。UMAP:用于降维的一致流形逼近与投影。arXiv 预印本 arXiv:1802.03426,2018 年。
- Mentzer 等人(2024)Fabian Mentzer、David Minnen、Eirikur Agustsson 和 Michael Tschannen。有限标量量化:让 VQ-VAE 变得简单。发表于国际学习表征会议,2024 年卷,第 51772–51783 页,2024 年。
- Monfort 等人(2019)Mathew Monfort、Alex Andonian、Bolei Zhou、Kandan Ramakrishnan、Sarah Adel Bargal、Tom Yan、Lisa Brown、Quanfu Fan、Dan Gutfreund、Carl Vondrick 等。时间瞬间数据集:用于事件理解的一百万个视频。IEEE 模式分析与机器智能汇刊,42(2):502–508,2019 年。
- Montanaro 等人(2024)Antonio Montanaro、Luca Savant Aira、Emanuele Aiello、Diego Valsesia 和 Enrico Magli。MotionCraft:基于物理的零样本视频生成。神经信息处理系统进展,37:123155–123181,2024 年。
- Nan 等人(2025)Kepan Nan、Rui Xie、Penghao Zhou、Tiehan Fan、Zhenheng Yang、Zhijie Chen、Xiang Li、Jian Yang 和 Ying Tai。OpenVid-1M:用于文生视频的大规模高质量数据集。发表于国际学习表征会议,2025 年卷,第 1045–1064 页,2025 年。
- Narayanan 等人(2026)Sriram Narayanan、Ziyu Jiang、Srinivasa Narasimhan 和 Manmohan Chandraker。PhyCo:学习可控的物理先验用于生成式运动。发表于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 41892–41902 页,2026 年。
- OpenAI(2025)OpenAI。Sora 2 系统卡。https://cdn.openai.com/pdf/50d5973c-c4ff-4c2d-986f-c72b5d0ff069/sora_2_system_card.pdf,2025 年。访问日期:2026 年 1 月 21 日。
- Pan 等人(2026)Kaihang Pan、Qi Tian、Jianwei Zhang、Weijie Kong、Jiangfeng Xiong、Yanxin Long、Shixue Zhang、Haiyi Qiu、Tan Wang、Zheqi Lv 等。OmniWeaving:迈向支持自由形式组合与推理的统一视频生成。arXiv 预印本 arXiv:2603.24458,2026 年。
- Rädsch 等人(2026)Tim Rädsch、Yuki M Asano、Hilde Kuehne、Stefan Bauer、Priyank Jaini、Robert Geirhos 和 Carsten T Lüth。Physics-IQ 验证版。arXiv 预印本 arXiv:2606.18943,2026 年。
- Ren 等人(2025)Zhongwei Ren、Yunchao Wei、Xun Guo、Yao Zhao、Bingyi Kang、Jiashi Feng 和 Xiaojie Jin。《Videoworld:探索从无标注视频中学习知识》。载于《计算机视觉与模式识别会议论文集》,第 29029–29039 页,2025 年。
- Ren 等人(2026)Zhongwei Ren、Yunchao Wei、Xiao Yu、Guixun Luo、Yao Zhao、Bingyi Kang、Jiashi Feng 和 Xiaojie Jin。《Videoworld 2:从真实世界视频中学习可迁移知识》。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 40569–40580 页,2026 年。
- Ressler-Antal 等人(2025)Thomas Ressler-Antal、Frank Fundel、Malek Ben Alaya、Stefan Andreas Baumann、Felix Krause、Ming Gui 和 Björn Ommer。《Dismo:面向开放世界运动迁移的解耦运动表征》。arXiv 预印本 arXiv:2511.23428,2025 年。
- Runway ML(2024)Runway ML。《推出 Gen-3 Alpha》。https://runwayml.com/research/introducing-gen-3-alpha,2024 年。访问日期:2026 年 4 月 29 日。
- Schmidt 与 Jiang(2024)Dominik Schmidt 和 Minqi Jiang。《在没有动作的情况下学习行动》。载于《国际学习表征会议》,第 2024 卷,第 9379–9395 页,2024 年。
- Shang 等人(2026)Shuyao Shang、Bing Zhan、Yunfei Yan、Yuqi Wang、Yingyan Li、Yasong An、Xiaoman Wang、Jierui Liu、Lu Hou、Lue Fan 等人。《Dynvla:学习世界动态以支持自动驾驶中的动作推理》。arXiv 预印本 arXiv:2603.11041,2026 年。
- Sun 等人(2023)Mingzhen Sun、Weining Wang、Xinxin Zhu 和 Jing Liu。《Moso:分解运动、场景与物体以进行视频预测》。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 18727–18737 页,2023 年。
- Teng 等人(2026)Yao Teng、Minxuan Lin、Xian Liu、Shuai Wang、Xiao Yang 和 Xihui Liu。《自适应一维视频扩散自编码器》。arXiv 预印本 arXiv:2602.04220,2026 年。
- Tian 等人(2025)Rui Tian、Qi Dai、Jianmin Bao、Kai Qiu、Yifan Yang、Chong Luo、Zuxuan Wu 和 Yu-Gang Jiang。《Reducio!利用极度压缩的运动潜变量在 16 秒内生成 1k 视频》。载于《IEEE/CVF 国际计算机视觉会议论文集》,第 19237–19247 页,2025 年。
- Tung 等人(2023)Hsiao-Yu Tung、Mingyu Ding、Zhenfang Chen、Daniel Bear、Chuang Gan、Josh Tenenbaum、Dan Yamins、Judith Fan 和 Kevin Smith。Physion++:评估需要对不同物理属性进行在线推理的物理场景理解。《神经信息处理系统进展》,36:67048–67068,2023 年。
- Wan 团队(2025)Wan 团队、Ang Wang、Baole Ai、Bin Wen、Chaojie Mao、Chen-Wei Xie、Di Chen、Feiwu Yu、Haiming Zhao、Jianxiao Yang、Jianyuan Zeng、Jiayu Wang、Jingfeng Zhang、Jingren Zhou、Jinkai Wang、Jixuan Chen、Kai Zhu、Kang Zhao、Keyu Yan、Lianghua Huang、Mengyang Feng、Ningyi Zhang、Pandeng Li、Pingyu Wu、Ruihang Chu、Ruili Feng、Shiwei Zhang、Siyang Sun、Tao Fang、Tianxing Wang、Tianyi Gui、Tingyu Weng、Tong Shen、Wei Lin、Wei Wang、Wei Wang、Wenmeng Zhou、Wente Wang、Wenting Shen、Wenyuan Yu、Xianzhong Shi、Xiaoming Huang、Xin Xu、Yan Kou、Yangyu Lv、Yifei Li、Yijing Liu、Yiming Wang、Yingya Zhang、Yitong Huang、Yong Li、You Wu、Yu Liu、Yulin Pan、Yun Zheng、Yuntao Hong、Yupeng Shi、Yutong Feng、Zeyinzi Jiang、Zhen Han、Zhi-Fan Wu 和 Ziyu Liu。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025 年。
- Wang 等人(2026a)Feng Wang、Yichun Shi、Ceyuan Yang、Qiushan Guo、Jingxiang Sun、Alan Yuille 和 Peng Wang。Vtok:具有解耦时空潜变量的统一视频分词器。arXiv 预印本 arXiv:2602.04202,2026a。
- Wang 等人(2026b)Jing Wang、Ao Ma、Ke Cao、Jun Zheng、Jiasong Feng、Zhanjie Zhang、Wanyuan Pang 和 Xiaodan Liang。Wisa:用于物理感知文本到视频生成的世界模拟器助手。《神经信息处理系统进展》,38:5388–5416,2026b。
- Wang 等人(2023a)Jiuniu Wang、Hangjie Yuan、Dayou Chen、Yingya Zhang、Xiang Wang 和 Shiwei Zhang。ModelScope 文本到视频技术报告。arXiv 预印本 arXiv:2308.06571,2023a。
- Wang 等人(2023b)Limin Wang、Bingkun Huang、Zhiyu Zhao、Zhan Tong、Yinan He、Yi Wang、Yali Wang 和 Yu Qiao。VideoMAE v2:通过双重掩码扩展视频掩码自编码器。见《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 14549–14560 页,2023b。
- Wang 等人(2024)王晓峰、朱政、黄冠、王博远、陈新泽、卢继文。《Worlddreamer:通过预测掩码 token 实现视频生成的通用世界模型》。arXiv 预印本 arXiv:2401.09985,2024。
- Wang 等人(2025a)王宇辰、张峰铭、詹德川、赵力、王凯欣、江滨。《共同演化的潜在动作世界模型》。arXiv 预印本 arXiv:2510.26433,2025a。
- Wang 等人(2025b)王宇驰、郭俊良、谢欣怡、何天宇、孙栩、江滨。《Vidtwin:结构与动态解耦的视频 VAE》。载于计算机视觉与模式识别会议论文集,第 22922–22932 页,2025b。
- Wang 等人(2026c)王子昭、石畅、胡嘉恒、Kevin Rohling、Roberto Martín-Martín、张安、Peter Stone。《因子化潜在动作世界模型》。arXiv 预印本 arXiv:2602.16229,2026c。
- Wu 等人(2016)吴佳俊、Joseph J Lim、张宏毅、Joshua B Tenenbaum、William T Freeman。《Physics 101:从无标注视频中学习物理对象属性》。载于 BMVC,第 2 卷,第 7 页,2016。
- Wu 等人(2023)吴佳龙、马浩宇、邓超逸、龙明盛。《利用野外视频预训练上下文世界模型用于强化学习》。神经信息处理系统进展,36:39719–39743,2023。
- Wu 等人(2024)吴佳龙、尹少峰、冯宁娅、何旭、李栋、郝建业、龙明盛。《ivideogpt:交互式 VideoGPT 是可扩展的世界模型》。神经信息处理系统进展,37:68082–68119,2024。
- xAI(2026)xAI。《Grok Imagine API:在质量、成本和延迟方面均达最先进水平的视频生成》。https://x.ai/news/grok-imagine-api,2026。访问日期:2026 年 4 月 29 日。
- Xiang 等人(2024)向建南、刘光毅、顾毅、高启越、宁雨婷、查宇恒、冯泽宇、陶天骅、郝世博、石一鸣 等。《Pandora:具有自然语言动作和视频状态的通用世界模型》。arXiv 预印本 arXiv:2406.09455,2024。
- Xiang 等人(2025)Jiannan Xiang、Yi Gu、Zihan Liu、Zeyu Feng、Qiyue Gao、Yiyan Hu、Benhao Huang、Guangyi Liu、Yichi Yang、Kun Zhou 等。Pan:面向通用、可交互、长时程世界模拟的世界模型。arXiv 预印本 arXiv:2511.09057,2025。
- Xie 等人(2026)You-Zhe Xie、Yu-Hsuan Li、Jie-Ying Lee、Kaipeng Zhang、Yu-Lun Liu 和 Zhixiang Wang。Yocausal:从因果视角看视频生成距离世界模型还有多远。arXiv 预印本 arXiv:2605.30346,2026。
- Xiong 等人(2026)Zhexiao Xiong、Yizhi Song、Liu He、Wei Xiong、Yu Yuan、Feng Qiao 和 Nathan Jacobs。Physalign:通过特征与 3D 表征对齐实现物理一致的图像到视频生成。arXiv 预印本 arXiv:2603.13770,2026。
- Xue 等人(2025)Zhucun Xue、Jiangning Zhang、Teng Hu、Haoyang He、Yinan Chen、Yuxuan Cai、Yabiao Wang、Chengjie Wang、Yong Liu、Xiangtai Li 等。Ultravideo:带全面标注的高质量超高清视频数据集。arXiv 预印本 arXiv:2506.13691,2025。
- Yang 等人(2025a)Nianzu Yang、Pandeng Li、Liming Zhao、Yang Li、Chen-Wei Xie、Yehui Tang、Xudong Lu、Zhihang Liu、Yun Zheng、Yu Liu 等。重新思考视频 token 化:一种基于条件扩散的方法。arXiv 预印本 arXiv:2503.03708,2025a。
- Yang 等人(2023)Sherry Yang、Yilun Du、Kamyar Ghasemipour、Jonathan Tompson、Leslie Kaelbling、Dale Schuurmans 和 Pieter Abbeel。学习交互式真实世界模拟器。arXiv 预印本 arXiv:2310.06114,2023。
- Yang 等人(2025b)Xindi Yang、Baolu Li、Yiming Zhang、Zhenfei Yin、Lei Bai、Liqian Ma、Zhiyong Wang、Jianfei Cai、Tien-Tsin Wong、Huchuan Lu 等。Vlipp:利用视觉与语言信息引导的物理先验实现物理合理的视频生成。载于 IEEE/CVF 国际计算机视觉大会论文集,第 12360–12370 页,2025b。
- Yang 等人(2025c)Zhuoyi Yang、Jiayan Teng、Wendi Zheng、Ming Ding、Shiyu Huang、Jiazheng Xu、Yuanming Yang、Wenyi Hong、Xiaohan Zhang、Guanyu Feng 等。Cogvideox:基于专家 Transformer 的文本到视频扩散模型。载于国际学习表征会议,第 2025 卷,第 83048–83077 页,2025c。
- Ye 等人(2025)Seonghyeon Ye、Joel Jang、Byeongguk Jeon、Se June Joo、Jianwei Yang、Baolin Peng、Ajay Mandlekar、Reuben Tan、Yu-Wei Chao、Bill Yuchen Lin 等人。基于视频的潜在动作预训练。收录于国际学习表征会议,第 2025 卷,第 28213–28239 页,2025 年。
- Yi 等人(2019)Kexin Yi、Chuang Gan、Yunzhu Li、Pushmeet Kohli、Jiajun Wu、Antonio Torralba 和 Joshua B Tenenbaum。Clevrer:用于视频表征与推理的碰撞事件。arXiv 预印本 arXiv:1910.01442,2019 年。
- Yu 等人(2023)Lijun Yu、José Lezama、Nitesh B Gundavarapu、Luca Versari、Kihyuk Sohn、David Minnen、Yong Cheng、Vighnesh Birodkar、Agrim Gupta、Xiuye Gu 等人。语言模型胜过扩散模型——分词器是视觉生成的关键。arXiv 预印本 arXiv:2310.05737,2023 年。
- Yu 等人(2024a)Sihyun Yu、Sangkyung Kwak、Huiwon Jang、Jongheon Jeong、Jonathan Huang、Jinwoo Shin 和 Saining Xie。面向生成的表征对齐:训练扩散 Transformer 比你想象的更容易。arXiv 预印本 arXiv:2410.06940,2024a。
- Yu 等人(2024b)Sihyun Yu、Weili Nie、De-An Huang、Boyi Li、Jinwoo Shin 等人。通过内容帧-运动潜变量分解实现高效视频扩散模型。收录于国际学习表征会议,第 2024 卷,第 9642–9670 页,2024b。
- Yuan 等人(2025)Jianhao Yuan、Fabio Pizzati、Francesco Pinto、Lars Kunze、Ivan Laptev、Paul Newman、Philip Torr 和 Daniele De Martini。Likephys:通过似然偏好评估视频扩散模型中的直觉物理理解。arXiv 预印本 arXiv:2510.11512,2025 年。
- Zhang 等人(2025)Ke Zhang、Cihan Xiao、Yiqun Mei、Jiacong Xu 和 Vishal M Patel。扩散之前先思考:大语言模型引导的物理感知视频生成。arXiv 电子预印本,第 arXiv–2505 页,2025 年。
- Zhang 等人(2026a)Tianqiu Zhang、Muyang Lyu、Yufan Zhang、Fang Fang 和 Si Wu。Dila:解耦的潜在动作世界模型。arXiv 预印本 arXiv:2605.15725,2026a。
- Zhang 等人(2026b)张向东、廖佳琪、张少峰、孟凡清、万祥鹏、严俊驰和程宇。《VideoRepa:通过基础模型的关系对齐学习视频生成的物理规律》。收录于《神经信息处理系统进展》,第38卷,第122647–122676页,2026b。
- Zhu 等人(2025)朱一轩、冯佳琪、郑文昭、高远、陶鑫、万鹏飞、周杰和卢继武。《Astra:具有自回归去噪能力的通用交互式世界模型》。arXiv 预印本,arXiv:2512.08931,2025年。