Code World Model 框架将世界演化与视觉呈现分离,由编码智能体生成可执行代码维护持久世界状态并执行规则一致的演化。该框架引入代理表示编码帧级时空约束并编译为代理视频,条件化视频模型渲染高保真视觉观察。微调后的 MiniMax-H3 能遵循编码智能体构建的交互世界中的代理时空规范,同时保留丰富视觉细节。
Code World Model 框架将世界演化与视觉呈现分离,由编码智能体生成可执行代码维护持久世界状态并执行规则一致的演化。该框架引入代理表示编码帧级时空约束并编译为代理视频,条件化视频模型渲染高保真视觉观察。微调后的 MiniMax-H3 能遵循编码智能体构建的交互世界中的代理时空规范,同时保留丰富视觉细节。
🚀 What if video generators could build on representations that already understand the visual world? We are excited to i...
研究团队提出全栈框架G2WEngine,自动提取并合成UI覆盖层,构建含96K合成视频和1,079段野外片段的Game2World数据集。基于该数据训练的GameCleaner模型在UI去除任务上平均AAR达95.36,较最强时序掩码基线提升57.3%;使用去UI数据训练的世界模型VideoReward提升6.83%。
LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。
EchoWM 是一个面向可进入式生成媒体的全模态世界模型,能在持续导航中联合生成 720p 视频、环境音、音乐和语音。它围绕相机意图组织交互,将离散指令和连续姿态映射到共享的度量尺度相对 6-DoF 轨迹,并通过渐进训练和自回归后训练实现长时程生成。评测显示其在公开世界模型基准上轨迹跟随和视觉质量表现优异,支持第一/第三人称交互及同步环境音和语音。
ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。
OmniAssistBench 发布,用于评测全模态大模型在实时视频助手场景中的交互能力。该基准通过逆向工程现有互联网视频构建多轮交互数据集,构建过程耗时超 1000 专家小时。评测显示,闭源 Gemini-3-Pro 得分 66.4(满分 100),开源 Qwen3-Omni-Instruct 得分 51.2,模型普遍存在对视觉提示理解不足、多轮上下文保持不佳等问题。
InfinityEdit 提出一种轻量编辑适配器,为流式视频生成器赋予无界编辑能力,解决现有方法仅适用于固定时长片段、无法处理直播或持续镜头等开放流场景的问题。该适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,仅在编辑请求到达的块中激活,后续块由原始模型生成。实验表明,InfinityEdit 能在每次编辑下忠实延续视频流,并在无界编辑序列中保持生成稳定。
VGI-bench 提出一套视频生成模型视觉推理评测基准,含 27 个任务、810 个实例,按任务领域和技能标签两级分类。评测显示当前最强模型 Seedance 2.0 仅达 51.0% 准确率,生成系统虽能解决部分视觉推理任务但远不可靠。分析还揭示了输出失败模式、输入条件敏感性和去噪阶段自我修正有限等问题,代码与数据将开源。
CoinVE-200K 是一个面向组合式指令视频编辑的大规模高质量数据集,包含 1080p 视频编辑对,最长 201 帧,每个样本涉及 2 至 5 种原子编辑操作,覆盖增删、修改与风格化等类型。
SparsePR 提出免训练块稀疏注意力方法,结合响应耦合分区与探针拟合残差重建,在四个视频生成与世界模型上持续降低注意力重建误差。该方法在 22.0%-26.0% 实际执行对密度下保持生成质量,实现 1.48x-2.61x 端到端加速。消融实验显示探针拟合贡献主要误差降低,响应耦合分区在有限探针预算下改善重建效果。
StreamOPD 提出免推理时记忆的后训练方案,将 StreamingBench 从 77.9% 提升至 83.9%,距 9B 教师模型仅差 0.3 个百分点。其扩展模块 ST-CueGate 在 OVO-Bench(排除幻觉检测子任务)和 Video-MME 上分别达 71.9% 和 64.9%,是唯一在所有四项基准上均高于基础模型的变体。
GRNEdit 提出轻量级两阶段框架,将编辑语义建模为逐比特的保留或翻转决策,仅用不到 3% 的条件参数和 0.6M 训练对完成训练。GRNEdit-2B 与 GRNEdit-8B 在 OpenVE-Bench 上分别取得 4.03 和 4.18 分,其中 2B 模型超越多个 14B 开源编辑器,8B 模型与领先开源编辑器表现相当。
AnyTalk提出一种无需动画数据即可为任意角色生成3D语音动画的新方法,通过Character-specific Fine-tuning(CsF)技术将预训练视频扩散模型适配至目标角色,再经优化过程估计blendshape参数,将说话头视频提升为3D语音动画。该方法支持多种面部网格和blendshape配置,显著降低人工与数据需求。蒸馏版AnyTalk_{RT}可实现实时性能,代码已公开。
研究团队提出“语义任务完成视频生成”这一以结果为导向的视频生成任务,要求模型同时实现预期结果并保持与参考图像的语义对齐。为此构建了覆盖六个领域的评估数据集 SemComp-Data,并推出基于视觉语言模型(VLM)的评估协议 SemComp-Bench,分别以 OA Score 和 GR Score 衡量结果达成与生成可靠性。实验显示,现有代表性视频生成模型在兼顾任务目标与语义对齐方面仍面临挑战。
WorldRover 是一个生成富含标注的长程世界探索视频的数据引擎,其核心 WorldRover-Engine 基于 Unreal Engine 离线渲染分钟级路线,保留完整轨迹与场景几何,并支持第一人称、第三人称及 360 全景视角重放。
Context-Matched Distillation(CMD)提出因果DMD框架,用因果教师替代双向全片段评分,使教师监督与学生生成时的因果信息集对齐。CMD在短、长视频基准上达到自回归方法中的最优综合性能,并显著提升对时变相机控制的遵循度。该方法可自然扩展至逐帧、分块生成及相机条件蒸馏。
ForgeWM 提出一种渐进式框架,将双向动作条件视频生成器转化为高效的少步世界模型,通过域适应、教师强制因果训练、因果一致性蒸馏及与双向教师模型的在线策略分布匹配,得到稳态去噪预算为 1、2、4 步的专用学生模型。
LiveAnimate 提出首个结合实时流式与稳定长时生成的十亿级人体动画系统,基于 14B 参数视频 Diffusion Transformer(DiT)。通过两阶段训练将采样预算降至三步,并引入 Pose-Retrieval Sink Attention(PR-Sink)机制,使内存与延迟不随流时长增长。
UniSwap 提出首个用于说话视频的流式联合音视频身份替换框架,在单一音视频扩散 Transformer 中同时迁移参考外观与音色,并保留源视频内容与动态。
H2R-Bench 提出用于评估跨具身人到机器人操作视频生成的基准,要求模型将第一视角人类演示转换为指定具身下的机器人操作视频。基准涵盖目标状态完成、动作事件完成、功能接触迁移、具身正确性和视频质量五个维度,并评测了六个操作族、两种机器人具身上的十一个最新视频生成模型。结果显示当前视频世界模型在具身一致性、功能交互和任务执行上仍存在明显不足。
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,输入观测帧、语言指令及动作序列即可预测未来观测。该模型通过 PRoPE 式几何编码注入每臂 SE(3) 变换,并引入深度分支与 SAM3 掩码保持物体一致性,同时用分布匹配蒸馏实现高效部署。
Alaya Lab 等机构提出交互式世界模型 Evoke,通过外部相机索引世界状态库保持有界上下文,并重新设计教师模型以支持长时程监督。其稀疏注意力机制实现激活内存和计算量线性增长,30 秒长时程分布匹配目标使三步学生模型无需 CFG 即可抵抗内容漂移。
香港大学与快手可灵团队推出 PlayWorld 基准,用多模态 Agent Player 模拟人类玩家,在 171 个带指定目标的场景中与世界模型交互,以长程目标而非固定动作轨迹进行跨模型公平对比。评测覆盖几何一致性、交互保真度、视野外演化与洞察演化四个核心维度,并纳入视频质量与可控性基础指标。对九个前沿世界模型的实验显示,现有模型在长程交互目标上仍不可靠,尤其在空间一致性与持续状态演化方面。
RA-Bench基准以真实视频为锚点,含17,886个视频,覆盖10类社会风险场景,由1,830个真实视频和来自4个开源、5个闭源生成器的16,056个生成片段组成。评估发现,七种传统检测器、十种零样本多模态模型及两种微调MLLM均无法在RA-Bench上稳定泛化;能误导人类的视频同样难以被现有检测器识别,且社交传播进一步降低检测可靠性。
Marionette 将交互游戏世界模型拆分为显式状态预测与外观合成:两阶段自回归动力学模型输出 276 维 3D 世界状态,零参数图形桥接器以闭式解计算几何与遮挡,再由控制条件视频扩散模型合成 RGB 帧。强制不匹配动作流使根对齐关节误差改变 31%;施加地形碰撞器与分离上限后,地面穿透减少 66%,FVD 831 对 799,外观保真度无明显损失。
StateFlow 提出以可编辑 3D 世界为核心的状态中心框架,用于电影、游戏等领域的生成式预可视化。该框架通过状态构建、演化与访问三阶段,将 2D 内容提升为连贯 3D 世界,并支持局部编辑与相机轨迹优化,避免逐帧全场景重生成。实验显示其能生成高质量 3D 世界,适用于视频创作与类游戏原型设计。
AVA-Encoder 提出智能体视频自编码框架,将视频转化为知识图谱表示再重建回视频,以文本梯度优化驱动策略训练。该方法在评测中较最强外部基线提升 20.7 个百分点,伪训练策略在系统提示词 token 减少 74.3% 的情况下仍优于人工调优策略。研究团队已开源完整框架、重建基准及首个高质量电影知识图谱数据集。
研究团队提出闭环框架 S2R,统一物理反射模拟、扩散视频去反射与基准评测。其 S2R-Synthesis 在结构空间进行物理增强并渲染带反射视频,S2R-Removal 为首个扩散视频去反射模型,单步去噪即可恢复干净透射。S2R-Bench 是首个视频去反射基准,支持全参考评估与真实人工感知评测,实验显示性能达 SOTA 且推理快于非扩散基线。
NARU 是一个评估日本长视频中叙事演变与文化推理能力的基准,包含 155 个视频、总计 146.8 小时,以及 1,481 个问题,覆盖四个叙事维度和五个文化维度。其构建采用基于分层记忆的标注流程,并经过 68 名母语者的两轮验证。对八种模型配置的评估显示,模型在长程叙事整合与文化推理方面仍存在明显局限。
V-RAE 提出一种视频表示自编码器,在冻结的视觉基础模型表示之上构建紧凑生成式潜在空间,并引入轻量时间池化模块去除时间冗余。在 K600 上达到 2.13 rFVD,优于所有被评估的大规模预训练视频 VAE;最佳变体在 UCF101 和 K600 上分别取得 117.86 和 19.16 的 gFVD,收敛速度提升最高 6 倍。
小米 MiLM Plus 团队发布 PROVE 评测框架,包含 RC-S 与 RC-T 两项感知对齐指标及 PROVE-Bench 真实世界视频基准,已获 ACM MM 2026 接收。
4D 生成通常依赖 RGB 视频重建或为特定视频生成器定制几何预测,两者分别受分布失配和生成器绑定限制。新方法 Latent-to-4D 直接对齐视频模型的去噪潜变量与预训练 4D 解码器的 token 网格,绕过 RGB 中间步骤,仅用约 1K 重建片段训练,单一 checkpoint 即可在同类 VAE 家族的不同视频扩散 Transformer 间迁移。
VideoGAIA 是一个面向通用 AI 助手的智能体视频理解基准,将视频理解从单轮问答转向多轮、工具增强的交互过程,要求模型迭代感知视频、调用外部工具并整合多模态证据。该基准包含 271 个由模型与人类共同设计的任务,每个实例均经三位人类专家独立验证。GPT-5.5、Kimi-K3 等前沿 MLLM 在 VideoGAIA 上准确率均低于 60%,凸显其作为评估下一代 MLLM 基准的价值。