# WorldReasonBench：面向未来世界状态预测的视频生成器人类对齐压力测试

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-05-11 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmp25c775049pslbpgxpk21cc
- 原文链接：https://arxiv.org/abs/2605.10434

## 精选理由

视频生成越来越像真的，但逻辑和因果一塌糊涂，这个基准把问题量化了，想做世界模拟器的团队可以拿来测测自己的模型到底懂不懂世界。

## AI 摘要

研究团队发布WorldReasonBench基准，旨在直接评估视频生成模型作为“世界模拟器”的推理能力。该基准包含436个测试案例，涵盖物理、社会、逻辑和信息四大维度及22个子类，要求模型根据初始状态与动作生成状态演化一致的未来视频。评估采用人类对齐的双部分方法：过程感知推理验证通过结构化问答检测时序与因果错误；多维质量评估则对推理质量、时序一致性和视觉美学进行评分。测试发现，当前先进模型在视觉合理性与世界推理能力间存在显著差距，生成的视频可能看似逼真却违反动态、因果或信息守恒规律。相关资源已开源。

## 正文

诸如 Seedance2.0 和 Veo3.1 等商业视频生成系统已迅速改进，强化了视频生成器可能正演变为“世界模拟器”的观点。然而，社区仍缺乏一个能直接测试模型是否能够推理观察到的世界应如何随时间演变的基准。我们引入了 WorldReasonBench，它将视频生成评估重新定义为世界状态预测：给定初始状态和动作，模型能否生成一个未来视频，使其状态演化在物理、社会、逻辑和信息层面保持一致？WorldReasonBench 包含 436 个精心策划的测试用例，并配有结构化的真实答案问答标注，涵盖四个推理维度和 22 个子类别。我们采用一种与人类对齐的两部分方法来评估生成的视频：过程感知推理验证使用结构化问答和推理阶段诊断来检测时间与因果层面的失败，而多维质量评估则对推理质量、时间一致性和视觉美感进行评分，用于排序和奖励建模。我们进一步引入了 WorldRewardBench，这是一个包含约 6K 个专家标注对（基于 1.4K 个视频）的偏好基准，支持成对和逐点的奖励模型评估。在当前的视频生成器上，我们的结果揭示了视觉合理性与世界推理之间持续存在的差距：视频可能看起来令人信服，但在动力学、因果关系或信息保存方面却存在失败。我们将发布我们的基准和评估工具包，以支持社区对真正具有世界感知能力的视频生成的研究，地址为 https://github.com/UniX-AI-Lab/WorldReasonBench/。
