一项基于能力的研究系统评估了生成式世界模型与传统模拟器的差距,覆盖资产构建、物理引擎、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力,并梳理了2018年至2026年6月间的200篇代表性工作。
一项基于能力的研究系统评估了生成式世界模型与传统模拟器的差距,覆盖资产构建、物理引擎、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力,并梳理了2018年至2026年6月间的200篇代表性工作。
EchoWM 是一个面向可进入式生成媒体的全模态世界模型,能在持续导航中联合生成 720p 视频、环境音、音乐和语音。它围绕相机意图组织交互,将离散指令和连续姿态映射到共享的度量尺度相对 6-DoF 轨迹,并通过渐进训练和自回归后训练实现长时程生成。评测显示其在公开世界模型基准上轨迹跟随和视觉质量表现优异,支持第一/第三人称交互及同步环境音和语音。
新研究提出“Projector Is All You Train”:为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。
ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
一项新研究指出,Sora、Genie 3 等现有世界模型仅建模物理层,忽略人类信念、意图等心理状态,导致预测错误。研究者提出“Mental World Modeling”(MWM)框架及免训练实现 MENTIS,并构建含 448 个场景的 Menti-Bench 评测集。在八款模型测试中,完整 MWM 流程将 F1 分数从直接回答的 63.3 提升至 87.9,人类基准为 98.5。
TLive-Omni 将图像、视频、音频和文本输入映射到统一表示空间,专为电商直播场景设计。其引入 Per-vGrid 时间戳 token 组织以对齐视频与音频,并通过三阶段监督训练和 Faithful-RFT 强化微调提升回答忠实度与表达质量,同时满足实时性要求。实验表明,该模型在电商直播基准任务上表现强劲,并在通用基准上展现出良好泛化能力。
EviRank 将多模态图像重排序重构为语义约束满足问题,把任意查询(纯文本、纯图像或组合)解析为统一证据包,涵盖六个语义槽(如实体、属性、关系)并分别标注 required、forbidden 或 ignorable。
OmniAssistBench 发布,用于评测全模态大模型在实时视频助手场景中的交互能力。该基准通过逆向工程现有互联网视频构建多轮交互数据集,构建过程耗时超 1000 专家小时。评测显示,闭源 Gemini-3-Pro 得分 66.4(满分 100),开源 Qwen3-Omni-Instruct 得分 51.2,模型普遍存在对视觉提示理解不足、多轮上下文保持不佳等问题。
Block3D提出一种分块扩散框架,将离散形状token序列划分为连续块,以自回归方式生成各块,并对当前块内所有token进行联合去噪。该方法引入置信度引导的块内修正机制,在每块完成前修正低置信度token,以缓解误差累积。在TRELLIS-500K留出集上,Block3D将端到端平均生成时间从25.71秒降至4.99秒,较微调自回归基线实现5.15倍加速,且不损失几何保真度。
MoE-ViE 系列专家混合视觉编码器在多种规模上均超越同尺寸密集编码器,其最大模型以 SOTA 编码器 76% 的延迟实现同等零样本性能。研究提出细粒度 MoE 拓扑、无辅助损失均衡变体及专用 MoE 内核,并通过帧级蒸馏与冻结机制增强视频能力。与 LLM 对齐后,MoE-ViE 在图像和视频基准上超越所有对比编码器,包括激活参数多 5 倍的模型。
CoinVE-200K 是一个面向组合式指令视频编辑的大规模高质量数据集,包含 1080p 视频编辑对,最长 201 帧,每个样本涉及 2 至 5 种原子编辑操作,覆盖增删、修改与风格化等类型。
针对大语言模型编写3D程序时难以将高层意图转化为一致底层几何的问题,研究者联合设计了智能体中心领域特定语言aDSL与角色专业化多智能体系统。aDSL通过关系运算符替代绝对坐标,强调可组合性与空间推理;免训练系统采用Plan-Execute-Critic循环,利用执行反馈迭代修复错误。该方法在文本/图像生成3D形状任务上优于此前LLM基线,并支持铰接物体创建与结构化场景组合,代码已开源。
VA-Judger 提出一种面向视频-音频联合生成的链式思维全模态奖励模型,并构建了包含 9K 提示词和 10.3K 细粒度成对比较的大规模人类偏好数据集 VAPref-10K。该模型通过分维度强化学习分解人类反馈,在域内和域外评测中均优于现有指标基线,用于后训练可显著提升生成质量。
Hydra-0 是一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,实现跨本体、任务、环境和视频生成骨干的通用建模与控制。其最佳配置相比动作条件基线,机器人运动误差降低 90.4%,物体运动误差降低 60.2%,并支持零样本组合与数据高效适配。该接口还涌现出逆模式——世界动作模型,可从人类演示的目标物体流预测兼容的机器人运动,无需任务专属专家演示即可生成可执行动作。
GRNEdit 提出轻量级两阶段框架,将编辑语义建模为逐比特的保留或翻转决策,仅用不到 3% 的条件参数和 0.6M 训练对完成训练。GRNEdit-2B 与 GRNEdit-8B 在 OpenVE-Bench 上分别取得 4.03 和 4.18 分,其中 2B 模型超越多个 14B 开源编辑器,8B 模型与领先开源编辑器表现相当。
研究团队提出一种即插即用的2D运动接口,使3D预训练的运动语言模型(MoLMs)无需修改或微调即可接受2D运动输入。在公开数据集上,该方法在多个MoLMs上达到与3D运动输入相当的性能,并优于从头训练2D运动的模型。团队还构建了单目真实世界视频运动评估数据集并引入真实视频适配器,证明在单目姿态估计场景下2D运动比3D运动更具实用性。
TRACE-Bench 将多参考图像生成任务形式化为 Anchor、Disentangle、Apply、Compose 四种原子操作,并据此构建约 1,600 个评测案例(覆盖 1–8 个操作槽位,源自 631 个公式模板与约 4,000 张参考图)。对 9 个领先模型的评测显示,主要瓶颈在于解耦与属性绑定而非场景级组合,最佳模型属性保真度得分仅 0.74。
HarnessEval-W 提出一种智能体化评估流水线,将 LLM 生态中的 harness 范式引入世界模型基准测试。该方法将评估问题分解为可测量的子问题,并派生子智能体进行推理,最终由父智能体验证证据并给出结论,形成可核查的推理链。研究在 330 个评估案例上对 18 个代表性世界模型进行了测试,判断与人类偏好高度一致,并提供细粒度诊断;完整流水线已开源。
WorldMind 提出首个面向游戏世界模型中状态感知 NPC 行为的解耦框架,将交互式世界建模分为理解、决策、控制与生成四层,并通过闭环交互循环将 NPC 行为锚定于不断演化的游戏状态。配套发布 BOSS-140K 数据集及自动化采集智能体。在 BOSS-140K 上的实验显示,WorldMind 在约 70% 的成对比较中因战术更合理、行为更连贯而优于基线。
一篇综述提出全谱系人类上下文分类法,将人类视为可观察主体、动态行动者和情境化智能体,整合视觉外观、空间几何、运动动力学、交互建模、世界模拟与具身智能六个层面。文章系统梳理了该领域的方法论基础、代表性方法、数据集与评测基准,并讨论了构建可扩展、可信、具身可部署的人类中心智能所面临的开放挑战。
针对现有音乐编辑系统忽视编辑中应保持不变的音乐要素评估的问题,研究者提出首个音乐上下文保留(MuseCP)评估框架 MuseCPEval。该框架覆盖四类音乐要素,采用细粒度定制指标捕捉音乐属性的细微变化,并通过客观验证与人类研究证明指标有效性。对多种音乐编辑系统的案例研究展示了其作为测试平台和诊断工具的实际价值。
Google Research 推出 PhotoScan,一种从智能手机 2D 照片直接估算三维身体成分的深度学习框架,可预测胰岛素抵抗,在临床研究中精度接近 DXA 扫描。
McAfee Labs 研究发现,AI 能通过分析照片中的视觉线索识别拍摄地点,在测试旅行照片中准确率达 87% 至 91%,即使照片已删除位置标签或 GPS 信息。建筑物、商店招牌、道路标线、植被及地标等都可能暴露位置。此类技术或与网络钓鱼结合,犯罪分子可利用度假照片细节发送虚假银行提醒,构成日益严重的隐私风险。
混合思考多模态大模型(MLLM)可在深思推理与低延迟非思考推理间切换,但两种模式输出的响应行为未必一致。新研究推出PatternEval基准,含2,415个多模态提示,检测思维链泄露、响应重复、逻辑矛盾与表演性推理四类失败,发现非思考推理失败率显著更高。配套的PatternRM与PatternRL在Qwen3-VL-4B和Qwen3-VL-8B上验证,可缓解跨模式错位且任务性能损失轻微。
新提出的IVT后训练框架在无标注视频上联合优化文本预测与下一嵌入预测,使模型推理时直接生成答案,无需合成或重编码未来帧。相比显式视觉CoT,IVT性能相当或更优,端到端延迟平均降低5倍以上,并在全部六项评测设置上优于直接答案微调。
ConceptFormer 提出一种潜在概念表示学习框架,将查询相关证据建模为连续、查询条件化的潜在概念,无需文本中间表示或原始视觉标注即可桥接局部视觉证据与语义相关性。在多个视觉文档检索基准上,其平均 NDCG@10 较最强视觉检索基线和最强 OCR 文本检索基线分别相对提升 16.7% 和 22.1%。代码与数据已公开。
VibeWorlding 提出统一框架,用于基准测试和训练能自主推断用户意图、规划场景布局、调用 3D 工具并反思多模态反馈的“vibe worlding”智能体。
三星美国研究院数字健康团队推出两款 AI 基础模型,用于学习智能手表采集的生物信号数据,涵盖心脏活动、睡眠和身体活动。该公司在 7 月 Galaxy Unpacked 期间的 Health Forum 上阐述了其 Connected Care 愿景,描绘了相关未来应用场景。
ALD/E-ImageMiner 基准与 ICDAR 2026 科学图表信息提取竞赛提供来自 205 篇论文的 1,951 张图表,经专家标注用于分类、数据表提取、摘要和视觉问答。该视角文章提出将“从图像中理解科学概念”作为长期基准目标,未来方向涵盖更广领域与图表类型、跨文档综合、假设评估及可验证的多模态科学 AI。
UniSwap 提出首个用于说话视频的流式联合音视频身份替换框架,在单一音视频扩散 Transformer 中同时迁移参考外观与音色,并保留源视频内容与动态。
Meta 与牛津大学研究发现,若语言与视觉理解同步训练,多模态模型仅需极少量图像生成数据。1T token 实验中最佳配比为 70% 语言、25% 图像理解、5% 图像生成;13.5B 规模 2T token 测试中,图像生成 token 减少 5 倍,GenEval 仍从 0.467 提升至 0.482。研究还指出过晚引入视觉会导致“视觉惰性”,模型倾向依赖语言捷径。
Alaya Lab 等机构提出交互式世界模型 Evoke,通过外部相机索引世界状态库保持有界上下文,并重新设计教师模型以支持长时程监督。其稀疏注意力机制实现激活内存和计算量线性增长,30 秒长时程分布匹配目标使三步学生模型无需 CFG 即可抵抗内容漂移。
AutoDesign 将多模态设计任务建模为元框架优化问题,通过元优化器引导代码智能体基于反馈递归改进设计框架。在 PosterBench 主赛道(100 篇论文、五个学科)上,AutoDesign 以 78.32 分超越 Claude Design 7.45 分;集成 DesignHarness 后,七种配置下平均得分从 54.99 提升至 67.39(+12.4%)。
OmniScientist 是一个端到端全模态 AI 科学家,可直接从异构原始证据(图像、信号、音频、视频、3D 结构、轨迹、表格、公式和图)开展多学科研究。系统在 36 个真实数据案例(覆盖 5 个学科族)中全部完成从原始数据到成稿论文的完整流程,平均论文总分为 6.3。与仅接收预计算标量特征的盲变体相比,直接感知在全部 7 个评估维度上均更优,并在 85% 的成对比较中胜出。
MegaParts提出可扩展的自回归3D生成框架,结合结构化序列建模与token高效的向量量化形状分词器,将部件级3D生成扩展至最多300个部件、序列长度达256k tokens。该方法在统一结构化序列中训练大语言模型生成物体边界框、部件边界框及部件形状token,相比基线自回归和扩散模型实现了更高的网格质量,表明压缩离散部件token能同时提升可扩展性与生成保真度。
自监督视觉在策略蒸馏(S^2VOPD)通过从学生端而非教师端削减信息来构建学习信号,无需标注、奖励或更强教师模型。在六个细粒度感知基准上,该方法将Qwen3.5-4B从70.7%提升至77.4%,超越所有对比开源模型(最高至Qwen3-VL 235B)及GPT-5.4,并在训练数据不变时恢复了特权信息方法96%的提升。
SPARGen 提出统一多模态框架,将 3D 重建、密集对应与空间推理重构为指令条件生成任务,在单一原生多模态生成模型中联合塑造共享表征。该框架将紧凑结构化与语言输出序列化为 token 序列,同时以图像对齐形式生成密集几何场。在 3D 重建、对应与空间推理基准上,SPARGen 以单一框架在异构空间任务中取得具有竞争力的性能。
研究团队推出MBA-Bench,这是首个用于训练和评估商业创意智能体的多模态基准,涵盖六个领域共30K样本,每个领域包含文本无法完全传达的独特视觉线索。基于GPT-4o生成参考创意,团队训练了MBA-b和MBA-k两个智能体,分别针对隐藏和公开的评估标准进行优化。MBA-b和MBA-k在基准上分别超越纯文本基线63.9%和77.1%,超越多模态基线25.6%和35.8%。