NVIDIA 与伯克利联合开源触觉机器人方法 T-Rex,将触觉作为模型一等公民,采用双时钟异步架构,以每视觉 tick 4 次触觉 tick 的高频修正实时优化操作。
CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。
GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。
EXIMO 提出一种高效微调视觉-语言-动作(VLA)策略的三阶段算法:探索、模仿与优化。探索阶段由视觉语言模型(VLM)充当规划器,将长程任务分解为短程子任务并收集编排数据;模仿阶段用该数据微调 VLA;优化阶段采用残差离线策略强化学习进一步提升。实验表明,EXIMO 在样本效率和最终性能上显著优于现有方法。
PhysCaP 提出一种物理信息驱动的代码即策略智能体,用于机器人操作中的主动感知。它通过无训练物理属性提取模块,仅凭机器人本体感觉估算物体质量与刚度,并采用 Planner 与 Prioritizer 双智能体设计,在真实桌面操作任务和 LIBERO 模拟任务中,以更少交互和更短执行时间达到与基线相当的性能。
中国信通院《具身智能训练场研究报告(2026 年)》显示,截至今年 6 月底,全国建成启用超 70 家训练场,在建或规划中 46 家,覆盖过半省级行政区,形成长三角、京津冀和珠三角三大集群。训练场建设正由省会及一线城市向三四五线城市延伸,其中含工业制造场景的训练场占 86%。报告预测,训练场将从建设热潮期向能力沉淀期过渡。
SoftVTBench 发布,含 4,000 条专家演示与 50 余个资产,以 20 Hz 同步多视角 RGB、双指触觉、本体感觉、语言及夹爪动作,并配评估专用的有限元状态。其闭环基准以形变感知成功率(DSR)衡量,要求任务完成且峰值归一化形变在容差内。测试中,三种策略在全部 12 个分布内配置均存在违反形变容差却计为成功的轨迹,占各配置成功量的 0.7–24%。
研究提出Plan-Real Spearman与CEM-stage Spearman两个诊断指标,揭示JEPA式潜在世界模型中潜在距离代价与真实任务进展排序不一致的问题。据此开发DA-LeWM,为LeWM增加逆动力学与演示条件目标头。实验表明DA-LeWM收敛更快、在线成功率更高,且探针分数相近。
TAMP-Nav 提出统一框架,将具身导航重构为 2D 视觉提示任务,让 VLM 仅需选择 2D 像素即可由 SLAM 控制器执行,并引入选择性推理与锚点轨迹记忆机制,通过 GRPO 双层对齐实现高效导航。该方法在 R2R-CE 基准上取得 66.2% SR 的 SOTA 成绩,且仅需 90k 训练轨迹,兼具高运行效率与样本效率。
Hydra-0 是一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,实现跨本体、任务、环境和视频生成骨干的通用建模与控制。其最佳配置相比动作条件基线,机器人运动误差降低 90.4%,物体运动误差降低 60.2%,并支持零样本组合与数据高效适配。该接口还涌现出逆模式——世界动作模型,可从人类演示的目标物体流预测兼容的机器人运动,无需任务专属专家演示即可生成可执行动作。
中国信通院联合发布《具身智能训练场研究报告(2026年)》,指出训练场产业链已初步成型,呈“上游技术供给活跃、下游应用仍待拓展”的倒三角特征。训练场属重资产投入,当前商业服务以数据产品出售为主,但仅靠数据出售难以覆盖投入,亟需构建多元收入结构。
研究团队提出一种即插即用的2D运动接口,使3D预训练的运动语言模型(MoLMs)无需修改或微调即可接受2D运动输入。在公开数据集上,该方法在多个MoLMs上达到与3D运动输入相当的性能,并优于从头训练2D运动的模型。团队还构建了单目真实世界视频运动评估数据集并引入真实视频适配器,证明在单目姿态估计场景下2D运动比3D运动更具实用性。
HarnessEval-W 提出一种智能体化评估流水线,将 LLM 生态中的 harness 范式引入世界模型基准测试。该方法将评估问题分解为可测量的子问题,并派生子智能体进行推理,最终由父智能体验证证据并给出结论,形成可核查的推理链。研究在 330 个评估案例上对 18 个代表性世界模型进行了测试,判断与人类偏好高度一致,并提供细粒度诊断;完整流水线已开源。
一篇综述提出全谱系人类上下文分类法,将人类视为可观察主体、动态行动者和情境化智能体,整合视觉外观、空间几何、运动动力学、交互建模、世界模拟与具身智能六个层面。文章系统梳理了该领域的方法论基础、代表性方法、数据集与评测基准,并讨论了构建可扩展、可信、具身可部署的人类中心智能所面临的开放挑战。
一篇论文提出 System 0/1/2/3 四过程认知理论,在经典双过程理论上向下引入 System 0(身体与物理动力学)、向上引入 System 3(语言、文化与社会互动形成的集体智能),构建跨越身体、个体认知到社会的多时间尺度框架。该论文现已开放获取。
Our memorial paper from last year is now fully open access! “System 0/1/2/3: Quad-Process Theory for Multitimescale Embo...
τ_0-VLA 将高层子任务生成构建为可通过世界模型引导的测试时计算扩展的推理问题,在每次推理时用执行记忆生成子任务,必要时搜索备选方案,再由低层策略跨多机器人本体执行。该策略在 40,115 小时异构真实世界数据上训练并采用多模态协同训练。额外分配测试时计算可显著提升下一子任务预测准确率,并转化为长程操作任务中更高的闭环成功率。
Zetta 提出一种闭环具身框架,在保持基础策略冻结的同时,在线进化基于代码的运行时批评者与恢复技能。通过三个时间尺度分离的循环,Zetta 在 LIBERO-Pro 和 RoboCasa 上分别达到 90.8% 和 93.6% 的成功率,并实现 11.1 倍推理加速;学习技能可零样本迁移,并涌现出机器人的“顿悟时刻”。
H2R-Bench 提出用于评估跨具身人到机器人操作视频生成的基准,要求模型将第一视角人类演示转换为指定具身下的机器人操作视频。基准涵盖目标状态完成、动作事件完成、功能接触迁移、具身正确性和视频质量五个维度,并评测了六个操作族、两种机器人具身上的十一个最新视频生成模型。结果显示当前视频世界模型在具身一致性、功能交互和任务执行上仍存在明显不足。
Spatial Memory Agent(SMA)提出一种无需参数更新的空间推理自进化框架,通过验证器引导的反思将空间经验蒸馏为可迁移教训,并分配可校准的迁移可靠性评分(TRS)。在五个空间基准和四个基础VLM上,SMA在每个基础模型组中均取得最高宏平均准确率,在20项评测中多数达到最佳精度,为冻结模型的空间自进化提供了实用路径。
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,输入观测帧、语言指令及动作序列即可预测未来观测。该模型通过 PRoPE 式几何编码注入每臂 SE(3) 变换,并引入深度分支与 SAM3 掩码保持物体一致性,同时用分布匹配蒸馏实现高效部署。
PACE-Bench 提出一个基于模拟器的基准测试,包含六个物理领域的 144 组源到目标适配对,用于评估智能体在环境条件变化后的恢复能力。在十种自演化方法中,Reflexion + Qwen3-14B 仅成功完成 35.9% 的全基准任务,而 GPT-5.5 在完整预算下解决了 Statics 子集的 66.7%。
PRM-as-a-Judge 1.5 发布,将 rollout 视频转化为密集进度曲线并派生多项细粒度指标,在 1.0 基础上新增三个指标,分别刻画失败侧进展、回撤后恢复与成功侧执行质量。基于基准测试的 rollout 视频,该工具包对具身模型进行了综合评估,并推出 RoboPulse++ 以检验过程奖励模型(PRM)的可靠性,同时开源了包含基准、指标实现与可视化工具的评估套件。
Marionette 将交互游戏世界模型拆分为显式状态预测与外观合成:两阶段自回归动力学模型输出 276 维 3D 世界状态,零参数图形桥接器以闭式解计算几何与遮挡,再由控制条件视频扩散模型合成 RGB 帧。强制不匹配动作流使根对齐关节误差改变 31%;施加地形碰撞器与分离上限后,地面穿透减少 66%,FVD 831 对 799,外观保真度无明显损失。
SPARGen 提出统一多模态框架,将 3D 重建、密集对应与空间推理重构为指令条件生成任务,在单一原生多模态生成模型中联合塑造共享表征。该框架将紧凑结构化与语言输出序列化为 token 序列,同时以图像对齐形式生成密集几何场。在 3D 重建、对应与空间推理基准上,SPARGen 以单一框架在异构空间任务中取得具有竞争力的性能。
Hand Visibility Detector 首次将手部关节可见性估计作为独立任务系统研究,利用大规模预训练 HPE 模型作为骨干网络实现高精度估计。在下游 3D 手部姿态标注任务中,基于可见性加权的多视角三角化降低了重投影误差。该方法已作为即用型包发布,代码与演示已公开。
HumanTracker 基准包含约 153 小时来自多位专业表演者的光学运动轨迹,按四个运动族组织并附文本标签,用于细粒度诊断。研究团队还提出 HumanScore 指标,基于包含 24K 个运动的 12K 运动对训练。在代表性 SOTA 跟踪器上,HumanScore 能更好预测人类偏好,并揭示运动学指标常遗漏的接触与稳定性失败。
比亚迪汽车新技术研究院 AI 团队发布首篇研究论文,推出用于自动驾驶的混合世界模型 HyWorldVLA,结合像素级与潜在空间世界建模,采用视觉-语言-动作(VLA)架构。
论文提出 Combodied Agents 范式,将数字智能体与具身智能体统一为以人为中心的闭环系统,通过感知、建模、预测并支持个体状态轨迹,而非仅改变软件或物理状态。框架整合个人助理、健康智能体、AI 伴侣等能力,采用事件感知、纵向可纠正记忆、个人世界模型与合规干预策略,并强调保留用户自主性的评估指标与治理方向。
论文提出CEAA,一种用于在实时交互式虚拟环境中部署具身智能虚拟人(IVA)的模块化认知架构。该架构基于Sense-Think-Act范式和信念-欲望-意图(BDI)认知模型等既有框架,提供可复用的实现导向模板,弥合高层智能体推理模型与实时具身执行之间的鸿沟,以支持复杂交互式虚拟环境中可扩展、自适应且可解释的智能体。
RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。
SHAPER 提出免训练的自进化框架,冻结模型参数,通过目标环境 rollout 演化可复用技能与上下文代码执行框架。同一冻结模型可同时充当规划器与优化器,无需参数更新即可改进外部技能与执行框架。在 VLABench 和 ESI-Bench 上的评估显示,该方法是模型训练昂贵或不可用时实现自进化具身智能体的实用路径。
视频扩散模型拟合像素却未建模时间演化规律,为此研究者提出 Latent Dynamics Reasoning(LDR),将潜在状态转移显式化为运动学积分,仅回归三阶及以上残差。在 PhyWorld 基准的五个物理任务上,LDR 在分布外场景的误差差距比视频扩散基线小 20 余倍,参数量少 26 倍,速度快 143 倍,并能泛化至严重分布偏移场景。
360CityArena 是一个评估具身智能体城市探索能力的基准,基于日本东京秋叶原街区的 602 段 360 度视频片段(覆盖 85 条街道)构建,包含 175 个人工设计的任务,涵盖环境理解、路径推理和空间推理三类。评测显示,最强模型 Gemini 2.5 Flash 的准确率为 17.1%,远低于人类的 77.3%,表明城市级具身导航与推理仍面临重大挑战。
Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。
DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。
GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。
AtlasVLA 提出一种从直接反应式操作转向主动推理的框架,通过双记忆架构解决单腕部相机下的感知遗忘与任务进度遗忘问题。该模型在 LIBERO、RLBench 及真实世界基准上达到 SOTA 性能,在 LIBERO-Long 上绝对成功率提升 9.4%,真实世界长程任务提升 17.5%,并超越多视角基线。
Capek 0.5 是一款以执行为中心的具身视觉语言模型,按功能角色将能力分为空间推理、时间理解、动作引导与状态验证四类,先由专家模型通过可验证奖励的强化学习分别习得,再经权重合并与策略蒸馏整合为单一推理模型。该模型提供 2B 与 35B-A3B 两种规模,在多数基准项上优于初始化版本,并新增状态验证基准 Capek-StateBench,同时保留全部四项专家能力并支持闭环具身任务执行。