内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 408 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「具身智能」清除

今天8月25日 周二

02:59AK30潜态推理视频世界模型如何学习世界演化

8月23日周日

11:18Rohan Paul31斯坦福北大新研究:QWM 让世界模型不参与训练

8月22日周六

00:31Jim Fan72T-Rex:NVIDIA 与伯克利开源触觉机器人方法

8月21日周五

22:06HuggingFace Daily Papers(社区热门论文)51CoToGrasp:通过规范工作区学习实现接触拓扑条件化的灵巧抓取合成
22:06HuggingFace Daily Papers(社区热门论文)47GOAG:面向灵巧机器人操作的可泛化物体无关抓取规划器
10:06HuggingFace Daily Papers(社区热门论文)48EXIMO:用 VLM 引导探索来微调 VLA 机器人策略
08:00HuggingFace Daily Papers(社区热门论文)56PhysCaP:用物理信息探索为代码即策略智能体注入主动感知

8月20日周四

21:24IT之家(RSS)43中国信通院:全国已建成启用超 70 家具身智能训练场,覆盖过半省级行政区
12:06HuggingFace Daily Papers(社区热门论文)46SoftVTBench:面向可变形物体操作的形变感知视触觉数据集与基准
12:06HuggingFace Daily Papers(社区热门论文)42潜在世界模型中的决策度量对齐:诊断与面向动作的MPC规划目标

8月19日周三

12:05HuggingFace Daily Papers(社区热门论文)41TAMP-Nav:面向高效具身导航的点选、思考、记忆与对齐框架
01:59HuggingFace Daily Papers(社区热门论文)50Hydra-0:以动作流为条件的通用世界模型与控制

8月18日周二

18:22IT之家(RSS)28中国信通院联合发布具身智能训练场研究报告
17:05HuggingFace Daily Papers(社区热门论文)44即插即用的2D运动接口:让真实世界运动语言模型无需微调即可工作
12:05HuggingFace Daily Papers(社区热门论文)53HarnessEval-W:将智能体化评估引入世界模型基准测试
08:00HuggingFace Daily Papers(社区热门论文)40基础模型时代的人类中心智能:综述
06:04Dongxi 东锡 NLP26认知四过程理论:从身体到集体智能

8月17日周一

08:00HuggingFace Daily Papers(社区热门论文)52τ_0-VLA:用世界模型引导测试时计算的分层机器人基础模型
08:00HuggingFace Daily Papers(社区热门论文)37Zetta ζ:面向自进化物理智能的高效闭环具身框架

8月14日周五

13:02HuggingFace Daily Papers(社区热门论文)44H2R-Bench:评估视频世界模型的人到机器人操作视频生成基准
12:02HuggingFace Daily Papers(社区热门论文)49Spatial Memory Agent:用经验记忆提升冻结VLM空间推理
12:02HuggingFace Daily Papers(社区热门论文)50DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
08:00HuggingFace Daily Papers(社区热门论文)49PACE-Bench:动态环境中基于代码演化的物理适配基准
08:00HuggingFace Daily Papers(社区热门论文)45PRM-as-a-Judge 1.5:面向机器人过程评估的工具包
08:00HuggingFace Daily Papers(社区热门论文)52Marionette:预测世界状态、渲染几何、绘制外观
08:00HuggingFace Daily Papers(社区热门论文)48SPARGen:以原生多模态生成统一空间感知与推理

8月13日周四

15:02HuggingFace Daily Papers(社区热门论文)45Hand Visibility Detector:逐关键点手部可见性估计
08:00HuggingFace Daily Papers(社区热门论文)51HumanTracker:面向全面且与人类感知对齐的运动跟踪基准

8月12日周三

20:13IT之家(RSS)44比亚迪 AI 团队首秀:混合世界模型 HyWorldVLA 获 90.59 分,自研芯片 + 算法闭环成型
12:58HuggingFace Daily Papers(社区热门论文)44ComBodied Agents:以人为中心的智能体 AI 新范式

8月11日周二

15:58HuggingFace Daily Papers(社区热门论文)41CEAA:面向交互式计算系统的具身智能体认知架构
12:58HuggingFace Daily Papers(社区热门论文)74精选RynnValue:用时间距离扩展机器人价值基础模型
08:00HuggingFace Daily Papers(社区热门论文)43SHAPER:通过技能-执行框架进化实现自进化具身智能体

8月10日周一

08:00HuggingFace Daily Papers(社区热门论文)51LDR:通过潜在动力学推理实现外推式视频世界模型

8月9日周日

08:00HuggingFace Daily Papers(社区热门论文)42360CityArena:面向具身智能体的真实感城市导航基准

8月8日周六

08:00HuggingFace Daily Papers(社区热门论文)78精选Ego-OSCAR:开源低成本头戴式立体惯性采集系统

8月7日周五

10:55HuggingFace Daily Papers(社区热门论文)52DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作
10:55HuggingFace Daily Papers(社区热门论文)54GST-Bench:视频理解中的全局空间智能基准
08:00HuggingFace Daily Papers(社区热门论文)50AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模
08:00HuggingFace Daily Papers(社区热门论文)52Capek 0.5:面向具身智能的执行中心视觉语言模型
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「具身智能」 · 408 条清除

8月25日

星期二 · 1 条
02:59
AK@_akhaliq
AI 评分 30/100
学习世界如何演化通过潜态动力学推理实现的外推式视频世界模型论文:https://huggingface.co/papers/2608.09926
具身智能视频论文/研究

8月23日

星期日 · 1 条
11:18
Rohan Paul@rohanpaul_ai
AI 评分 31/100
斯坦福大学和北京大学的新论文指出,在学到的世界模型内部训练机器人策略,会继承该模型的每一个错误。随着任务变长、图像变复杂,这些错误会不断累积。QWM(基于世界模型的 Q 学习)从不在模型内部训练任何内容。在此方法中,世界模型完全不参与训练,它只帮助机器人做选择。- arxiv.org/abs/2608.17163标题:"Q-Learning With World Models"
具身智能数据/训练论文/研究

8月22日

星期六 · 1 条
00:31
Jim Fan@DrJimFan
AI 评分 72/100
T-Rex:NVIDIA 与伯克利开源触觉机器人方法

NVIDIA 与伯克利联合开源触觉机器人方法 T-Rex,将触觉作为模型一等公民,采用双时钟异步架构,以每视觉 tick 4 次触觉 tick 的高频修正实时优化操作。

具身智能数据/训练论文/研究

8月21日

星期五 · 4 条
22:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
CoToGrasp:通过规范工作区学习实现接触拓扑条件化的灵巧抓取合成

CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。

arXiv具身智能论文/研究
22:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
GOAG:面向灵巧机器人操作的可泛化物体无关抓取规划器

GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。

arXiv具身智能论文/研究
10:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
EXIMO:用 VLM 引导探索来微调 VLA 机器人策略

EXIMO 提出一种高效微调视觉-语言-动作(VLA)策略的三阶段算法:探索、模仿与优化。探索阶段由视觉语言模型(VLM)充当规划器,将长程任务分解为短程子任务并收集编排数据;模仿阶段用该数据微调 VLA;优化阶段采用残差离线策略强化学习进一步提升。实验表明,EXIMO 在样本效率和最终性能上显著优于现有方法。

具身智能数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
PhysCaP:用物理信息探索为代码即策略智能体注入主动感知

PhysCaP 提出一种物理信息驱动的代码即策略智能体,用于机器人操作中的主动感知。它通过无训练物理属性提取模块,仅凭机器人本体感觉估算物体质量与刚度,并采用 Planner 与 Prioritizer 双智能体设计,在真实桌面操作任务和 LIBERO 模拟任务中,以更少交互和更短执行时间达到与基线相当的性能。

智能体具身智能论文/研究

8月20日

星期四 · 3 条
21:24
IT之家(RSS)
AI 评分 43/100
中国信通院:全国已建成启用超 70 家具身智能训练场,覆盖过半省级行政区

中国信通院《具身智能训练场研究报告(2026 年)》显示,截至今年 6 月底,全国建成启用超 70 家训练场,在建或规划中 46 家,覆盖过半省级行政区,形成长三角、京津冀和珠三角三大集群。训练场建设正由省会及一线城市向三四五线城市延伸,其中含工业制造场景的训练场占 86%。报告预测,训练场将从建设热潮期向能力沉淀期过渡。

具身智能行业动态
12:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
SoftVTBench:面向可变形物体操作的形变感知视触觉数据集与基准

SoftVTBench 发布,含 4,000 条专家演示与 50 余个资产,以 20 Hz 同步多视角 RGB、双指触觉、本体感觉、语言及夹爪动作,并配评估专用的有限元状态。其闭环基准以形变感知成功率(DSR)衡量,要求任务完成且峰值归一化形变在容差内。测试中,三种策略在全部 12 个分布内配置均存在违反形变容差却计为成功的轨迹,占各配置成功量的 0.7–24%。

arXiv具身智能数据/训练论文/研究
12:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 42/100
潜在世界模型中的决策度量对齐:诊断与面向动作的MPC规划目标

研究提出Plan-Real Spearman与CEM-stage Spearman两个诊断指标,揭示JEPA式潜在世界模型中潜在距离代价与真实任务进展排序不一致的问题。据此开发DA-LeWM,为LeWM增加逆动力学与演示条件目标头。实验表明DA-LeWM收敛更快、在线成功率更高,且探针分数相近。

arXiv具身智能数据/训练论文/研究

8月19日

星期三 · 2 条
12:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 41/100
TAMP-Nav:面向高效具身导航的点选、思考、记忆与对齐框架

TAMP-Nav 提出统一框架,将具身导航重构为 2D 视觉提示任务,让 VLM 仅需选择 2D 像素即可由 SLAM 控制器执行,并引入选择性推理与锚点轨迹记忆机制,通过 GRPO 双层对齐实现高效导航。该方法在 R2R-CE 基准上取得 66.2% SR 的 SOTA 成绩,且仅需 90k 训练轨迹,兼具高运行效率与样本效率。

具身智能推理论文/研究
01:59
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
Hydra-0:以动作流为条件的通用世界模型与控制

Hydra-0 是一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,实现跨本体、任务、环境和视频生成骨干的通用建模与控制。其最佳配置相比动作条件基线,机器人运动误差降低 90.4%,物体运动误差降低 60.2%,并支持零样本组合与数据高效适配。该接口还涌现出逆模式——世界动作模型,可从人类演示的目标物体流预测兼容的机器人运动,无需任务专属专家演示即可生成可执行动作。

具身智能多模态论文/研究

8月18日

星期二 · 5 条
18:22
IT之家(RSS)
AI 评分 28/100
中国信通院联合发布具身智能训练场研究报告

中国信通院联合发布《具身智能训练场研究报告(2026年)》,指出训练场产业链已初步成型,呈“上游技术供给活跃、下游应用仍待拓展”的倒三角特征。训练场属重资产投入,当前商业服务以数据产品出售为主,但仅靠数据出售难以覆盖投入,亟需构建多元收入结构。

具身智能论文/研究
17:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
即插即用的2D运动接口:让真实世界运动语言模型无需微调即可工作

研究团队提出一种即插即用的2D运动接口,使3D预训练的运动语言模型(MoLMs)无需修改或微调即可接受2D运动输入。在公开数据集上,该方法在多个MoLMs上达到与3D运动输入相当的性能,并优于从头训练2D运动的模型。团队还构建了单目真实世界视频运动评估数据集并引入真实视频适配器,证明在单目姿态估计场景下2D运动比3D运动更具实用性。

arXiv具身智能多模态论文/研究
12:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
HarnessEval-W:将智能体化评估引入世界模型基准测试

HarnessEval-W 提出一种智能体化评估流水线,将 LLM 生态中的 harness 范式引入世界模型基准测试。该方法将评估问题分解为可测量的子问题,并派生子智能体进行推理,最终由父智能体验证证据并给出结论,形成可核查的推理链。研究在 330 个评估案例上对 18 个代表性世界模型进行了测试,判断与人类偏好高度一致,并提供细粒度诊断;完整流水线已开源。

具身智能多模态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 40/100
基础模型时代的人类中心智能:综述

一篇综述提出全谱系人类上下文分类法,将人类视为可观察主体、动态行动者和情境化智能体,整合视觉外观、空间几何、运动动力学、交互建模、世界模拟与具身智能六个层面。文章系统梳理了该领域的方法论基础、代表性方法、数据集与评测基准,并讨论了构建可扩展、可信、具身可部署的人类中心智能所面临的开放挑战。

arXiv具身智能多模态论文/研究
06:04
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 26/100
认知四过程理论:从身体到集体智能

一篇论文提出 System 0/1/2/3 四过程认知理论,在经典双过程理论上向下引入 System 0(身体与物理动力学)、向上引入 System 3(语言、文化与社会互动形成的集体智能),构建跨越身体、个体认知到社会的多时间尺度框架。该论文现已开放获取。

Tanichu (Tadahiro Taniguchi): Our memorial paper from last year is now fully open access! “System 0/1/2/3: Quad-Process Theory for Multitimescale Embo...

具身智能论文/研究

8月17日

星期一 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
τ_0-VLA:用世界模型引导测试时计算的分层机器人基础模型

τ_0-VLA 将高层子任务生成构建为可通过世界模型引导的测试时计算扩展的推理问题,在每次推理时用执行记忆生成子任务,必要时搜索备选方案,再由低层策略跨多机器人本体执行。该策略在 40,115 小时异构真实世界数据上训练并采用多模态协同训练。额外分配测试时计算可显著提升下一子任务预测准确率,并转化为长程操作任务中更高的闭环成功率。

具身智能论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 37/100
Zetta ζ:面向自进化物理智能的高效闭环具身框架

Zetta 提出一种闭环具身框架,在保持基础策略冻结的同时,在线进化基于代码的运行时批评者与恢复技能。通过三个时间尺度分离的循环,Zetta 在 LIBERO-Pro 和 RoboCasa 上分别达到 90.8% 和 93.6% 的成功率,并实现 11.1 倍推理加速;学习技能可零样本迁移,并涌现出机器人的“顿悟时刻”。

智能体arXiv具身智能论文/研究

8月14日

星期五 · 7 条
13:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
H2R-Bench:评估视频世界模型的人到机器人操作视频生成基准

H2R-Bench 提出用于评估跨具身人到机器人操作视频生成的基准,要求模型将第一视角人类演示转换为指定具身下的机器人操作视频。基准涵盖目标状态完成、动作事件完成、功能接触迁移、具身正确性和视频质量五个维度,并评测了六个操作族、两种机器人具身上的十一个最新视频生成模型。结果显示当前视频世界模型在具身一致性、功能交互和任务执行上仍存在明显不足。

arXiv具身智能视频论文/研究
12:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
Spatial Memory Agent:用经验记忆提升冻结VLM空间推理

Spatial Memory Agent(SMA)提出一种无需参数更新的空间推理自进化框架,通过验证器引导的反思将空间经验蒸馏为可迁移教训,并分配可校准的迁移可靠性评分(TRS)。在五个空间基准和四个基础VLM上,SMA在每个基础模型组中均取得最高宏平均准确率,在20项评测中多数达到最佳精度,为冻结模型的空间自进化提供了实用路径。

智能体arXiv具身智能论文/研究
12:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型

DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,输入观测帧、语言指令及动作序列即可预测未来观测。该模型通过 PRoPE 式几何编码注入每臂 SE(3) 变换,并引入深度分支与 SAM3 掩码保持物体一致性,同时用分布匹配蒸馏实现高效部署。

具身智能视频论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
PACE-Bench:动态环境中基于代码演化的物理适配基准

PACE-Bench 提出一个基于模拟器的基准测试,包含六个物理领域的 144 组源到目标适配对,用于评估智能体在环境条件变化后的恢复能力。在十种自演化方法中,Reflexion + Qwen3-14B 仅成功完成 35.9% 的全基准任务,而 GPT-5.5 在完整预算下解决了 Statics 子集的 66.7%。

智能体arXiv具身智能论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
PRM-as-a-Judge 1.5:面向机器人过程评估的工具包

PRM-as-a-Judge 1.5 发布,将 rollout 视频转化为密集进度曲线并派生多项细粒度指标,在 1.0 基础上新增三个指标,分别刻画失败侧进展、回撤后恢复与成功侧执行质量。基于基准测试的 rollout 视频,该工具包对具身模型进行了综合评估,并推出 RoboPulse++ 以检验过程奖励模型(PRM)的可靠性,同时开源了包含基准、指标实现与可视化工具的评估套件。

具身智能开源生态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
Marionette:预测世界状态、渲染几何、绘制外观

Marionette 将交互游戏世界模型拆分为显式状态预测与外观合成:两阶段自回归动力学模型输出 276 维 3D 世界状态,零参数图形桥接器以闭式解计算几何与遮挡,再由控制条件视频扩散模型合成 RGB 帧。强制不匹配动作流使根对齐关节误差改变 31%;施加地形碰撞器与分离上限后,地面穿透减少 66%,FVD 831 对 799,外观保真度无明显损失。

具身智能视频论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
SPARGen:以原生多模态生成统一空间感知与推理

SPARGen 提出统一多模态框架,将 3D 重建、密集对应与空间推理重构为指令条件生成任务,在单一原生多模态生成模型中联合塑造共享表征。该框架将紧凑结构化与语言输出序列化为 token 序列,同时以图像对齐形式生成密集几何场。在 3D 重建、对应与空间推理基准上,SPARGen 以单一框架在异构空间任务中取得具有竞争力的性能。

arXiv具身智能多模态论文/研究

8月13日

星期四 · 2 条
15:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Hand Visibility Detector:逐关键点手部可见性估计

Hand Visibility Detector 首次将手部关节可见性估计作为独立任务系统研究,利用大规模预训练 HPE 模型作为骨干网络实现高精度估计。在下游 3D 手部姿态标注任务中,基于可见性加权的多视角三角化降低了重投影误差。该方法已作为即用型包发布,代码与演示已公开。

具身智能论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
HumanTracker:面向全面且与人类感知对齐的运动跟踪基准

HumanTracker 基准包含约 153 小时来自多位专业表演者的光学运动轨迹,按四个运动族组织并附文本标签,用于细粒度诊断。研究团队还提出 HumanScore 指标,基于包含 24K 个运动的 12K 运动对训练。在代表性 SOTA 跟踪器上,HumanScore 能更好预测人类偏好,并揭示运动学指标常遗漏的接触与稳定性失败。

具身智能数据/训练论文/研究

8月12日

星期三 · 2 条
20:13
IT之家(RSS)
AI 评分 44/100
比亚迪 AI 团队首秀:混合世界模型 HyWorldVLA 获 90.59 分,自研芯片 + 算法闭环成型

比亚迪汽车新技术研究院 AI 团队发布首篇研究论文,推出用于自动驾驶的混合世界模型 HyWorldVLA,结合像素级与潜在空间世界建模,采用视觉-语言-动作(VLA)架构。

具身智能多模态论文/研究
12:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
ComBodied Agents:以人为中心的智能体 AI 新范式

论文提出 Combodied Agents 范式,将数字智能体与具身智能体统一为以人为中心的闭环系统,通过感知、建模、预测并支持个体状态轨迹,而非仅改变软件或物理状态。框架整合个人助理、健康智能体、AI 伴侣等能力,采用事件感知、纵向可纠正记忆、个人世界模型与合规干预策略,并强调保留用户自主性的评估指标与治理方向。

智能体具身智能论文/研究

8月11日

星期二 · 3 条
15:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 41/100
CEAA:面向交互式计算系统的具身智能体认知架构

论文提出CEAA,一种用于在实时交互式虚拟环境中部署具身智能虚拟人(IVA)的模块化认知架构。该架构基于Sense-Think-Act范式和信念-欲望-意图(BDI)认知模型等既有框架,提供可复用的实现导向模板,弥合高层智能体推理模型与实时具身执行之间的鸿沟,以支持复杂交互式虚拟环境中可扩展、自适应且可解释的智能体。

智能体arXiv具身智能论文/研究
12:58
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
RynnValue:用时间距离扩展机器人价值基础模型

RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。

具身智能数据/训练论文/研究

推荐理由:用时间距离替代偏好标注,让价值模型能利用原始时间戳规模化训练,跨具身、任务和视角的泛化能力为无偏好数据的机器人策略提供了新的奖励接口。
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
SHAPER:通过技能-执行框架进化实现自进化具身智能体

SHAPER 提出免训练的自进化框架,冻结模型参数,通过目标环境 rollout 演化可复用技能与上下文代码执行框架。同一冻结模型可同时充当规划器与优化器,无需参数更新即可改进外部技能与执行框架。在 VLABench 和 ESI-Bench 上的评估显示,该方法是模型训练昂贵或不可用时实现自进化具身智能体的实用路径。

智能体具身智能论文/研究

8月10日

星期一 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
LDR:通过潜在动力学推理实现外推式视频世界模型

视频扩散模型拟合像素却未建模时间演化规律,为此研究者提出 Latent Dynamics Reasoning(LDR),将潜在状态转移显式化为运动学积分,仅回归三阶及以上残差。在 PhyWorld 基准的五个物理任务上,LDR 在分布外场景的误差差距比视频扩散基线小 20 余倍,参数量少 26 倍,速度快 143 倍,并能泛化至严重分布偏移场景。

arXiv具身智能视频论文/研究

8月9日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 42/100
360CityArena:面向具身智能体的真实感城市导航基准

360CityArena 是一个评估具身智能体城市探索能力的基准,基于日本东京秋叶原街区的 602 段 360 度视频片段(覆盖 85 条街道)构建,包含 175 个人工设计的任务,涵盖环境理解、路径推理和空间推理三类。评测显示,最强模型 Gemini 2.5 Flash 的准确率为 17.1%,远低于人类的 77.3%,表明城市级具身导航与推理仍面临重大挑战。

arXiv具身智能数据/训练论文/研究

8月8日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
Ego-OSCAR:开源低成本头戴式立体惯性采集系统

Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。

具身智能开源生态数据/训练论文/研究

推荐理由:Ego-OSCAR 把以我为中心的数据采集成本从数万美元压到200美元以下,附带标注的550小时数据集让分布式众包采集变得可行,小团队也能启动规模实验。

8月7日

星期五 · 4 条
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作

DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。

具身智能数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
GST-Bench:视频理解中的全局空间智能基准

GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。

具身智能视频论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模

AtlasVLA 提出一种从直接反应式操作转向主动推理的框架,通过双记忆架构解决单腕部相机下的感知遗忘与任务进度遗忘问题。该模型在 LIBERO、RLBench 及真实世界基准上达到 SOTA 性能,在 LIBERO-Long 上绝对成功率提升 9.4%,真实世界长程任务提升 17.5%,并超越多视角基线。

具身智能多模态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
Capek 0.5:面向具身智能的执行中心视觉语言模型

Capek 0.5 是一款以执行为中心的具身视觉语言模型,按功能角色将能力分为空间推理、时间理解、动作引导与状态验证四类,先由专家模型通过可验证奖励的强化学习分别习得,再经权重合并与策略蒸馏整合为单一推理模型。该模型提供 2B 与 35B-A3B 两种规模,在多数基准项上优于初始化版本,并新增状态验证基准 Capek-StateBench,同时保留全部四项专家能力并支持闭环具身任务执行。

arXiv具身智能多模态论文/研究
已加载 40 条