Generalist AI 发布机器人基础模型 GEN-1.5,将 3–12 秒的传感器运动数据放入 30 秒上下文窗口即可执行任务,无需梯度更新或微调。在 10 项操作任务中,单次上下文提示平均成功率达 59%(±10%),每任务用 5 分钟数据做 10 步梯度更新后提升至 83%(±9%)。该能力并非显式训练,而是从超八个月预训练中涌现;目前无公开权重、API 或定价,属研究发布。
TARS 推出具身原生基础模型 AWE 3.5,采用“Born as One”架构,将动作、感知、几何与触觉整合进单一模型,而非后期拼接。该模型支持数分钟长时程闭环推理,任务执行效率约为 PI0.5 的 2 倍,并通过预训练双先验与后训练世界引擎滚动预测来优化决策。
Meta 发布 Muse Spark 1.2 新评测与演示,展示其多模态能力广度,涵盖视觉转代码、感知转物理动作及音视频理解。演示中,模型解析多模态观察并调用工具,引导机器人在非结构化环境中导航寻找橡皮鸭。
机器人初创公司 Generalist AI 发布 GEN-1.5,该模型可将 3 至 12 秒的演示作为“物理提示词”载入上下文窗口,让机器人无需训练即可执行任务。在开罐、取钱等十项测试中,平均成功率为 59%;用五分钟数据训练十步后,成功率升至 83%。模型还能串联两个提示词、使用仿真演示并部分模仿人类手部动作,但所有结果均出自公司自身,未经独立验证。
Dyna Robotics 发布 Dyna-2,一个在超100万小时第一人称人类视频上预训练的世界-动作模型(WAM),用于机器人操作。研究团队验证了从1,000到1,000,000小时数据的缩放定律,并首次将该定律零样本迁移至未见过的机器人数据;视频联合去噪在39/39任务上优于仅动作训练,将零样本机器人MSE从0.340降至0.120。
具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超 100 万小时第一人称人类视频预训练,任务成功率最高达 90%。该模型通过预测下一帧画面及应采取动作,补足传统视觉语言模型缺失的空间推理与接触物理能力。
LTX 发布 LTX-2.5,一个面向视频生成、实时应用和物理 AI 的开源权重世界模型,针对 NVIDIA RTX GPU 和 DGX Spark 本地推理优化,降低了 VRAM 需求。
同一事件,精选展示《LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI》Dyna Robotics 推出 Dyna-2,一个用 100 万小时人类视频预训练的世界动作模型,证明机器人预测能力随人类视频数据量单调提升。该模型在未见过的客户现场实现 87% 生产通过率,远超 Dyna-1 的 46%。团队首次发现人类数据规模定律,并验证其可迁移至未见机器人数据。
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
小米技术宣布具身基座模型 Xiaomi-Robotics-1 正式开源。该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练。本次开源覆盖从真机后训练到模型部署的完整流程,并提供相关 Benchmark 的评测代码。
京东今日开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持用户一边观看视频一边修改人物与场景。该模型基于全自研 JoyAI-Video 模型,在 720P 分辨率下实现每秒 30 帧的模型推理速度,并支持任意时长的稳定流式编辑。在 OpenVE-Bench 通用评测中,模型超越目前所有流式编辑方法,全局风格、局部替换等任务优势突出。
另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)英伟达今日推出 Alpamayo 2 Super,一款面向自动驾驶的前沿开源推理模型,可在行动前理解并推理复杂世界。该模型适用于 Robotaxi、卡车、班车、配送车及拖拉机等移动机器人,已按 OpenMDW-1.1 协议开放商用,支持团队检查、微调与部署。
同一事件,精选展示《NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型》NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 1 家信源报道IT之家(RSS)Google DeepMind 发布 Gemini Robotics 2,称其为迄今最先进的视觉-语言-动作(VLA)模型,可控制从桌面机械臂到全身人形机器人的各类系统。该模型支持全身运动、精细操作及多机器人协同,开发者可通过候补名单申请早期访问。同期发布的 Gemini Robotics ER 2 专为具身推理设计,已上线 Google AI Studio。
字节跳动今日发布新一代视频生成模型 Seedance 2.5,火山引擎将于近期上线 API 服务。徐工集团、小鹏汽车、智元机器人、穹彻智能等多家企业已达成合作意向,将率先接入该模型。Seedance 2.5 延续统一的多模态音视频联合生成架构,重点提升长叙事、多模态参考和编辑能力,并新增白模参考能力,已落地工业制造、汽车、具身智能、智能驾驶等实体产业。
火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。
另有 8 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)字节 Seed:Research Feed(网页内嵌数据)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)谷歌 DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的最强具身推理模型。相比 1.6 版本,ER 2 可分析连续视频流以追踪任务进度、在出错时调整,并在任务进度分类测试中准确率达 57.4%,时刻寻找测试中准确率为 91.3%。该模型执行速度为更大模型的 4 倍,支持多机器人协作,现已通过 Gemini API 和 Google AI Studio 公开提供。
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》Google DeepMind 推出 Gemini Robotics 2,通过 Gemini Robotics ER 2 等三个新子模型为机器人带来全身智能。ER 2 可处理实时视频流,关键动作识别准确率近 90%,并支持多机器人协作。新安全基准 ASIMOV-Agentic 已开源至 Hugging Face,ER 2 模型即日起通过 Gemini Live API 向开发者开放。
One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...
Google DeepMind 发布 Gemini Robotics 2,该模型能从“脚趾到指尖”控制人形机器人全身动作,支持行走、蹲下、伸展和操作物体。新模型可控制更复杂的五指手,完成封袋、系垃圾袋等精细任务。同时更新的 Gemini Robotics ER 2 能更好理解任务起止,并支持多台不同类型机器人协作。
Google DeepMind 发布 Gemini Robotics 2,作为其下一代机器人的智能层。该版本包含三个模型:用于全身人形控制的视觉-语言-动作模型、用于具身推理与任务编排的 Gemini Robotics ER 2,以及可在数小时内适配新机器人本体的端侧 VLA。单个检查点驱动 Apptronik Apollo 2 与 Franka Duo,仅 ER 2 公开可用。
Google DeepMind 推出 Gemini Robotics 2,可控制人形机器人全身动作,包括行走、蹲伏及五指精细操作。该系统融合三个模型,在全身任务上成功率 45.7%-76.3%,五指操作成功率从 32%(用簸箕)到 92%(拧灯泡)不等。
One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...
Google DeepMind 发布 Gemini Robotics 2,为机器人赋予全身智能。该模型基于 Gemini 架构,使机器人能协调手臂、躯干和腿部动作以完成复杂任务,并具备物体操控与环境适应能力。目前尚未公布具体参数规模、上下文长度及可用性细节。
Google 发布 Gemini Robotics ER 2,一个全新的具身推理模型。该模型在成功/失败检测上支持原始视频流而非静态快照,可捕捉溢出、滑落等执行中故障;通用仪表读数能力从圆形表盘扩展至数字显示屏、线性刻度尺、液体温度计等 10 种类型。其空间 VQA 能力也通过 Gemini 多模态理解提升得到增强。
One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》Google DeepMind 发布三款新机器人模型。Gemini Robotics 2 是高级视觉-语言-动作模型,支持全身人形机器人、指尖操作和双臂机器人。Gemini Robotics ER 2 具备具身推理能力,可帮助机器人与人沟通、理解世界并规划多步骤任务。
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
Google DeepMind 推出 Gemini Robotics 2,作为新一代自适应机器人的智能层,支持全身控制、高级灵巧操作及多机器人协作。同时发布新具身推理模型 Gemini Robotics ER 2,作为机器人的“高层大脑”,负责观察环境、推理任务步骤、协调视觉-语言-动作模型执行动作并追踪进度,使机器人能执行复杂多步骤工作流、自我纠错并适应全新场景。
同一事件,精选展示《Google DeepMind 发布 Gemini Robotics 2 物理 AI》智元自研的具身原生全模态大模型 WITA-Omni Preview 以 85.21 分综合成绩登顶 DailyOmni 榜单,在八项细分指标中的六项取得第一,超过千问、Gemini、豆包、英伟达等模型。该模型采用 Thinker–Talker–Actor 架构,将物理动作和表情提升为与语音并列的一级输出,并通过千万小时级多模态数据训练实现音视频联合理解与时序推理。
Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。
同一事件,精选展示《Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频》特斯拉 FSD v15 早期测试版本已在 Robotaxi 车队中实际运行,目前搭载于改装版 Model Y(HW4 硬件平台)。相比 FSD v14,v15 规划了七项重大改进,当前版本已实现约 40% 的预期改进内容。FSD v15 计划今年晚些时候或明年初向公众推出,新模型参数规模将达到当前 FSD 的 10 倍,但 HW3 硬件车辆将无法获得该更新。
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
另有 3 家信源报道IT之家(RSS)X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)