内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 140 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「具身智能」清除

8月24日周一

22:43Generalist29GEN-1.5 缩短物理提示到机器人行为时间
22:29MarkTechPost(RSS)60Generalist AI 发布 GEN-1.5:一个从 3-12 秒演示中学会新任务的机器人基础模型

8月22日周六

02:18Rohan Paul40TARS 发布 AWE 3.5 具身原生基础模型

8月21日周五

01:35AI at Meta53Meta 发布 Muse Spark 1.2 多模态评测与演示

8月20日周四

20:55The Decoder:AI News(RSS)48GEN-1.5:通用型 AI 仅凭单次演示教会机器人新任务
03:40Generalist39GEN-1.5 发布:秒级学习新任务的一次性学习者

8月13日周四

15:51MarkTechPost(RSS)47Dyna Robotics 发布 Dyna-2:基于100万小时人类视频预训练的世界-动作模型
14:15IT之家(RSS)62机器人 AI 模型 DYNA-2 登场:超 100 万小时人类视频训练,任务成功率可达 90%

8月12日周三

04:17MarkTechPost(RSS)64同事件LTX-2.5 发布:NVIDIA 加速的开源权重世界模型,将视频制作栈压缩到一张桌面同一事件,精选展示《LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI》

8月11日周二

03:46Rohan Paul50Dyna-2 用百万小时人类视频预训练机器人
02:44elvis40Dyna-2 世界动作模型发现新缩放定律

8月6日周四

21:12NVIDIA Blog(RSS)71精选NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

8月5日周三

16:08IT之家(RSS)67小米具身基座模型 Xiaomi-Robotics-1 正式开源
10:07IT之家(RSS)52京东开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持"边播边改"

8月4日周二

23:15Jensen Huang76同事件英伟达发布 Alpamayo 2 Super 开源自动驾驶推理模型同一事件,精选展示《NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型》
23:12NVIDIA Blog(RSS)68精选NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型
22:47Generalist46GEN-1 学习新执行器与机器人效率提升 10-20 倍

8月1日周六

05:06Logan Kilpatrick45Gemini Robotics 2 深度对话:机器人进展与未来
02:27The Decoder:AI News(RSS)66Google DeepMind 推出 Gemini Robotics 2,为各类机器人提供智能层

7月31日周五

15:05IT之家(RSS)39字节跳动发布 Seedance 2.5 视频生成模型,小鹏汽车、智元机器人等将率先接入
13:43公众号:火山引擎53Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向
08:05IT之家(RSS)54同事件谷歌 DeepMind 推出 Gemini Robotics ER 2,最强具身推理模型支持连续视频理解与多机器人协作同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
02:28Ars Technica:AI(RSS)65Google 发布 Gemini Robotics 2.0,提升机器人灵巧性与安全性
01:57Demis Hassabis60Gemini Robotics 2 发布,机器人可推理协作
01:57The Verge:AI(RSS)57Google DeepMind 发布 Gemini Robotics 2,可控制人形机器人全身动作
01:28MarkTechPost(RSS)63Google DeepMind 发布 Gemini Robotics 2,包含三款实体 AI 模型用于全身控制、灵巧操作与多机器人协作
01:27Chubby♨️55Google DeepMind 推出 Gemini Robotics 2,可控制人形机器人全身动作
00:28AK36TurboVLA:RTX 4090 上 32Hz 实时模型
00:27Hacker News 热门(buzzing.cc 中文翻译)48Gemini Robotics 2 为机器人带来全身智能
00:04🚨 AI News | TestingCatalog53同事件Google 推出具身推理模型 Gemini Robotics ER 2同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》

7月30日周四

23:56fofr50Google DeepMind 推出三款新机器人模型
23:33Logan Kilpatrick50Gemini Robotics ER 2 发布,基于 Gemini 的具身推理模型
23:33Google AI Developers64同事件Gemini Robotics ER 2 发布,专为物理 AI 设计同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
23:27Google DeepMind71精选Google DeepMind 发布 Gemini Robotics 2 物理 AI
23:27Google DeepMind:Blog(RSS)60精选Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
23:16Google AI69同事件Google DeepMind 发布 Gemini Robotics 2 与 ER 2同一事件,精选展示《Google DeepMind 发布 Gemini Robotics 2 物理 AI》

7月28日周二

20:04IT之家(RSS)62智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单,综合得分 85.21

7月27日周一

01:57MarkTechPost(RSS)70同事件Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型同一事件,精选展示《Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频》

7月26日周日

08:50IT之家(RSS)66特斯拉 FSD v15 早期版本已上路,Robotaxi 车队率先搭载

7月24日周五

20:24Hacker News 热门(buzzing.cc 中文翻译)75精选FLUX 3 x mimic:新一代视频动作模型
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「具身智能」 · 140 条清除

8月24日

星期一 · 2 条
22:43
Generalist@GeneralistAI
AI 评分 29/100
我们缩短了从物理提示到机器人行为所需的时间。任何人教会机器人新技能的速度越快,规模化物理工作就越容易。更多关于 GEN-1.5 的内容,请阅读下方评论中的博客文章。
具身智能模型发布
22:29
MarkTechPost(RSS)
AI 评分 60/100
Generalist AI 发布 GEN-1.5:一个从 3-12 秒演示中学会新任务的机器人基础模型

Generalist AI 发布机器人基础模型 GEN-1.5,将 3–12 秒的传感器运动数据放入 30 秒上下文窗口即可执行任务,无需梯度更新或微调。在 10 项操作任务中,单次上下文提示平均成功率达 59%(±10%),每任务用 5 分钟数据做 10 步梯度更新后提升至 83%(±9%)。该能力并非显式训练,而是从超八个月预训练中涌现;目前无公开权重、API 或定价,属研究发布。

具身智能多模态模型发布

8月22日

星期六 · 1 条
02:18
Rohan Paul@rohanpaul_ai
AI 评分 40/100
TARS 发布 AWE 3.5 具身原生基础模型

TARS 推出具身原生基础模型 AWE 3.5,采用“Born as One”架构,将动作、感知、几何与触觉整合进单一模型,而非后期拼接。该模型支持数分钟长时程闭环推理,任务执行效率约为 PI0.5 的 2 倍,并通过预训练双先验与后训练世界引擎滚动预测来优化决策。

具身智能多模态模型发布

8月21日

星期五 · 1 条
01:35
AI at Meta@AIatMeta
AI 评分 53/100
Meta 发布 Muse Spark 1.2 多模态评测与演示

Meta 发布 Muse Spark 1.2 新评测与演示,展示其多模态能力广度,涵盖视觉转代码、感知转物理动作及音视频理解。演示中,模型解析多模态观察并调用工具,引导机器人在非结构化环境中导航寻找橡皮鸭。

Meta具身智能多模态模型发布

8月20日

星期四 · 2 条
20:55
The Decoder:AI News(RSS)
AI 评分 48/100
GEN-1.5:通用型 AI 仅凭单次演示教会机器人新任务

机器人初创公司 Generalist AI 发布 GEN-1.5,该模型可将 3 至 12 秒的演示作为“物理提示词”载入上下文窗口,让机器人无需训练即可执行任务。在开罐、取钱等十项测试中,平均成功率为 59%;用五分钟数据训练十步后,成功率升至 83%。模型还能串联两个提示词、使用仿真演示并部分模仿人类手部动作,但所有结果均出自公司自身,未经独立验证。

具身智能多模态模型发布
03:40
Generalist@GeneralistAI
AI 评分 39/100
推出 GEN-1.5,一个一次性学习者。它能在几秒内学会新任务。向它展示要做什么,它便能泛化。这一能力源于在大规模物理数据上的预训练,是迈向为物理世界构建通用智能这一使命的一步。
具身智能数据/训练模型发布

8月13日

星期四 · 2 条
15:51
MarkTechPost(RSS)
AI 评分 47/100
Dyna Robotics 发布 Dyna-2:基于100万小时人类视频预训练的世界-动作模型

Dyna Robotics 发布 Dyna-2,一个在超100万小时第一人称人类视频上预训练的世界-动作模型(WAM),用于机器人操作。研究团队验证了从1,000到1,000,000小时数据的缩放定律,并首次将该定律零样本迁移至未见过的机器人数据;视频联合去噪在39/39任务上优于仅动作训练,将零样本机器人MSE从0.340降至0.120。

具身智能数据/训练模型发布
14:15
IT之家(RSS)
AI 评分 62/100
机器人 AI 模型 DYNA-2 登场:超 100 万小时人类视频训练,任务成功率可达 90%

具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超 100 万小时第一人称人类视频预训练,任务成功率最高达 90%。该模型通过预测下一帧画面及应采取动作,补足传统视觉语言模型缺失的空间推理与接触物理能力。

具身智能数据/训练模型发布

8月12日

星期三 · 1 条
04:17
MarkTechPost(RSS)同事件
AI 评分 64/100
LTX-2.5 发布:NVIDIA 加速的开源权重世界模型,将视频制作栈压缩到一张桌面

LTX 发布 LTX-2.5,一个面向视频生成、实时应用和物理 AI 的开源权重世界模型,针对 NVIDIA RTX GPU 和 DGX Spark 本地推理优化,降低了 VRAM 需求。

具身智能多模态开源生态模型发布
同一事件,精选展示《LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI》

8月11日

星期二 · 2 条
03:46
Rohan Paul@rohanpaul_ai
AI 评分 50/100
Dyna-2 用百万小时人类视频预训练机器人

Dyna Robotics 推出 Dyna-2,一个用 100 万小时人类视频预训练的世界动作模型,证明机器人预测能力随人类视频数据量单调提升。该模型在未见过的客户现场实现 87% 生产通过率,远超 Dyna-1 的 46%。团队首次发现人类数据规模定律,并验证其可迁移至未见机器人数据。

Dyna Robotics: Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...

具身智能数据/训练模型发布
02:44
elvis@omarsar0
AI 评分 40/100
DynaRobotics 推出 Dyna-2,一个基于 100 万小时人类视频预训练的世界动作模型,可同时预测未来视频与动作。首次发现人类数据在 1000 至 100 万小时四个数量级上的缩放定律,并外推至未见过的机器人数据,表明世界建模与视频数据缩放对跨本体迁移至关重要。

Dyna Robotics: Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...

具身智能模型发布

8月6日

星期四 · 1 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

具身智能多模态开源生态模型发布

推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日

星期三 · 2 条
16:08
IT之家(RSS)
AI 评分 67/100
小米具身基座模型 Xiaomi-Robotics-1 正式开源

小米技术宣布具身基座模型 Xiaomi-Robotics-1 正式开源。该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练。本次开源覆盖从真机后训练到模型部署的完整流程,并提供相关 Benchmark 的评测代码。

GitHub具身智能模型发布
10:07
IT之家(RSS)
AI 评分 52/100
京东开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持"边播边改"

京东今日开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持用户一边观看视频一边修改人物与场景。该模型基于全自研 JoyAI-Video 模型,在 720P 分辨率下实现每秒 30 帧的模型推理速度,并支持任意时长的稳定流式编辑。在 OpenVE-Bench 通用评测中,模型超越目前所有流式编辑方法,全局风格、局部替换等任务优势突出。

具身智能模型发布视频
另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)

8月4日

星期二 · 3 条
23:15
Jensen Huang@JensenHuang同事件
AI 评分 76/100
英伟达发布 Alpamayo 2 Super 开源自动驾驶推理模型

英伟达今日推出 Alpamayo 2 Super,一款面向自动驾驶的前沿开源推理模型,可在行动前理解并推理复杂世界。该模型适用于 Robotaxi、卡车、班车、配送车及拖拉机等移动机器人,已按 OpenMDW-1.1 协议开放商用,支持团队检查、微调与部署。

具身智能开源生态推理模型发布
同一事件,精选展示《NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型》
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

具身智能开源生态推理模型发布
另有 1 家信源报道IT之家(RSS)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
22:47
Generalist@GeneralistAI
AI 评分 46/100
我们改进了 GEN-1 在最底层学习适应新执行器和新机器人的方式,内部基准测试显示性能提升高达 10-20 倍。这显著增强了高精度任务的表现,例如从 NIST 板上拆卸零件。更多关于 GEN-1 的内容,请阅读下方评论中的博客文章。
具身智能模型发布

8月1日

星期六 · 2 条
05:06
Logan Kilpatrick@OfficialLoganK
AI 评分 45/100
与 Google DeepMind 机器人团队的一次对话,探讨我们最新的 Gemini Robotics 2 模型、机器人技术进步的轨迹,以及我们下一步的方向 🤖
Google具身智能模型发布
02:27
The Decoder:AI News(RSS)
AI 评分 66/100
Google DeepMind 推出 Gemini Robotics 2,为各类机器人提供智能层

Google DeepMind 发布 Gemini Robotics 2,称其为迄今最先进的视觉-语言-动作(VLA)模型,可控制从桌面机械臂到全身人形机器人的各类系统。该模型支持全身运动、精细操作及多机器人协同,开发者可通过候补名单申请早期访问。同期发布的 Gemini Robotics ER 2 专为具身推理设计,已上线 Google AI Studio。

DeepMindGoogle具身智能多模态

7月31日

星期五 · 11 条
15:05
IT之家(RSS)
AI 评分 39/100
字节跳动发布 Seedance 2.5 视频生成模型,小鹏汽车、智元机器人等将率先接入

字节跳动今日发布新一代视频生成模型 Seedance 2.5,火山引擎将于近期上线 API 服务。徐工集团、小鹏汽车、智元机器人、穹彻智能等多家企业已达成合作意向,将率先接入该模型。Seedance 2.5 延续统一的多模态音视频联合生成架构,重点提升长叙事、多模态参考和编辑能力,并新增白模参考能力,已落地工业制造、汽车、具身智能、智能驾驶等实体产业。

具身智能模型发布视频
13:43
公众号:火山引擎
AI 评分 53/100
Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向

火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。

具身智能模型发布视频
另有 8 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)字节 Seed:Research Feed(网页内嵌数据)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
08:05
IT之家(RSS)同事件
AI 评分 54/100
谷歌 DeepMind 推出 Gemini Robotics ER 2,最强具身推理模型支持连续视频理解与多机器人协作

谷歌 DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的最强具身推理模型。相比 1.6 版本,ER 2 可分析连续视频流以追踪任务进度、在出错时调整,并在任务进度分类测试中准确率达 57.4%,时刻寻找测试中准确率为 91.3%。该模型执行速度为更大模型的 4 倍,支持多机器人协作,现已通过 Gemini API 和 Google AI Studio 公开提供。

DeepMindGoogle具身智能推理
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
02:28
Ars Technica:AI(RSS)
AI 评分 65/100
Google 发布 Gemini Robotics 2.0,提升机器人灵巧性与安全性

Google DeepMind 推出 Gemini Robotics 2,通过 Gemini Robotics ER 2 等三个新子模型为机器人带来全身智能。ER 2 可处理实时视频流,关键动作识别准确率近 90%,并支持多机器人协作。新安全基准 ASIMOV-Agentic 已开源至 Hugging Face,ER 2 模型即日起通过 Gemini Live API 向开发者开放。

Google具身智能安全/对齐模型发布
01:57
Demis Hassabis@demishassabis
AI 评分 60/100
Gemini Robotics 2 来了,凭借我们新的模型套件,机器人现在可以推理每一步动作,以完成以前无法实现的任务,比如系精致的结--甚至能协作解决复杂工作流程。热烈祝贺机器人团队取得这一重要里程碑!

Google DeepMind: One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...

Google具身智能模型发布
01:57
The Verge:AI(RSS)
AI 评分 57/100
Google DeepMind 发布 Gemini Robotics 2,可控制人形机器人全身动作

Google DeepMind 发布 Gemini Robotics 2,该模型能从“脚趾到指尖”控制人形机器人全身动作,支持行走、蹲下、伸展和操作物体。新模型可控制更复杂的五指手,完成封袋、系垃圾袋等精细任务。同时更新的 Gemini Robotics ER 2 能更好理解任务起止,并支持多台不同类型机器人协作。

Google具身智能模型发布
01:28
MarkTechPost(RSS)
AI 评分 63/100
Google DeepMind 发布 Gemini Robotics 2,包含三款实体 AI 模型用于全身控制、灵巧操作与多机器人协作

Google DeepMind 发布 Gemini Robotics 2,作为其下一代机器人的智能层。该版本包含三个模型:用于全身人形控制的视觉-语言-动作模型、用于具身推理与任务编排的 Gemini Robotics ER 2,以及可在数小时内适配新机器人本体的端侧 VLA。单个检查点驱动 Apptronik Apollo 2 与 Franka Duo,仅 ER 2 公开可用。

DeepMind具身智能模型发布
01:27
Chubby♨️@kimmonismus
AI 评分 55/100
Google DeepMind 推出 Gemini Robotics 2,可控制人形机器人全身动作

Google DeepMind 推出 Gemini Robotics 2,可控制人形机器人全身动作,包括行走、蹲伏及五指精细操作。该系统融合三个模型,在全身任务上成功率 45.7%-76.3%,五指操作成功率从 32%(用簸箕)到 92%(拧灯泡)不等。

Google DeepMind: One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...

DeepMindGoogle具身智能模型发布
00:28
AK@_akhaliq
AI 评分 36/100
TurboVLA在 RTX 4090 上以 32 Hz 运行、显存占用小于 1 GB 的实时视觉-语言-动作模型论文:https://huggingface.co/papers/2607.27205
Hugging Face具身智能模型发布
00:27
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 48/100
Gemini Robotics 2 为机器人带来全身智能

Google DeepMind 发布 Gemini Robotics 2,为机器人赋予全身智能。该模型基于 Gemini 架构,使机器人能协调手臂、躯干和腿部动作以完成复杂任务,并具备物体操控与环境适应能力。目前尚未公布具体参数规模、上下文长度及可用性细节。

DeepMind具身智能模型发布
00:04
🚨 AI News | TestingCatalog@testingcatalog同事件
AI 评分 53/100
Google 推出具身推理模型 Gemini Robotics ER 2

Google 发布 Gemini Robotics ER 2,一个全新的具身推理模型。该模型在成功/失败检测上支持原始视频流而非静态快照,可捕捉溢出、滑落等执行中故障;通用仪表读数能力从圆形表盘扩展至数字显示屏、线性刻度尺、液体温度计等 10 种类型。其空间 VQA 能力也通过 Gemini 多模态理解提升得到增强。

Google DeepMind: One brain. For any robot. 🤖 We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intel...

Google具身智能模型发布
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》

7月30日

星期四 · 6 条
23:56
fofr@fofrAI
AI 评分 50/100
Google DeepMind 推出三款新机器人模型

Google DeepMind 发布三款新机器人模型。Gemini Robotics 2 是高级视觉-语言-动作模型,支持全身人形机器人、指尖操作和双臂机器人。Gemini Robotics ER 2 具备具身推理能力,可帮助机器人与人沟通、理解世界并规划多步骤任务。

DeepMind具身智能多模态模型发布
23:33
Logan Kilpatrick@OfficialLoganK
AI 评分 50/100
推出 Gemini Robotics ER 2,这是我们基于 Gemini 的最新机器人具身推理模型。 与上一代 ER 模型(以及基线 Gemini 3.6 Flash)相比,取得了巨大进步。非常期待看到更多机器人用这个模型做有用的事!
Google具身智能推理模型发布
23:33
Google AI Developers@googleaidevs同事件
AI 评分 64/100
Gemini Robotics ER 2 是我们最强大的具身推理模型,专为物理 AI 设计 🤖该模型作为机器人的高级大脑,可直接连接 Gemini Live API。它处理连续视频流以跟踪进度、调用工具、搜索网络,并实时指挥动作模型。面向开发者的升级包括:+ 增强的进度跟踪 + 实时执行中故障检测 + 多机器人协作 + 高级安全指令遵循
Google具身智能模型发布部署/工程
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
23:27
Google DeepMind@GoogleDeepMind精选
AI 评分 71/100
One brain. For any robot. 🤖我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
DeepMind具身智能模型发布

推荐理由:这是谷歌把通用大模型能力注入机器人的关键一步,全身智能和灵巧操作如果能兑现,制造业的自动化想象会彻底改写。
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

DeepMind具身智能多模态模型发布

推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
23:16
Google AI@GoogleAI同事件
AI 评分 69/100
Google DeepMind 发布 Gemini Robotics 2 与 ER 2

Google DeepMind 推出 Gemini Robotics 2,作为新一代自适应机器人的智能层,支持全身控制、高级灵巧操作及多机器人协作。同时发布新具身推理模型 Gemini Robotics ER 2,作为机器人的“高层大脑”,负责观察环境、推理任务步骤、协调视觉-语言-动作模型执行动作并追踪进度,使机器人能执行复杂多步骤工作流、自我纠错并适应全新场景。

DeepMindGoogle具身智能模型发布
同一事件,精选展示《Google DeepMind 发布 Gemini Robotics 2 物理 AI》

7月28日

星期二 · 1 条
20:04
IT之家(RSS)
AI 评分 62/100
智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单,综合得分 85.21

智元自研的具身原生全模态大模型 WITA-Omni Preview 以 85.21 分综合成绩登顶 DailyOmni 榜单,在八项细分指标中的六项取得第一,超过千问、Gemini、豆包、英伟达等模型。该模型采用 Thinker–Talker–Actor 架构,将物理动作和表情提升为与语音并列的一级输出,并通过千万小时级多模态数据训练实现音视频联合理解与时序推理。

具身智能多模态模型发布

7月27日

星期一 · 1 条
01:57
MarkTechPost(RSS)同事件
AI 评分 70/100
Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型

Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。

具身智能多模态开源生态模型发布
同一事件,精选展示《Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频》

7月26日

星期日 · 1 条
08:50
IT之家(RSS)
AI 评分 66/100
特斯拉 FSD v15 早期版本已上路,Robotaxi 车队率先搭载

特斯拉 FSD v15 早期测试版本已在 Robotaxi 车队中实际运行,目前搭载于改装版 Model Y(HW4 硬件平台)。相比 FSD v14,v15 规划了七项重大改进,当前版本已实现约 40% 的预期改进内容。FSD v15 计划今年晚些时候或明年初向公众推出,新模型参数规模将达到当前 FSD 的 10 倍,但 HW3 硬件车辆将无法获得该更新。

具身智能模型发布

7月24日

星期五 · 1 条
20:24
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
FLUX 3 x mimic:新一代视频动作模型

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

具身智能多模态模型发布
另有 3 家信源报道IT之家(RSS)X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)
推荐理由:Flux 3 证明了一个基础模型能同时生成视频和驱动机器人,Audi 产线的真实部署验证了物理 AI 从实验室走向量产,是基础模型走向通用世界理解的扎实一步。
已加载 40 条