8月19日,2026世界机器人大会在北京开幕,百度智能云将举办“具身智能场景落地”专题活动。北京人形、智元创新、星动纪元、自变量机器人、帕西尼、苏度科技、原力灵机、吉翼机器人等近20位行业技术先锋与企业创始人将围绕具身智能发展趋势、技术产品演进、真实场景落地与商业化破局展开交流,探讨物理AI如何从“看得见的未来”走向“用得上的现在”。
8月19日,2026世界机器人大会在北京开幕,百度智能云将举办“具身智能场景落地”专题活动。北京人形、智元创新、星动纪元、自变量机器人、帕西尼、苏度科技、原力灵机、吉翼机器人等近20位行业技术先锋与企业创始人将围绕具身智能发展趋势、技术产品演进、真实场景落地与商业化破局展开交流,探讨物理AI如何从“看得见的未来”走向“用得上的现在”。
8月18日,面壁智能与厘清智能签署战略合作协议,围绕大模型技术在具身智能领域的深度应用展开联合研发,推动具身智能基础模型训练、智能数据采集等关键技术产业化落地。双方将探索“云端大模型+端侧模型+物理AI模型”协同范式,打通“端侧大脑”与“物理AI”闭环,加速具身智能从实验室走向规模化商用。
AWS 开源的 Strands Robots(Apache 2.0)通过单一智能体循环,将机器人演示记录、基于 Hub 数据流的策略训练及硬件部署整合在一起,全程保持 LeRobot 磁盘格式不变。
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
加里·马库斯批评马斯克关于机器人手术时间线的预测“完全疯狂”,并援引机器人专家罗德尼·布鲁克斯的观点:目前连在活体实验动物上进行手术的实验室演示都远未实现,现有手术机器人全部仍需人类在环操作。马库斯担忧此类预测可能吓退潜在外科医生,并指出马斯克的时间线估计至少偏差十年。
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)百度智能云在2026可信云大会上分享百度百舸AI计算平台在具身模型训练、推理、仿真和资源管理方面的最新实践。平台针对VLA模型和全身控制策略两类场景优化,VLM多模态混合训练吞吐提升约1至5倍,π0.5和GR00T N1.7训练吞吐分别提升2.08倍和1.75倍,Isaac Sim任务启动时长减少83.3%。IDC报告显示,2025年百度智能云以29.55%市场份额位居中国具身智能云市场第一。
火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。
另有 8 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)字节 Seed:Research Feed(网页内嵌数据)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)机器人操作需根据任务、物体和交互环境调整动作执行方式。MoMo 提出两阶段模仿学习框架,包含时空动作分词器和行为克隆 Transformer,将任务与连续运动模式条件作为输入。在六项真实机器人操作任务中,改变该条件可稳定生成不同执行风格的动作。
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
另有 4 家信源报道X:Google AI for Developers (@googleaidevs)IT之家(RSS)Ars Technica:AI(RSS)X:Testing Catalog (@testingcatalog)NVIDIA Jetson 平台为边缘 AI 和机器人提供紧凑型开发套件,可放入手提包中。其中 Jetson Orin Nano Super 具备 67 TOPS 的 AI 性能,支持运行 Mistral 等开源模型,所有推理均在本地 GPU 加速完成,无需云端或 API 密钥。
Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。
生数科技在 WAIC 2026 上展示了从数字世界生成到物理世界行动的通用世界模型。其视频生成模型 Vidu 已形成产品矩阵,实时交互模型 Vidu S1 支持 540P、最高 42FPS 的视频通话级输出。面向物理世界的世界动作模型 Motubrain 在 RoboTwin 2.0 榜单的 Clean 和 Randomized 场景下均位列第一。
生数科技在WAIC 2026集中展示通用世界模型最新进展,覆盖数字世界生成、实时交互与物理世界行动。其世界动作模型Motubrain在RoboTwin 2.0榜单Clean和Randomized场景分别取得95.8分和96.1分,均位列第一;在WorldArena榜单以63.77的总体EWM Score位列第一。
2026 年第四届美团低空经济与具身智能挑战赛启动报名,面向全球高校在校学生,总奖金 55 万元。赛事以无人机换电任务为原型,考察机器人在视觉识别、运动规划、精准操作等方面的综合能力,参赛设备形态不限。初赛需提交机器人演示视频与技术报告,决赛为线下实机挑战,表现优异者可获美团无人机实习机会及“北斗计划”直通面试权。
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
2026 年第四届美团低空经济与具身智能挑战赛启动报名,面向全球高校在校学生,总奖金池达 55 万元。赛事以无人机换电任务为原型,考察机器人在视觉识别、运动规划、精准操作等方面的综合能力,分为初赛与线下硬件决赛。报名时间为 2026 年 7 月 22 日至 9 月 1 日,优胜者有机会获得美团无人机实习机会及“北斗计划”直通面试权。
美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。
同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》NVIDIA 宣布开源 Medical Physics Simulation 框架,这是 Isaac for Healthcare 中首个 GPU 加速的医疗物理仿真能力。该框架可并行运行 8,192 个机器人训练环境,将训练时间从超过 5 小时缩短至不到 2 分钟。CMR Surgical、Johnson & Johnson MedTech 等机构已在使用该框架。
面壁智能与吉利人工智能中心在 WAIC 2026 联合发布具身智能体框架 RoboHarness,基于 EmbodiedClaw 开发,集成 VLM 与 VLA 模型。该框架已在吉利生产仓储场景实现常态化作业,支持自主决策与失败重试,并依托吉利星睿智算中心(23.5 EFLOPS)训练。
2026世界人工智能大会现场,面壁智能与吉利人工智能中心联合发布具身智能体框架RoboHarness,基于该框架的机器人已在吉利生产仓储场景实现常态化作业。该框架基于面壁2026年4月发布的EmbodiedClaw开发,集成VLM多模态大模型与VLA模型,并内置数据闭环设计,支持自主决策与失败重试恢复。双方还依托吉利星睿智算中心(综合算力23.5 EFLOPS)共同训练并推出全新VLA具身模型。
生数科技联合创始人骆怡航在WAIC 2026提出,通用世界模型需像大语言模型一样建立统一基座,实现感知、预测与行动的闭环。公司围绕该基座构建“一体两翼”产品体系:Vidu Q系列面向数字内容生成,Vidu S系列推动实时交互,Motubrain面向物理世界机器人控制。世界模型正从学术研究走向产业中心,成为AI理解并行动于真实世界的关键路径。
生数科技联合创始人兼CEO骆怡航在WAIC 2026论坛上提出,仅靠大语言模型理解世界只使用了人类智能的一小部分,AI下一阶段需要达到LLM范式级别的通用世界模型。该模型需形成感知、预测与行动的动态闭环,并具备跨场景的通用性与泛化能力。生数科技已构建统一基座,通过Vidu Q系列、Vidu S系列和Motubrain分别覆盖数字内容生成、实时交互与物理世界行动。
物理 AI 系统因真实世界数据采集慢、成本高且风险大,转而依赖仿真生成大规模物理数据。MuJoCo 侧重精确动力学与接触建模,其 GPU 加速版 MuJoCo Warp 适合大规模策略训练;NVIDIA Isaac Sim 与 Isaac Lab 则提供 GPU 加速物理与 RTX 渲染,支持合成数据生成与强化学习。
Hugging Face 推出 Grabette,一套开源低成本系统,用户手持夹爪即可在几分钟内录制操作演示,并自动生成机器人可用的数据集。Grabette 配备鱼眼相机与 RGBD 相机,通过 SLAM 恢复 6-DoF 轨迹,硬件物料成本约 490 欧元。所有硬件设计、处理流程与训练代码均开源,数据以标准 LeRobot 格式上传至 Hugging Face Hub,支持任意机器人后端。
生数科技创始人朱军在WAIC 2026上提出,通用世界模型需具备理解、想象与行动一体化能力,并发布全球首个MoT统一架构。该架构将理解、生成与行动专家统一于同一模型,支撑Vidu Q3等视频生成模型及具身智能机器人控制。最新模型可驱动多种异构机器人完成长程任务,在跨场景泛化上取得行业领先效果。
生数科技创始人朱军在WAIC 2026论坛上提出,通用世界模型需实现理解、想象与行动一体化,将成为连接数字与物理世界的基础设施。公司已发布全球首个MoT统一架构,并推出Vidu Q3及实时生成模型,后者支持540P、42FPS输出与无限时长连续对话。最新模型可基于同一底座驱动多种异构机器人完成长程任务,跨场景泛化能力较去年12月开源版本显著提升。
NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。
NVIDIA 在 SIGGRAPH 2026 主题演讲中发布 Cosmos 3 Edge,一个 4B 参数的开放世界模型,可在设备端实时运行。同时推出 Cosmos-Dreams 闭环模拟器,能在单张 RTX PRO 6000 GPU 上从单帧生成完整世界。
百度集团副总裁袁佛玉在2026世界人工智能大会(WAIC)上表示,具身智能正从“能力验证”走向“生产力兑现”,行业需跨越模型、数据和本体部署三道关卡。百度百舸AI计算平台将Fast-WAM单步推理延迟降低至90毫秒以内,并联合发布dVLA-RL强化学习训练框架。百度智能云正与国地中心、智元机器人等伙伴推进数据建设、安全体系及云管端全域安全能力,并作为唯一入选云厂商参与国家级人形机器人标准制定。
面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。
阶跃星辰在 WAIC 2026 展出大模型原生智能体手机 STEPX Neo,该手机搭载智能体原生操作系统 Step AOS,为首批通过 L3 级国家标准测试的智能体手机。展区还呈现了与吉利、千里科技合作的汽车“超级智能体”超级Eva,搭载于量产车型极氪8X,支持一句话行泊车、控智驾及生活服务。
面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。
生数科技创始人朱军阐释了从视频生成到世界模型的演进路径。公司发布的实时交互模型Vidu S1支持无限时长连续生成与语音交互,世界动作模型Motubrain在RoboTwin 2.0的50余项复杂任务中平均成功率超过95%。
生数科技创始人朱军在WAIC 2026期间接受央视专访,阐述从视频生成到世界模型的统一技术路线。公司已发布实时交互模型Vidu S1、世界动作模型Motubrain,后者基于MoT统一架构,在RoboTwin 2.0的50余项复杂任务中平均成功率超95%。
面壁智能在 WAIC 2026 端侧AI论坛上发布两款端侧大模型:20亿参数的MiniCPM5-2B文本模型在AA榜单位列2B以下第一,以及融合多模态与视觉Token压缩的VLA具身模型。其MiniCPM开源系列累计下载量突破3800万次,已落地手机、汽车等终端,并搭载于吉利银河M9等车型。
面壁智能在 WAIC 2026 端侧AI论坛发布 MiniCPM5-2B 端侧文本大模型和 VLA 具身模型,前者在 AA 榜单位列 2B 以下模型第一。截至 2026 年 6 月 30 日,MiniCPM 开源系列累计下载量突破 3800 万次,已搭载于吉利银河 M9 等车型。公司还发布了法律解决方案 CPM for Legal,并与英特尔签署合作备忘录。
昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。
昆仑万维在WAIC论坛宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型与Mureka v9.5、O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p下可单卡20FPS实时生成,核心架构开源。Mureka v9.5指令精准度从6.92提升至7.62。
另有 1 家信源报道公众号:昆仑万维(天工)