# 智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单，综合得分 85.21

- 来源：IT之家（RSS）
- 发布时间：2026-07-28 19:08
- AIHOT 分数：62
- AIHOT 链接：https://aihot.virxact.com/items/cms4lz9k405oproepx7u0kbmg
- 原文链接：https://www.ithome.com/0/982/739.htm

## AI 摘要

智元自研的具身原生全模态大模型 WITA-Omni Preview 以 85.21 分综合成绩登顶 DailyOmni 榜单，在八项细分指标中的六项取得第一，超过千问、Gemini、豆包、英伟达等模型。该模型采用 Thinker–Talker–Actor 架构，将物理动作和表情提升为与语音并列的一级输出，并通过千万小时级多模态数据训练实现音视频联合理解与时序推理。

## 正文

IT之家 7 月 28 日消息，据智元 AGIBOT 微信公众号消息，近日，具身全模态理解权威榜单 DailyOmni 最新评测结果揭晓，智元自研的具身原生全模态大模型 WITA-Omni Preview，凭借领先的音视频联合理解与时序推理能力，以 85.21 分综合成绩登顶榜首，超过千问、Gemini、豆包、英伟达等国内外领先模型，并在八项细分指标中的六项取得第一。

据IT之家了解，DailyOmni 是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。不同于面向图文、短视频的常规评测任务，该榜单大量采用真实开放环境音视频素材，核心考验模型融合视觉画面、环境音频信息，精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力，高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。

官方称，WITA-Omni 领先的关键，在于它并不是简单地把聊天模型“装进”机器人，而是将物理动作和表情提升为与语音并列的一级输出，用一个原生端到端模型统一驱动感知、决策与表达，从 Thinker–Talker 范式上进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构。

WITA-Omni 的领先并非单纯依靠模型规模，而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段，WITA-Omni 使用总计千万小时级的开源和自有多模态数据，将强文本、视觉底座进一步升级为能够“听得见、看得懂，并进行音画联合推理”的全模态模型。

此外，公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息，难以直接训练端到端具身交互模型。为此，智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集，完整保留声音、画面、语言、动作和表情之间天然的时序关系。
