DailyOmni 评测结果出炉:智元WITA-Omni Preview 位列榜首
近日,具身全模态理解评测榜单 DailyOmni 最新结果公布:智元自研具身原生全模态大模型 WITA-Omni Preview 综合得分 85.21,排名第一,性能领先千问、Gemini、豆包、英伟达等多款主流模型,在八项细分指标里拿下六项第一。

DailyOmni 是业内用于衡量模型音视频时序对齐、跨模态联合推理水平的第三方评测基准。和常见图文、短视频评测不同,榜单数据集以真实开放场景音视频为主,重点测试模型结合图像与环境音频,识别声画匹配关系、事件时序、跨模态语义的能力,与人形机器人在现实环境交互所需的感知能力高度匹配。

WITA-Omni独创三层架构
现有人形机器人交互存在明显短板:多数全模态模型面向线上数字场景优化,难以适配动态物理空间。机器人在现实环境中需要同步视觉、听觉输入,实时区分声源主体、理清事件时序、锁定交互对象并把握响应时机。传统模块化架构难以实现这种时序耦合的复杂推理,这也是人形机器人人机交互体验生硬的核心症结。
对具身机器人来说,“理解”和“回应”并不是两个割裂的步骤,属于连续同步的物理过程:机器人并行完成环境观测、声音接收、语言生成、肢体与表情输出。在多人开放动态场景下,还需要自主决策是否应答、何时应答、交互对象是谁。
WITA-Omni 领先的关键,在于它并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker–Talker 范式上进一步扩展出面向具身输出的Thinker–Talker–Actor 架构。
-
Thinker(思考)是多模态推理核心,把文本、图像、音频、音视频经各自编码器与轻量投影层映射到统一表示空间,做跨模态联合推理和高层交互决策;
-
Talker(说) 以 Thinker 的隐状态为条件,流式生成自然语音;
-
Actor(动) 由动作头与表情头组成,把机器人动作与表情生成为与语音并列的一级输出——这是 WITA-Omni 面向具身场景的关键扩展。

大规模数据训练,叠加针对性训练策略
WITA-Omni 的领先并非单纯依靠模型规模,而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。
在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。
此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。
在千小时级高质量数据上,WITA-Omni 进一步采用SFT–OPD–RL 三阶段训练策略:
-
SFT监督微调用于建立基础的全模态理解、交互决策和多流生成能力。
-
OPD同策略蒸馏让同一个模型同时扮演“老师”和“学生”。老师模型在获得额外时间区间、目标对象等特权信息后生成高质量答案,再将能力蒸馏回不依赖特权信息的学生模型,在保持模型自身表达风格的同时,提升音视频上下文中的推理能力。
-
RL强化学习重点优化 Thinker 的交互决策能力。奖励信号覆盖可验证答案、时间区间匹配、目标人物选择、等待或回应决策,以及主动触发准确率,并通过 GRPO 优化模型策略。
由此,模型不仅学会“回答正确”,还进一步学会在真实场景中判断:该不该回应、何时回应,以及回应谁。
结语
作为业内面向机器人原生打造的端到端多模态交互大模型,WITA-Omni 的价值,不局限于拓展模型支持的模态类型,而是让机器人在统一认知表征、同一时间轴内完成感知、决策与表达。
传统方案将具身交互拆分为多个模块串行调度,而该模型构建持续感知、统一推理、同步输出的生成链路,实现视觉、听觉不再割裂,语言与动作同步协同,感知理解和响应输出不再相互分离。
“看、听、说、动” 形成连贯流程,打通视觉、听觉、语言、表情、肢体动作的全模态协同,推动机器人从单一语音工具,演进为具备连续在场交互能力的智能载体,这也是具身智能落地现实场景、释放实用价值的关键能力。
依托 WITA-Omni 搭建的交互智能底座,智元将持续完善 “三智一体” 技术架构,实现交互智能与作业智能、运动智能协同配合,推动 “本体-数据-模型-场景” 四维闭环持续迭代,拓展商业服务、公共服务、展演等各类落地场景。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)