全球第一,智元 WITA-Omni Preview登顶 DailyOmni 全模态理解榜单

发布时间:2026/7/30 6:38:26
全球第一,智元 WITA-Omni Preview登顶 DailyOmni 全模态理解榜单 全球第一智元 WITA-Omni Preview登顶 DailyOmni 全模态理解榜单近日具身全模态理解权威榜单 DailyOmni 最新评测结果揭晓智元自研的具身原生全模态大模型 WITA-Omni Preview凭借领先的音视频联合理解与时序推理能力以 85.21分综合成绩登顶榜首超过千问、Gemini、豆包、英伟达等国内外领先模型并在八项细分指标中的六项取得第一。DailyOmni是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。不同于面向图文、短视频的常规评测任务该榜单大量采用真实开放环境音视频素材核心考验模型融合视觉画面、环境音频信息精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。何以自然WITA-Omni独创三层架构让互动浑然一体对于人形机器人交互能力来说以往的全模态模型大多优先适配线上数字内容交互而机器人身处持续变化的物理空间不仅需要同步“看见画面、听见声音”更要实时判断声音归属主体、事件发生顺序识别交互对象、找准响应时机传统模块化机器人方案很难完成这类时序耦合的复杂推理任务也是长久以来人机交互生硬割裂的关键瓶颈。对具身智能机器人而言“理解”和“回应”并不是两个割裂的步骤而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中它还必须进一步判断是否应该回应、什么时候回应以及正在与谁交互。WITA-Omni 领先的关键在于它并不是简单地把聊天模型“装进”机器人而是将物理动作和表情提升为与语音并列的一级输出用一个原生端到端模型统一驱动感知、决策与表达从Thinker–Talker 范式上进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构。Thinker思考 是多模态推理核心把文本、图像、音频、音视频经各自编码器与轻量投影层映射到统一表示空间做跨模态联合推理和高层交互决策Talker说 以 Thinker 的隐状态为条件流式生成自然语音Actor动 由动作头与表情头组成把机器人动作与表情生成为与语音并列的一级输出——这是 WITA-Omni 面向具身场景的关键扩展。何以领先大规模数据训练叠加针对性训练策略WITA-Omni 的领先并非单纯依靠模型规模而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段WITA-Omni 使用千万小时级多模态数据将强文本、视觉底座进一步升级为能够“听得见、看得懂并进行音画联合推理”的全模态模型。此外公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息难以直接训练端到端具身交互模型。为此智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集完整保留声音、画面、语言、动作和表情之间天然的时序关系。在千小时级高质量数据上WITA-Omni 进一步采用 SFT–OPD–RL 三阶段训练策略SFT监督微调用于建立基础的全模态理解、交互决策和多流生成能力。OPD同策略蒸馏让同一个模型同时扮演“老师”和“学生”。老师模型在获得额外时间区间、目标对象等特权信息后生成高质量答案再将能力蒸馏回不依赖特权信息的学生模型在保持模型自身表达风格的同时提升音视频上下文中的推理能力。RL强化学习重点优化 Thinker 的交互决策能力。奖励信号覆盖可验证答案、时间区间匹配、目标人物选择、等待或回应决策以及主动触发准确率并通过 GRPO 优化模型策略。由此模型不仅学会“回答正确”还进一步学会在真实场景中判断该不该回应、何时回应以及回应谁。何以致远三智一体不断演进开启具身智能新未来本次智元作为专注通用具身智能赛道的企业在 DailyOmni 中超越多款主流Omni模型取得榜首位置证明了WITA-Omni在物理世界视听时序理解任务上具备的独特竞争力。作为具身智能行业内首个机器人原生端到端多模态交互大模型WITA-Omni的意义不只是让一个模型支持更多模态而是让机器人在统一认知状态和统一时间轴上完成感知、决策与表达。它将具身交互从多个模块依次调用的工程流水线推进为一个能够持续感知、统一判断并同步表达的生成过程看与听不再割裂语言与动作不再分离理解与回应不再是两个独立步骤让“看、听、说、动”成为一个连续过程打通了视觉、听觉、语言、表情、肢体动作全模态协同让机器人不再只是 “会说话的工具”进化为拥有在场感、人格感的硅基伙伴。这项能力也是具身智能落地现实场景创造生产力的关键所在。依托 WITA-Omni 构筑的交互智能底座智元将进一步夯实“三智一体”技术架构与作业智能、运动智能协同联动持续驱动 “本体数据模型场景” 四维一体飞轮运转解锁更多商业场景、公共服务、影视展演等广阔场景。面向未来智元将持续迭代 WITA硅光动语大模型不断拉近具身智能与人类沟通的距离加速具身智能新生产力时代的到来