AI资讯 / 产业

产业 / 媒体

智元 WITA-Omni Preview 登顶 DailyOmni 榜单,具身全模态理解能力全球第一

IT之家

智元 AGIBOT 自研的具身原生全模态大模型 WITA-Omni Preview,在权威第三方评测榜单 DailyOmni 最新一轮测试中以 85.21 分的综合成绩登顶榜首,超越千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一名。DailyOmni 榜单专注于考察音视频时序对齐与跨模态联合推理能力,大量采用真实开放环境素材,高度贴合人形机器人在物理空间中开展人机交互所需的核心感知能力。WITA-Omni 的优势并非来自单纯堆砌模型规模,而是依托独创的 Thinker–Talker–Actor 架构与千万小时级多模态训练数据,将物理动作和表情纳入与语音并列的一级输出,实现感知、决策与表达的端到端统一驱动。

具身全模态理解权威榜单 DailyOmni 近日公布最新评测结果,智元 AGIBOT 自研的 WITA-Omni Preview 以 85.21 分综合成绩位居榜首。该模型在八项细分指标中的六项取得第一,全面超越千问、Gemini、豆包、英伟达等国内外主流大模型,成为目前在该榜单上表现最强的具身原生全模态大模型。

DailyOmni 是业界公认的检验音视频时序对齐与跨模态联合推理能力的权威第三方榜单。与面向图文或短视频的常规评测不同,该榜单大量采用真实开放环境中的音视频素材,核心考察模型融合视觉画面与环境音频、精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,与人形机器人在真实物理空间中开展人机交互所需的感知能力高度吻合。

WITA-Omni 的核心创新在于架构层面的突破。官方表示,该模型并非简单地将聊天模型嵌入机器人,而是将物理动作和表情提升为与语音并列的一级输出,通过原生端到端模型统一驱动感知、决策与表达。在传统 Thinker–Talker 范式基础上,WITA-Omni 进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构,从根本上改变了模型与物理世界的交互方式。

在训练数据层面,WITA-Omni 采用了分层数据体系与针对性训练方法。中训练阶段使用总计千万小时级的开源及自有多模态数据,将原有的强文本、视觉底座升级为能够听得见、看得懂并进行音画联合推理的全模态模型,使其具备在复杂真实场景中稳定运行的基础能力。

针对公开音视频数据普遍缺乏真实交互中轮次切换、响应时机、动作和表情信息的问题,智元专门构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集。该数据集完整保留了声音、画面、语言、动作和表情之间天然的时序关系,为端到端具身交互模型的训练提供了坚实的数据基础,也是 WITA-Omni 在 DailyOmni 榜单上实现领先的关键支撑之一。

要点

  • WITA-Omni Preview 在 DailyOmni 榜单以 85.21 分登顶,八项细分指标中六项全球第一,超越千问、Gemini、豆包、英伟达等主流模型
  • 模型采用原创 Thinker–Talker–Actor 架构,将物理动作和表情纳入一级输出,实现感知、决策与表达的端到端统一驱动
  • 训练数据达千万小时级多模态规模,并自建以人为中心的高质量全模态数据集,完整保留声画动作的时序关系
  • 领先优势来自架构创新与数据体系的协同,而非单纯依赖模型参数规模的堆砌
查看原始来源

原始标题:全球第一,智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。