央广网上海7月30日消息(记者何智康 实习记者吴嘉源)近日,具身全模态理解榜单 DailyOmni 公布了最新评测结果,一款中国自研的具身原生全模态大模型 WITA-Omni Preview 以85.21分的综合成绩登顶榜首,超过国内外多款领先模型,并在八项细分指标中的六项取得第一。

DailyOmni公布的最新评测结果(央广网发)

让机器人交互更自然,让“看、听、说、动”浑然一体

据智元相关工作人员介绍,以往人形机器人进行交互时,全模态模型大多优先适配线上数字内容交互,而机器人身处持续变化的物理空间,不仅需要同步“看见画面、听见声音”,更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机,传统模块化机器人方案很难完成这类时序耦合的复杂推理任务,这也是长久以来人机交互生硬割裂的关键瓶颈。

WITA-Omni 作为具身智能行业内首个机器人原生端到端多模态交互大模型,它并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。“理解”和“回应”将不再是两个割裂的步骤,而是一个持续发生的物理过程。

看与听不再割裂,语言与动作不再分离,理解与回应不再是两个独立步骤,“看、听、说、动”成为一个连续过程,打通了视觉、听觉、语言、表情、肢体动作全模态协同,机器人不再只是 “会说话的工具”,而逐渐进化为拥有在场感、人格感的硅基伙伴。

大规模数据训练、针对性训练策略,造就全球领先地位

据了解,WITA-Omni 的领先并非单纯依靠模型规模,而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。

此外,由于公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。

在千小时级高质量数据上,WITA-Omni 进一步采用 SFT–OPD–RL 三阶段训练策略,让模型不仅学会“回答正确”,还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。

这项能力,正是具身智能落地现实场景,创造生产力的关键所在。

编辑:林馥榆
更多精彩资讯请在应用市场下载“央广网”客户端。欢迎提供新闻线索,24小时报料热线400-800-0088;消费者也可通过央广网“啄木鸟消费者投诉平台”线上投诉。版权声明:本文章版权归属央广网所有,未经授权不得转载。转载请联系:cnrbanquan@cnr.cn,不尊重原创的行为我们将追究责任。
长按二维码
关注精彩内容