近日,智元的具身全模态大模型 WITA-Omni Preview,在 DailyOmni 榜单拿了第一,综合成绩 85.21,八项里六项第一。
DailyOmni 这个榜单专门考音视频时序对齐和跨模态联合推理。简单说,它考的是模型能不能同时看懂画面、听清声音,再判断声音从哪来、事件谁先谁后、该不该回应、回应谁——这比「看图说话」难一个量级。这些能力对人形机器人在开放空间里跟人交互很关键。
智元这次的核心变化,是把模型的输出从「说话」扩展到了「说话 + 动作 + 表情」。它管这套架构叫 Thinker–Talker–Actor。Thinker 做跨模态推理,Talker 生成语音,Actor 负责动作和表情。三个输出被放在同一层,不是先想再说话、说话完再补动作。
按智元自己的定位,这是业内首个机器人原生的端到端多模态交互大模型。训练上用了千万小时多模态数据,加上千小时级的高质量交互数据,走 SFT–OPD–RL 三个阶段。
榜单第一当然说明在测试集上表现好。但更值得看的是方向:之前的机器人交互大多是把一个聊天模型塞进机器人里,语言理解和身体动作是两套系统。WITA-Omni 想把「看、听、说、动」压进同一个模型、同一个时间轴里。
这能不能在真实场景里跑顺,现在还不知道。榜单是榜单,真机是另一回事。响应延迟、动作安全性、长时间运行的稳定性,这些 DailyOmni 都还测不了。
智元机器人多模态大模型智元模型登顶全模态理解榜单


