国际具身全模态理解权威榜单DailyOmni近日更新评测结果。智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分的综合成绩强势登顶。这一高分不仅超越了Gemini 3.1 Pro Preview、Qwen3.5-Omni-Plus、Doubao Seed 2.0 Lite以及英伟达等国内外主流模型,更在八项细分指标中斩获六项第一。
DailyOmni究竟考什么?
要读懂85.21分背后的含金量,先得看清它的考核逻辑。业内常把这份榜单视为具身智能感知能力的“试金石”,原因在于它模拟的是真实物理空间的复杂性:人形机器人走进商场、展馆或地铁站,面对的是动态开放的环境。在这种场景下,机器人需同时处理视觉观察与声音接收,并在组织语言的同时配合肢体动作和面部表情——它还得具备判断力:该不该回应、何时回应、正在跟谁互动。
相比之下,常规AI大模型榜单多聚焦图文问答,偏向线上内容消费。而DailyOmni大量采用开放环境的真实音视频素材,核心考察三项能力:能否将画面人物与其发声对应起来;能否理清事件的时间先后;能否结合视听信息完成跨模态推理。
据论文披露,DailyOmni测试集涵盖数百段日常场景短视频及上千道选择题,任务横跨音视频对齐、上下文理解、事件序列、因果推理、跨模态一致性等六大维度。
从当前公开数据来看,闭源模型中Gemini 2.5 Flash得分为73.06%,开源模型Qwen3.5-Omni-Plus为84.68%。WITA-Omni以85.21%的成绩不仅实现了超越,更在细分领域拿下六项冠军。
告别“流水线拼接”,三层架构重构交互
长期以来,人形机器人的交互系统多采用模块化串联方案:视觉模块、音频模块、对话大模型、运动控制模块依次执行,形成一条串行流水线。
这种模式下,机器人遵循“先看画面→转译音频→生成回答→输出动作表情”的流程。步骤割裂导致延迟明显,常出现语音已说完,抬手转头才迟缓启动的情况。在多人场景中,甚至难以锁定交互对象,先天短板限制了其适应真实环境的能力。
智元WITA-Omni的独特之处在于,跳出了“通用大模型外挂机器人动作模块”的传统路径,推出行业首个面向具身场景的Thinker–Talker–Actor三层原生端到端架构。该架构将肢体动作与面部表情提升至与语音、文本同等的一级输出层级,所有模态共享统一认知表征与时间轴,实现感知、思考、表达的同步并行。
简言之,它并非简单地把聊天模型“装进”机器人,而是让物理动作和表情成为独立的一级输出。三层架构分工明确:
• Thinker(思考):作为多模态推理核心,将文本、图像、音频及音视频映射至统一表示空间,执行跨模态联合推理与高层交互决策;
• Talker(说):基于Thinker的隐状态,流式生成自然语音;
• Actor(动):由动作头与表情头构成,生成与语音并列的一级输出。
在此架构支持下,机器人能实现“边观察、边思考、边说话、边做动作”,模拟人类实时同步的沟通状态,有效解决市面上多数人形机器人交互僵硬、机械感强的问题。
具身智能落地的关键一跃
业界观察者指出,智元在DailyOmni榜单上的突破,揭示了具身智能行业的下一个竞争焦点:交互智能。
过去几年,行业重心主要集中在运动能力(如跑速、跳跃高度)和作业能力(如负载、精度)。但当机器人真正进入商业服务、公共服务等高频率人机互动场景时,能否进行自然、流畅且符合社交礼仪的交互,成为决定其市场接受度的关键。
对整个具身智能产业而言,WITA-Omni的价值远超单一榜单成绩。它打通了机器人“看、听、说、动、表情”的全模态协同链路,将传统的分模块流水线交互,升级为统一认知、同步输出的连续生成过程。这使得机器人从单纯执行指令的机械工具,转变为具备在场感与自主交互意识的硅基协作伙伴,为人形机器人落地商用场景、创造增量生产力奠定了核心基础。
可以预见,随着交互能力的持续进化,人形机器人将不再只是执行指令的冰冷机器,而是能理解人类意图、提供情绪价值的智能伙伴。这或许正是具身智能真正融入人类社会的“临门一脚”。
目前,通用大模型厂商正加速补齐具身短板。千问、Gemini、豆包持续迭代视频音频时序推理能力,英伟达则依托硬件生态布局机器人全栈方案。未来赛道竞争将是“通用大模型横向拓展”与“机器人原生模型纵向深耕”的双线对抗。榜单跑分仅是阶段性标尺,真实场景的规模化落地才是最终检验标准。
采写:南都·湾财社记者 胡雯雯
