在一个展厅之中, 存在着多人正在交谈的场景, 此时有一台机器人站立其中, 它究竟可不可以从那诸多嘈杂声音里, 分辨出究竟是谁正在与自身进行对话, 进而判断出某一句话是不是需要给予回应? 它能够在对方讲话出现停顿之际, 顺利接过话头吗? 当被人家突然打断话语之后, 能否自然接续下去? 并且, 它又是否能够在回答的时段, 同时配合适宜的语气, 做出恰当合适的手势以及表情?
这些似乎平常的交流方面的细节, 是具身智能所具备的重要核心能力, 同时, 它还是机器人在跨越走进自然交互的门槛之际, 最难去补足齐全达到完善的关键一环。
很长时间以来, 机器人领域一直被困在状况尴尬的一个矛盾情况当中, 在单独一项能力方面实现接连突破, 将原本的“看、听、说、动”这些能力整合成为逻辑连贯的、类似人类的一个完整整体组合起来之后, 始终都存在一些尚未能达到或者满足要求的微小差距。
这道鸿沟存在着本质, 那便是交互能力较为滞后, 具体表现为, 感知层面自顾自运行, 推理方面各自独立操作, 语音领域各自行事, 动作部分各自为政, 一直未在同一时间轴里协同起来。
近日, 智元自己研究制造的全模态大模型WITA - Omni, 给出了一份有着一定重要程度、具备相应影响力的答卷。
于行业所公认的具身全模态理解权威榜单之上, 它凭借85.21分的综合成绩登上榜首位置, 此成绩超越了千问、豆包、英伟达等国内外处于领先地位的模型, 在八项细分指标里有六项取得了第一名。

在一条核心交互能力主线上, 这条主线是“看懂环境、听懂声音、边听边想、边说边动”, 有一家企业, 它专注具身智能, 跑到了通用大模型厂商的前面。
在此之前, 智元自主研发的世界模型Genie -Sim 2.0, 在“世界模型感知与动作响应”这个赛道, 取得了总分第一名的成绩, 这是其一。此次, Writa -Omni在全模态理解的榜单上拿到了登顶的名次, 这是其二。这两项成绩, 分别对应着的是, 机器人对于物理世界的理解能力, 模拟物理世界的能力, 以及机器人与物理世界进行交互的关键能力, 这是其三。
这也使得外界察觉到, 智元在制造机器人本体的情形以外, 正在同步构建起具有“交互 - 作业 - 运动”这三个方面的自研AI版图。
一、一场“声画对位”的大考:凭什么检验真正的全模态能力
只是那种“能够看图”加上“能够听声”这般简单的加法, 实则并不等同于全模态。而真正的难点所在之处在于, 当声音与画面一同涌过来的时候, 模型是不是能够分辨清楚究竟是谁在说话, 何事是先发生的, 应该去关注哪一个细节。它的核心要点算是这种一边听着, 一边看着, 一边思考的同步协同能力。
的评测逻辑恰好对准了这个难点。
它大量运用真实开放环境中的音视频, 去考察声画对应方面的关系, 进行事件时序的判断, 开展跨模态联合推理, 以此检验模型会不会“听到声音便知晓画面里是谁在讲话”, “看到动作就能明白事情发生的先后次序”, 在连续的时间流当中理解一段真实物理世界当下正在发生着什么。
和那种仅仅依靠单一的画面, 或者凭借语言先验就能够完成的图文评测不一样, 有大量的问题, 需要模型同时去调动声音信息, 还有视觉信息, 这两者缺一不可。
WITA - Omni所交出的成绩单是, 综合分数为85.21分从而实现登顶, 其中音视频对齐分数是86.13, 事件时序分数是84.64, 综合推理分数是85.06, 并且在比较理解以及30秒/60秒视频理解等长时序任务方面取得了领先地位。在八项指标里有六项获得第一, 在“声画对齐、时序判断、跨模态推理”这一整条主线上构建起了系统性的领先。
再瞧瞧同台竞技时所依据的参照标准体系, 处于榜单之上的情形, 先是有着千问, 然而又有豆包, 随后亦有英伟达等属于通用大模型厂商涉及商用领域或旗舰级别的模型, 智元就正好是当中那种极其寥落的身为“具身智能赛道选手”的存在事项。
一家凭借机器人起步的公司, 于全模态理解方面战胜了大模型领域的大厂。除了分数有输赢之分, 这份排名更表明技术路线的抉择: 从机器人原生交互的场景着手构造全模态的能力, 正展现出自身的竞争力。
WITA - Omni凭借排名第一作出证明, 使得机器人能够“自然流畅地理解并回应世界”了, 智元已然处于前列, 对于行业来讲, 这同样是一次认知校准, 以往市场看待智元,更多看到的是机器人整机和量产能力, 然而此次登顶表明, 智元的AI大模型能力, 已经步入与大厂同台竞技的第一梯队了。
二、––Actor:让机器人边想边说边动
传统机器人交互如同一条流水线, 先是进行语音识别, 然后理解语义, 接着产生回复, 还要合成语音, 最终输入动作。每一个步骤都存在延迟, 每一次交接都有损耗, 最后导致机器人呈现出“想完表述、表述完才有动作”的情况, 无法达成人那般边思考边表意的自然感觉。
这种级联架构存在三重天然缺陷。
最终, 机器人或许每个模块都能够开展工作, 然而却始终不会像一个具备协调性、完整性的智能体样子。
WITA-Omni的原生架构从根上打破了这个串行范式。
它于–范式那儿扩展出Actor模块, 把机器人动作予以提升, 使其成为与语音并列的一级输出, 还把机器人表情也提升为与语音并列的一级输出。
作为多模态推理的核心部分, 它会将文本、图像、音频以及音视频, 通过各自的编码器以及轻量投影层, 映射到统一的表示空间, 进而进行跨模态联合推理以及高层交互决策, 可依据隐状态当作条件, 以流式方式生成自然语音, 其中, 它的Actor是由动作头与表情头共同组成, 用于驱动动作以及表情。
统一时间轴, 同步推进三个模块, 取代传统“处理完一个才交给下一个”这般的串行模式。
流同步机制被设计出来, 这一设计把那种同步性给进一步强化了。Actor所具备的情况是, 不但那里有接收的语义状态情况, 而且还存在着以音频隐变量作为条件的事实, 在这样的条件下, 动作就能够对语速、停顿、重音和情绪变化有所感知了。

语音生出的过程里, 机器人的手势与表情实时响应, 边说话边动作, 边动作边表达, 语音、动作以及表情处于同一条时间线上。这种情况下, 理解跟回应同步达成了。
WITA - Omni架构的关键核心突破之处在于“原生”这两个字, 它将“理解”这一行为, 以及“表达”这一行为, 从原本的两个步骤, 转变成为了同一个生成过程里的不同维度。
通用大模型厂商所拥有的全模态模型, 多数情况下都是优先去适配那线上数字内容交互的。然而, 智元却是从机器人原生交互需求这个角度出发的, 进而重新设定了全模态模型的结构。这既是一个工程架构方面的创新, 同时也展现了具身智能公司因着独特视角而滋生出来的差异化竞争力。
三、千万个小时当中施以训练, 在经过千小时高质量状态之后再予以训练, 这便是具身数据的“炼钢术”。
基座模型的竞争, 正从“谁的参数量大”这个维度跳出, 然而具身智能的数据难题更为棘手, 公开音视频数据, 毫无交互轮次可言, 也没有响应时机, 更不存在动作和表情的时序标注, 凭借这类数据训练而出的模型, 压根学不会“何时该说话、何时该动作”。
WITA - Omni的领先, 源于一套分层数据体系, 此体系围绕具身全模态交互构建, 还源于针对性训练方法。
在中训练阶段, WITA—Omni运用了千万小时级别的多模态数据, 把强文本、视觉底座予以升级, 使之成为能够“听得见”的全模态模型, 成为能够“看得懂”的全模态模型, 成为能够“进行音画联合推理”的全模态模型。
数据配比是经过精心设计而成的, 其中音视频联合数据大约占到了四成的比例, 用以着重训练声音、画面之间, 以及画面与事件之间的对应关系有, 同时纯音频数据大体占到约三千成比例, 其目的在于强化针对语音与声学事件, 还有环境声音的理解, 另外则是视觉与文本数据, 它们分别大概占到两成以及一成的比例, 是用的让原有能力, 也就是视觉与语言能力得以保持。
这一阶段着重关注三个方面的问题, 其一为声音究竟源自哪一主体并且对应哪一视觉事件, 其二是不同事件发生的先后秩序以及时间关联, 其三则是那种必定要把声音与画面同时结合起来才能够达成的跨模态推理。数据配置的逻辑自始至终都是紧扣具身交互的核心能力需求, 而并非只是单纯地堆积数量。
公开的数据是远远不足够的。鉴于此, 智元自行构建了大规模高质量全模态数据集, 该数据集是以人作为核心, 它面向真实的交互场景, 并且完整地留存了声音、画面、语言、动作以及表情之间天然存在的时序关系。
数据主要来自三类场景:
这种数据使得模型能够直接在真实交互当中加以学习, 学习的内容包含“什么时候进行表达、针对谁去表达、怎样与动作相配合”, 并且越过了多模块人工规则拼接的这一环节。
WITA - Omni在千小时级别的高质量数据之上, 采用了SFT–OPD–RL三阶段的后训练策略, 而且是进一步采用这种策略。
因此, 模型不只是学会了处于正确回答的状态, 还更进一步学会了于真实场景里辨别应不应该做出回应, 在什么时候做出回应, 以及回应哪一个对象。
在具身交互这个关键核心场景周围, 于数据采集及训练策略这两个层面上, 智元打造出了一整套完备的形成体系样式的能力。最终, WITA - Omni把音视频联合着去理解、做出交互决策以及同步进行表达融合在了一起, 使得机器人不但“能够看得明白、听得清楚”, 而且回应得十分自然, 这同样是它在具身交互场景里的能够起到关键作用具备竞争优势的因素。

四、不仅要“想得准确”,更要“聊天像个人”
只需明确理解准确, 这不过是及格的底线, 而交互智能存在更高的标准, 它隐匿于细节之处: 当你言语表达之时, 它会不会毫无章法地随意进行插嘴, 当你出现停顿之际, 它能不能做到安静地深入思考, 当你实施打断之时, 它能不能顺利且自然地随之切转回来。单单是诸如此类的细节, 便已然决定了人类与机器人之间究竟能不能真正实现如同顺畅交流般的“聊得来”。
WITA-Omni在语音交互侧同样经受住了检验。
在国际权威第三方大模型评测的Arena所采用的两个公开基准之上, 智元展开了同协议评测, 其包括衡量语音推理的Big Bench Audio, 以及衡量全双工对话能力的Full Bench子集, Full Bench子集覆盖停顿处理、轮次切换、打断处理、附和处理。

衡量语音推理的Big Bench Audio

衡量全双工对话能力的Full Bench子集
WITA - Omni, 在这两项之上, 都获取到了第一, 把GPT - 等闭源商用模型给超越了。
存在这样一种全双工对话, 其意味着同时进行听与说的行为, 并且要实时去判断语轮的切换, 语音交互里存在特别难的环节, 就是全双工对话, WITA - Omni在能力的这种领先状况下 , 表明它能够在真实的对话节奏里做出自然反应, 在该说的时候进行的说的举动, 在该停的时候做出停的行为, 被他人给打断的时候能够自然地衔接回复, 听到他人附和的时候不会打乱自身节奏。
好多模型于离线评测期间能够答对问题, 然而一旦步入真实对话场景便会暴露出短板, 具体表现为该停下的时候却不停, 该说话的时候显得犹豫, 被打断之后就陷入断片状态, WITA - Omni在动态对话指标方面处于领先地位, 这表明“交互节奏对”以及“理解能力强”同样重要, 甚至更难以达成。
这样的节奏感, 乃是机器人步入家庭, 进入工厂, 涉入服务场景之际, 使得用户切实领会把握得到的那种体会感受。用户并不会去在意模型的参数量到底有多少情况, 仅仅会不假思索直观地就领会感受到"这个机器人说话到底像不像人那样有特定表现"
WITA - Omni的能力, 覆盖了“感知”, 覆盖了“推理”, 覆盖了“表达”, 覆盖了“交互”这一整条链路。这种全链路能力, 划出了它与通用大模型之间“单模态强、不同交互弱、有很大差异”的关键分野。
有着全模态模型的通用大模型厂商, 更多是面向内容消费场景的;然而从设计开始就以真实物理交互当作目标的WITA- Omni, 在交互节奏此项维度上设立起了天然优势。看懂并且听懂决定下限, 聊得顺畅、动得自然决定上限的, WITA- Omni在语音交互一侧的领先, 补足了具身智能在“自然表达”这个维度里的关键一环。
结语:三智一体,领跑行业
很长时间以来, 智元始终围绕作业智能, 以及交互智能, 还有运动智能, 以“三智一体”的模式来打造差异化竞争力。
于智元的“一体三智”架构那儿, 运动智能属基础智能, 此乃物理载体的执行器呢, 作业智能能提供劳动生产力, 可使机器人自行干活 , 交互智能会提供服务生产力, 能让机器人自然交流。
在这之前, 智元于具身智能综合评测里取得了总分第一名, 作业智能的GO系列基础模型, 运动智能的运控基座模型, 分别建立了在行业内的领先优势, 交互智能在全球实现登顶后, 让行业得以看到智元三智一体的完整能力版图。
三智完备所具备的意义, 于2026年的时候显得格外清晰, 今年, 具身智能这一行业迎来了从开发状态朝着部署状态的关键跨越, 也就是机器人进入到产线。门店以及家庭之中, 进而创造出实实在在的生产力, 部署状态的核心门槛, 乃是三种智能的协同, 运动智能决定了是否能够走进相应场景, 作业智能决定在走进场景之后是否能够完成劳动, 交互智能决定在作业过程中能否给人们提供情绪方面的价值, 以此产生服务生产力, 智元在该行业率先推行的七大生产力解决方案以内, 由三智结为一体所形成的完整能力栈是其底层的支撑。
机器人渐渐进入工厂, 进入商业服务, 进入公共空间, 此时衡量智能水平的标准, 不再局限于单项指标, 而是朝着整体协同发展。WITA - Omni此次取得登顶成果, 使得机器人与真实世界的自然交互又靠近了一点, 更是让智元“带有本体, 也融入AI”的设定落实成为能够验证的能力闭环。
把Codex接入Claude Code!OpenAI开源专属
开发者使用Coding Agent时,虽然更换模型,但组织上...(181 )人阅读时间:2026-07-30
新智元火到硅谷了?VC大佬走访中国实验室,爆料长文连夜刷屏
新智元因一篇报道在硅谷引起轰动,被一位风投大佬盛赞。文章指出...(66 )人阅读时间:2026-07-30
这家Agent创企融了2亿!前微软员工创业,ARR涨超5倍
以色列AI初创公司Encore AI完成3000万美元A轮融...(77 )人阅读时间:2026-07-30
北京手术机器人龙头,买了一家骨科植入物公司
天智航医疗公告将于7月30日复牌,并发布《发行股份购买资产并...(179 )人阅读时间:2026-07-30