![]()
智東西
作者 江宇
編輯 漠影
當一臺機器人站在多人交談的展廳里,它能不能從嘈雜聲中聽出誰在和自己說話,判斷一句話是否需要回應;能不能在對方停頓時接過話頭,被突然打斷后自然續上;還能不能一邊回答,一邊配合語氣做出恰當的手勢和表情?
這些看似尋常的交流細節,是具身智能的核心能力,也是機器人跨越自然交互門檻時最難補齊的一環。
長久以來,機器人行業困在一個尷尬的悖論里:單項能力不斷突破,把“看、聽、說、動”揉成一個連貫的、像人一樣的整體,始終差著一口氣。
這道鴻溝的本質,是交互能力跟不上——感知、推理、語音、動作各跑各的,始終沒有在同一個時間軸上協同起來。
近日,智元自研的全模態大模型WITA-Omni Preview給出了一份有分量的答卷。
在行業公認的具身全模態理解權威榜單DailyOmni上,它以85.21分的綜合成績登頂榜首,超越千問、Gemini、豆包、英偉達等國內外領先模型,八項細分指標中六項拿下第一。
![]()
在“看懂環境、聽懂聲音、邊聽邊想、邊說邊動”這條核心交互能力主線上,一家專注具身智能的企業,跑到了通用大模型廠商的前面。
此前,智元自研世界模型Genie Envisioner-Sim 2.0已在WorldArena“世界模型感知與動作響應”賽道拿下總分第一。此次WITA-Omni又在全模態理解榜單登頂,兩項成績分別對應機器人理解物理世界、模擬物理世界以及與物理世界交互的關鍵能力。
這也讓外界觀察到,智元在造機器人本體之外,正同步構建出“交互-作業-運動”三位一體的自研AI版圖。
一、一場“聲畫對位”的大考:DailyOmni憑什么檢驗真正的全模態能力
“能看圖+能聽聲”的簡單加法,不等于全模態。真正的難點在于,聲音和畫面同時涌來時,模型能否分清誰在說話、什么事先發生、該關注哪個細節。其核心是邊聽邊看邊想的同步協同能力。
DailyOmni的評測邏輯恰好對準了這個難點。
它大量采用真實開放環境音視頻,考察聲畫對應關系、事件時序判斷、跨模態聯合推理,檢驗模型能否“聽到聲音就知道畫面里誰在說話”“看到動作就知道事情發生的先后順序”,在連續的時間流里理解一段真實物理世界正在發生什么。
與僅靠單一畫面或語言先驗就能完成的圖文評測不同,DailyOmni中大量問題要求模型同時調動聲音和視覺信息,缺一不可。
WITA-Omni交出的成績單:綜合85.21分登頂,音視頻對齊86.13、事件時序84.64、綜合推理85.06,并在比較理解及30秒/60秒視頻理解等長時序任務上取得領先。八項指標中六項第一,在“聲畫對齊、時序判斷、跨模態推理”整條主線上建立了系統性的領先。
再看同臺競技的參照系。站在DailyOmni榜單上的,是千問、Gemini、豆包、英偉達等通用大模型廠商的商用或旗艦模型,智元是其中少有的“具身智能賽道選手”。
一家以機器人起家的公司,在全模態理解上跑贏了大模型大廠。分數的勝負之外,這份排名更指向技術路線的選擇:從機器人原生交互場景出發構建全模態能力,正在證明自身的競爭力。
WITA-Omni用排名第一證明,讓機器人“自然流暢地理解并回應世界”,智元已經走在了前面。對行業而言,這也是一次認知校準:過去市場看智元,更多看到的是機器人整機和量產能力;而這次登頂說明,智元的AI大模型能力,已進入與大廠同臺競技的第一梯隊。
二、Thinker–Talker–Actor:讓機器人邊想邊說邊動
傳統機器人交互像一條流水線:先識別語音、再理解語義、再生成回復、再合成語音、最后輸出動作。每一步都有延遲,每換一棒都有損耗,結果就是機器人“想完再說、說完再動”,做不到人那樣邊想邊表達的自然感。
這種級聯架構存在三重天然缺陷。
- 其一,多模塊串行調用導致響應延遲不斷累積,一段對話下來遲鈍感越來越明顯。
- 其二,信息跨模塊轉換產生語義損失,上一環的理解傳到下一環時已經打了折扣。
- 其三,語音、動作和表情獨立生成,無法保持節奏與情緒同步:嘴在笑、手卻沒跟上,或者話說完了、表情才姍姍來遲。
最終,機器人可能每個模塊都能工作,卻始終不像一個協調、完整的智能體。
WITA-Omni的原生架構從根上打破了這個串行范式。
它在Thinker–Talker范式上擴展出Actor模塊,將機器人動作和表情提升為與語音并列的一級輸出。
Thinker是多模態推理核心,把文本、圖像、音頻、音視頻經各自編碼器與輕量投影層映射到統一表示空間,做跨模態聯合推理和高層交互決策;Talker以Thinker的隱狀態為條件,流式生成自然語音;Actor由動作頭與表情頭組成,驅動動作與表情。
三個模塊在統一的時間軸上同步推進,替代了傳統“處理完一個再交給下一個”的串行模式。
跨流同步機制的設計進一步強化了這種同步性。Actor不僅接收Thinker的語義狀態,還以Talker的音頻隱變量為條件,使動作能夠感知語速、停頓、重音和情緒變化。
![]()
機器人的手勢和表情從語音生成的過程中實時響應:邊說邊動、邊動邊表達,語音、動作和表情在同一條時間線上,理解與回應同步完成。
WITA-Omni架構的核心突破在于“原生”二字,它把“理解”和“表達”從兩個步驟變成了同一個生成過程的不同維度。
通用大模型廠商的全模態模型,大多優先適配線上數字內容交互;而智元從機器人原生交互需求出發,重新定義了全模態模型的結構。這既是一個工程架構的創新,也體現了具身智能公司獨特視角帶來的差異化競爭力。
三、千萬小時中訓練+千小時高質量后訓練:具身數據的“煉鋼術”
基座模型的競爭正在跳出“誰的參數量大”這個維度,而具身智能的數據難題更難:公開音視頻數據沒有交互輪次、沒有響應時機、沒有動作和表情的時序標注。拿這些數據訓出來的模型,永遠學不會“什么時候該說話、什么時候該動”。
WITA-Omni的領先來自一套圍繞具身全模態交互構建的分層數據體系與針對性訓練方法。
在中訓練階段,WITA-Omni使用了千萬小時級多模態數據,將強文本、視覺底座升級為能夠“聽得見、看得懂,并進行音畫聯合推理”的全模態模型。
數據配比經過精心設計。音視頻聯合數據約占四成,重點訓練聲音、畫面與事件之間的對應關系;純音頻數據約占三成,用于強化語音、聲學事件和環境聲音理解;視覺與文本數據分別約占兩成和一成,用于保持原有視覺與語言能力。
這一階段聚焦三個問題——聲音來自哪個主體、對應哪個視覺事件,不同事件發生的先后順序與時間關系,以及必須同時結合聲音和畫面才能完成的跨模態推理。數據配置的邏輯始終圍繞具身交互的核心能力需求,而非單純堆量。
公開數據遠遠不夠。為此,智元自建了以人為中心、面向真實交互場景的大規模高質量全模態數據集,完整保留了聲音、畫面、語言、動作和表情之間天然的時序關系。
數據主要來自三類場景:
- 帶有同步語音、動作和面部表情的人-人及人-機交互視頻,并標注輪次切換與響應時機;
- 機器人在遙操作交互過程中由自身傳感器采集的第一人稱感知與動作數據;
- 通過半自動數據流水線,將原始視頻轉化為帶有說話人、動作、事件、時間區間、指令和問答標注的監督樣本。
這套數據讓模型直接從真實交互中學習“什么時候說、對誰說、如何配合動作”,跳過了多模塊人工規則拼接的環節。
在千小時級高質量數據上,WITA-Omni進一步采用SFT–OPD–RL三階段后訓練策略。
- SFT監督微調建立基礎的全模態理解、交互決策和多流生成能力。
- OPD同策略蒸餾讓同一個模型同時扮演“老師”和“學生”,老師模型在獲得額外時間區間、目標對象等特權信息后生成高質量答案,再將能力蒸餾回不依賴特權信息的學生模型,在保持模型自身表達風格的同時提升音視頻上下文中的推理能力。
- RL強化學習重點優化Thinker的交互決策能力,獎勵信號覆蓋可驗證答案、時間區間匹配、目標人物選擇、等待或回應決策,以及主動觸發準確率,并通過GRPO優化模型策略。
由此,模型不僅學會“回答正確”,還進一步學會在真實場景中判斷該不該回應、何時回應、回應誰。
圍繞具身交互這一核心場景,在數據采集和訓練策略兩個層面,智元構建了一套完整的體系化能力。最終,WITA-Omni將音視頻聯合理解、交互決策與同步表達融為一體,讓機器人不僅“看得懂、聽得懂”,更能回應得自然,這也是其在具身交互場景中的核心競爭力。
![]()
四、不僅要“想得準確”,更要“聊天像個人”
理解準確只是及格線,交互智能的更高標準藏細節處:你說話時它會不會亂插嘴、你停頓時它能不能安靜思考、你打斷時它能不能自然切回來。這些細節,決定了人和機器人能不能真正“聊得來”。
WITA-Omni在語音交互側同樣經受住了檢驗。
在國際權威第三方大模型評測Artificial Analysis的Speech Arena所采用的兩個公開基準上,智元做了同協議評測:衡量語音推理的Big Bench Audio,與衡量全雙工對話能力的Full Duplex Bench子集(覆蓋停頓處理、輪次切換、打斷處理、附和處理)。
![]()
▲衡量語音推理的Big Bench Audio
![]()
▲衡量全雙工對話能力的Full Duplex Bench子集
WITA-Omni Preview在這兩項上均取得第一,超越了GPT-Realtime等閉源商用模型。
全雙工對話,即同時聽和說、實時判斷語輪切換,是語音交互中難度極高的環節,WITA-Omni在這項能力上的領先,意味著它能在真實對話節奏中做出自然反應:該說時說、該停時停、被打斷能自然銜接、聽到附和不亂節奏。
很多模型在離線評測中能答對問題,一進入真實對話場景就暴露短板:該停的時候不停、該說的時候猶豫、被打斷后就斷片。WITA-Omni在動態對話指標上的領先,說明“交互節奏對”和“理解能力強”同等重要,甚至更難做到。
這種節奏感,是機器人進入家庭、工廠、服務場景時用戶直接感受到的體驗。用戶不會關心模型參數量,只會直接感受到“這個機器人說話像不像個人”。
WITA-Omni的能力覆蓋了“感知—推理—表達—交互”一整條鏈路。這種全鏈路能力,劃出了它與通用大模型“單模態強、交互弱”之間的關鍵分野。
通用大模型廠商的全模態模型,更多面向內容消費場景;而WITA-Omni從設計之初就以真實物理交互為目標,在交互節奏這個維度上建立了天然優勢。看懂聽懂決定下限,聊得順、動得自然決定上限,WITA-Omni在語音交互側的領先,補齊了具身智能在“自然表達”這個維度上的關鍵一環。
結語:三智一體,領跑行業
長久以來,智元一直圍繞作業智能、交互智能、運動智能“三智一體”打造差異化競爭力。
在智元的“一體三智”架構中,運動智能是基礎智能,是物理載體的執行器;作業智能提供勞動生產力,讓機器人自主干活;交互智能提供服務生產力,讓機器人自然交流。
此前,智元已在WorldArena具身智能綜合評測中拿下總分第一,作業智能的GO系列基礎模型、運動智能的運控基座模型均已建立行業領先優勢。交互智能的全球登頂,讓行業看到了智元三智一體的完整能力版圖。
三智齊備的意義,在2026年尤為清晰。今年,具身智能行業迎來開發態向部署態的關鍵跨越——機器人走進產線、門店和家庭,創造真實生產力。部署態的核心門檻,是三個智能的協同:運動智能決定能否走進場景,作業智能決定能否完成勞動,交互智能決定能否給人提供情緒價值,產生服務生產力。智元在行業率先推出的七大生產力解決方案中,三智一體的完整能力棧是其底層支撐。
當機器人逐漸進入工廠、商業服務和公共空間,衡量智能水平的標準,將超越單項指標,走向整體協同。WITA-Omni此次登頂,讓機器人距離真實世界的自然交互更近了一步,也讓智元“既有本體、更有AI”的定位落地為可驗證的能力閉環。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.