文 | 智能相對論
作者 | 葉遠風
世界模型早已走出實驗室,成為各家公司發布會上的高頻詞,不管是機器人公司,還是與具身智能相關的上下游機構,都開始頻繁談論世界模型。
熱鬧之下,很少有人回答幾個最核心的問題——世界模型對于機器人的核心價值到底是什么?拼接式方案和原生架構的差距,到底是體驗好壞還是代際差別?規模化落地的拐點,究竟要等到技術完全成熟還是可以提前進場?
![]()
近日,大曉機器人發布開悟世界模型技術報告,并披露其在多個具身智能基準測試中的奪冠表現。相比單純討論模型成績,更值得追問的是:這些成績背后,大曉到底選擇了一條怎樣的世界模型路線?
帶著這些問題,“智能相對論”專訪了大曉機器人開悟世界模型研發負責人王飛。在他的判斷里,世界模型遠不止演示層面的技術炫技,其本質定位更偏向支撐能力持續迭代的進化型基礎設施。整條賽道的競爭,已經從單點功能的比拼,轉向進化閉環的體系化較量。
![]()
大曉機器人開悟世界模型研發負責人王飛
能力邊界,是“原生”的技術分水嶺
過去一年,“原生”成了世界模型領域最泛濫的詞匯,幾乎所有廠商都在強調自身架構的原生屬性,很多方案本質只是視頻生成模塊加控制模塊的簡單拼接,換個包裝就敢冠以原生之名。
王飛對此的判斷邏輯,錨定在最終可實現的能力邊界上。
他提到行業內常用的拼接式方案,大多是先搭建視頻生成模塊,再外掛一套控制模塊,兩道工序像流水線一樣機械耦合,模塊之間的信息傳遞存在顯著損耗,就像傳統汽車生產里的沖壓焊接涂裝總裝流水線,每一道工序都要獨立完成再轉交下一環,中間的信息折損無法避免。
大曉開悟世界模型的原生一體化架構,形象地說,更接近“一體化壓鑄”的思路,將理解、生成、預測三類任務的目標,放在統一架構內做全局最優求解,底層表達保持一致,共享同一套世界狀態表征,模塊間的信息流動損耗可以降到最低。
在王飛看來,真正的原生世界模型,最終要指向物理AI+的能力水平。為了說明這種差異,他將世界模型能力從低到高拆成了五個層級。
第一層對應世界生成,負責構建視頻或文本形式的世界表象。
第二層對應物理認知,可將力、摩擦力、速度、質量等物理變量做顯式表達。
第三層對應交互反饋,可控制本體與世界產生交互,并明確判定任務的成敗狀態。
第四層對應自我進化,具備持續學習與策略優化的能力。
第五層對應多機協同,可實現多智能體之間的協作作業。
當前行業內絕大多數世界模型,能力邊界基本停留在前兩個層級,部分團隊的探索觸及第三層交互能力,但完整的反饋機制和進化能力,依然是少有人抵達的深水區。
英偉達Cosmos偏向世界生成與渲染,李飛飛團隊的相關研究側重物理認知,Yann LeCun推進的路線更關注本體控制與交互。各家路線各有側重,也各自對應不同的商業目標。
大曉開悟的特殊之處,是試圖把理解、生成、預測放進同一套架構中,更偏向將三類能力融合打通,最終指向自我進化與多機協同的高階目標。
在王飛看來,這是技術路線選擇上的本質分野。
很多團隊的世界模型定位停留在工具層面,追求的是單點任務的效果上限。大曉從一開始就將世界模型作為支撐持續迭代的基礎設施,其多模態理解、生成、預測一體化架構,所有設計都圍繞進化閉環展開。兩種路線在初期demo階段可能看不出太大差距,越往高階走,分化會越明顯。
參考大模型行業的洗牌規律也能得到相似結論。
套殼開源模型做后訓練的模式,短時間內就能拿出可用的產品,可一旦向高階能力升級,就會遭遇底層能力不足的硬天花板。只有掌握自主預訓練與架構設計能力的團隊,才能持續補全能力缺口,走到行業最后。
世界模型賽道正在重演同樣的邏輯,套殼拼接的方案能做簡單垂類場景,卻永遠觸達不到自我進化的高階境界。
視頻分支的真正作用,藏在進化閉環里
行業內長期存在一種討論,機器人只要能輸出準確的動作軌跡,像素級的視頻生成屬于多余的算力開銷。持這類觀點的人認為,隱空間路線直接輸出控制信號,效率遠高于先渲染畫面再解算軌跡的路徑。
王飛在訪談中給出了完全不同的視角。他認為,世界模型與傳統VLA模型的差異,恰好來自視頻生成分支的存在。
兩類模型都可以輸出軌跡控制信號,在單次推理的場景下,最終效果不會拉開顯著差距。視頻生成分支的核心作用,體現在策略推演的反饋環節。模型同時生成多條軌跡時,對應的視頻畫面可以直觀呈現每一條軌跡的交互結果,幫助模型判斷軌跡的成敗與優劣。
缺少這一層視覺反饋,模型只能輸出軌跡,無法自主判斷執行效果。就像盲人摸象一樣,能完成動作,卻不知道動作帶來的結果,自然談不上自我反思與優化。
![]()
大曉開悟世界模型架構圖
有了視頻分支做支撐,模型可以一次性推演數十條甚至上百條軌跡,從中篩選出最優的幾條做進一步迭代優化,通過反復推演反思,最終得到成功率最高的執行方案,這就是“進化”的具象體現。
大曉內部的測試數據可以印證這個邏輯。
在桌面整理這類單一小空間場景中,引入自我進化閉環后,任務成功率可以從六成左右提升至九成以上。提升的幅度,遠超單純優化軌跡預測模型帶來的收益。
當然這條路線也有自身的挑戰。
當前視頻生成的精度還無法完全復現所有軌跡的交互細節,偶爾會出現軌跡預測與視頻生成不同步的情況,進而影響自我進化的準確性。王飛坦言,目前自我進化能力只在小范圍低復雜度場景中驗證成熟,大空間通用場景下還有很長的路要走。
但這條技術路徑的方向已經得到驗證,隨著視頻生成能力持續提升,進化閉環的威力會進一步釋放。
被低估的人類數據與失敗案例的價值
數據是大模型時代的核心生產資料,世界模型領域也不例外。
行業內普遍將真機數據視作最金貴的資源,對人類行為數據則抱有復雜態度。很多人認為人類動作包含大量個人習慣帶來的冗余信息,直接投喂給模型反而會拉低任務成功率。
大曉采用的三級漸進式數據訓練范式,恰好打破了這種認知。三層數據由淺入深,分別承擔不同的訓練目標。
第一層是百萬小時級的互聯網開放視頻,主要用來學習重力摩擦力等基礎物理規律。
第二層是十萬小時級的人類交互行為數據,核心目標是學習通用動作空間與交互范式。
第三層是高精度真機數據,只用來做最終的動作錨定與微調。
王飛提到,三層數據目前都還符合尺度定律,沒有出現邊際收益收斂的跡象。
其中,互聯網視頻層的規律已經得到全行業驗證,數據規模持續增長依然能帶來物理一致性的穩定提升;
人類行為數據層正處于規模效應的起點階段,從一萬小時提升到十萬小時的過程中,下游具身任務的成功率提升非常顯著;
真機數據層的規模效應還沒有完全釋放,核心制約因素是機器人的部署量還不夠大。參考自動駕駛行業的發展路徑,一旦百萬級真機投入真實場景,數據帶來的能力提升會非常可觀。
針對人類動作的冗余問題,大曉的解法是對數據做分類處理,不同類型的數據承擔不同的學習目標。
成功案例數據主要學習均值模態,提取共性的動作邏輯,過濾掉個人習慣帶來的冗余噪音;
失敗案例數據反而會被重點對待,因為失敗的場景千變萬化,其中蘊含的信息密度遠高于成功案例,模型通過分析失敗案例,可以強化對物理因果關系的理解,泛化能力提升效果更明顯;
還有一類失敗后再成功的案例,專門用來訓練模型的自我糾錯能力,支撐自我進化閉環的形成。
針對長時程任務容易出現的狀態漂移問題,這套數據范式配合混合線性實時記憶機制,也給出了新的解法。
傳統流水線方案做長時程任務,生成到一定時長后畫面就會發散跳變,軌跡解算自然無法繼續。
大曉開悟世界模型創新的混合記憶機制同時保留兩部分信息,一部分是近幾秒內的連續局部視覺特征,另一部分是歷史任務中關鍵物體的空間位置與物理狀態等全局語義信息,二者結合推演后續動作,既能保證局部動作的連貫性,也能避免長時程下的全局信息丟失。
端側跑通世界模型,靠的不只是壓縮
行業內還有一種普遍認知,世界模型算力消耗巨大,只能部署在云端,端側只能承載輕量化的VLA模型。
大曉在端側推理上的進展,正在打破這個固有印象。
王飛透露,開悟世界模型部署在端側單芯片上,已經可以實現10-15赫茲的推理頻率。單次抓取放置任務的推理耗時約三秒,基本接近人類操作的效率。橫向對比行業內同量級世界模型,推理速度可以達到競品的十倍甚至數十倍。
能做到這個水平,核心支撐不來自后期的模型壓縮與蒸餾,主要源于原生架構層面的設計。
團隊自研的混合線性注意力算子,直接將時間復雜度從平方級降至線性級,這一步帶來的效率提升就有數倍之多。
在此基礎上,高性能計算團隊針對端側芯片的指令集,重構了整套算子推理庫,再配合圖優化與量化技術,進一步釋放硬件性能。兩步優化疊加,最終實現了端側的高效推理。
王飛提到,世界模型團隊普遍偏算法導向,具備底層高性能計算能力的團隊非常少。大多數團隊采用開源架構做二次開發,自然很難在底層算子層面做深度優化。這也是為什么很多模型參數規模相近,實際推理效率會拉開數量級差距。
此外,端側與云側也做了清晰的能力分工。端側負責交互反饋類任務,低延遲隱私性強,適配家庭封閉廠區等場景。云側承擔自我進化相關的高算力任務,并發推演大量軌跡并做擇優迭代,是模型持續進化的核心載體。
這套架構也支撐了“一腦多形”的跨本體泛化能力,同一個世界模型,可以同時驅動靈巧手機器人雙臂機器人與人形機器人。
對于同構型的新本體,甚至可以通過簡單的運動學映射實現零樣本適配,大幅降低跨本體的部署與調試成本。原生一體化架構只需要部署一套模型,相比傳統多模塊拼接的方案,部署人力和時間成本都能下降三到四倍。
落地不用等滿分,60分就可以進場
整個具身智能行業都在等待規模化落地的拐點。所有人都在關心,拐點什么時候會來。最先跑通的場景會在哪里。
王飛給出的時間判斷是三到五年左右。他參考自動駕駛的發展歷程,技術成熟只是一方面,載體的產能質量提升,消費端的認知培育,都需要時間周期。
人形機器人當前的出貨量規模還很小,想要培育起成熟的消費市場,至少需要經歷兩到三輪的硬件迭代。本體硬件的噪音、續航、散熱等問題,預計還需要兩到三年的迭代周期才能得到較好解決。
他斷定,最先規模化的場景,不會是全無人的工業產線,也不會是通用家庭服務機器人,半結構化場景下的人機協同模式,會更早跑通商業閉環。
比如酒店保潔場景中,保潔阿姨最耗時的環節是往返物料間運送物料,這部分工作完全可以由機器人承接。人負責核心的清潔整理工作,機器人承擔重復性轉運環節,整體效率可以提升一倍左右。
類似的還有零售分揀、桌面整理等場景,人力缺口明確,機器人能力可以覆蓋核心環節,落地門檻相對更低。
在落地模式上,王飛認為更合理的分工模式是,機器人企業輸出標準化的基礎能力,場景合作方提供行業知識與流程拆解,雙方共建落地方案——機器人能力不需要達到滿分,六十分的水平就可以進場,在真實場景中運行收集數據,再反過來迭代模型能力,形成正向循環。
尾聲
專訪最后,王飛提到全球范圍內的世界模型賽道,各家團隊的站位各不相同。英偉達側重云端基建與世界生成,其他前沿海外研究團隊更關注交互與控制技術,而中國團隊最大的優勢,來自豐富的落地場景與完整的供應鏈體系。
正是基于這樣的背景,大曉自身也在走軟硬一體耦合迭代的路線。大腦和本體同步研發,算法需求定義本體構型,本體能力反過來約束算法設計。單純做大腦或者單純做硬件,都很難走到終局,軟硬協同優化,才能最終實現性能與成本的最優解,而這種做法又恰好符合中國的優勢所在。
在王飛看來,世界模型的競爭不只是模型參數、生成效果或榜單成績的競爭,而是能否把架構、數據、端側部署和真實場景反饋串成一個持續迭代系統。這個系統能否跑通,才是世界模型從技術報告走向產業現場的關鍵。
世界模型的競賽,早已不是參數規模和生成效果的表層比拼,真正的分水嶺,在于誰能先構建起完整的自我進化閉環、走向物理AI+,在真實場景中跑通正向迭代的循環。當世界模型的定位從炫技的演示工具,轉向支撐持續進化的基礎設施,具身智能的規模化落地,才真正邁出了最關鍵的一步。
*本文圖片均來源于網絡此內容為【智能相對論】原創,
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.