![]()
世界模型,正成為人工智能(AI)領域最熱門也容易被亂用的概念之一。
無論是視頻生成還是機器人領域,越來越多研究都在使用“世界模型”。但關于它是什么、它應該預測什么、應該如何被構建,目前學界并沒有共識。
針對這個問題,上海 AI Lab 團隊發表了一篇關于世界模型的綜述,對此概念進行了科學定義,梳理了目前的訓練方式和關鍵技術問題,并提出了一個發展有效世界模型的階段性路線圖。
![]()
論文鏈接:https://arxiv.org/abs/2607.06401
研究團隊在文中指出,世界模型可能是通往物理 AGI 的關鍵路徑,并提出了通往物理 AGI 的三位一體架構:Agent 執行任務,Evaluator 評估軌跡,World Model 吸收交互數據并生成新的任務。世界模型不只是預測未來的工具,還能讓 AI 從靜態數據學習走向主動交互和自我進化。
![]()
圖|三位一體架構概覽。
世界模型到底是什么?
研究團隊指出,世界模型是在有限計算資源約束下,對物理世界狀態轉移過程的壓縮建模。通用物理世界模型天然表現出三個主要屬性:
1. 全模態工作范圍。 世界模型必須具備建模所有感知模態數據的能力。它不限于文本或視覺,根本上是一種能夠統一潛在表征的全模態基礎模型。
2. 多維異步性。 世界模型必須能夠處理多維、異步的,也就是多頻率的序列數據。
3. 局部性。 由于 Agent 的感知與計算資源有限,它收集的數據通常局限于局部區域;而該區域并不封閉,仍會受到外部環境持續影響。因此,局部化建模通常可形式化為部分可觀測馬爾可夫決策過程,即 POMDP。
![]()
圖|世界模型的本質及其主要特性的示意圖。
從功能上看,世界模型可理解為三類功能:模擬器預測狀態如何變化,渲染器把狀態轉化為可觀測結果,規劃器基于預測結果選擇動作。三者并非孤立模塊,而是在 POMDP 的閉環決策過程中相互調用、相互更新。
- 渲染器:觀測生成模型,把場景、歷史或動作序列轉化為可感知結果,如圖像或視頻。
- 模擬器:承載動態的模型,預測世界狀態如何演化,并保持物理、幾何和物體一致性。
- 規劃器:評估反事實未來,并選擇應追求的可控結果。
![]()
圖|世界模型在 POMDP 循環中的功能角色。
架構上,現有世界模型大致可分為三類:觀測級模型、潛空間模型,以及 3D 增強或對象中心模型;重要趨勢是走向全模態世界模型。
觀測級生成式世界模型:直接生成未來像素、視頻或體素,把世界建模視為高維觀測合成。它們可利用大規模視頻數據學習外觀、運動和場景動態,生成高視覺保真度的未來。
但視覺逼真不等于物理正確。這類模型可能在長時程中破壞物體恒常性、接觸關系、因果鏈條或場景一致性。因此,關鍵評估標準不只是畫面是否真實,而是軌跡是否在動作、指令或場景條件下保持物理一致、因果連貫和可控。
潛空間世界模型:將高維觀測壓縮為緊湊狀態,并在其中預測和規劃。PlaNet、Dreamer 等方法通過“想象”未來軌跡,讓 Agent 以較低計算成本處理長時程和部分可觀測問題。
它的價值在于保留幾何、對象關系、可供性和接觸動態等決策相關因素,而非重建全部像素細節;其風險是過度抽象,容易丟失夾爪接觸、細小障礙或物體姿態等關鍵線索。
3D 增強與對象中心世界模型:將世界建模從幀預測推進到結構化場景理解。其中,3D 占據和 BEV 適合空間與障礙物推理,NeRF 和 3D Gaussian 提供視角一致的幾何狀態,對象中心方法捕捉實體級動態與組合關系。更有前景的方向,是將空間、時間、對象和交互信息整合為共享物理表征。
但引入 3D 結構并不自動等于理解世界。模型仍可能無法捕捉可供性、因果性、任務語義或長時程交互。強世界模型應保持幾何一致、時間穩定、對象明確和物理合理,并能服務下游推理、規劃與控制。
統一趨勢:全模態世界模型。未來統一模型需要同時理解現在、想象未來、生成動作,并整合視覺、語言、空間、動作和物理信號。面向物理 AI,世界模型不能只會理解和預測,還要能指導行動。
![]()
圖|二維分類框架:功能與架構。
世界模型的訓練與學習范式
世界模型的訓練與學習,可以理解為一條從經驗輸入到可靠行動的閉環:先從從自監督預訓練、具身交互、仿真數據和物理先驗中學習世界表征,再通過潛在想象和 MBRL 循環,將預測能力轉化為可靠行動。
1.經驗與先驗輸入
世界模型首先通過自監督與生成式預訓練,從未標注視覺數據中學習基礎表征,典型方式包括視頻預測、掩碼自編碼、下一個 token 預測和擴散潛空間。隨后,具身交互通過狀態-動作-獎勵數據補充動作與結果之間的關系,并可結合好奇心或內在獎勵驅動探索。合成與仿真數據用于擴展長尾、危險和反事實場景覆蓋,物理先驗與約束則通過 PINNs、ODEs、守恒規律和接觸可行性增強物理一致性。
2. 世界模型學習核心
經過經驗與先驗輸入后,世界模型會把觀測壓縮為緊湊的信念狀態,并學習動作條件轉移先驗,用來預測不同動作下的狀態變化。在此基礎上,模型進一步估計獎勵、價值和不確定性,從而在潛空間中展開想象軌跡,為后續規劃和策略學習提供依據。
3. 決策與推理接口
在決策階段,世界模型通常嵌入 MBRL 循環:先從交互中學習動態模型,再利用該模型進行規劃或策略優化。模型可以在潛空間中進行后臺滾動,并結合 MPC、CEM 或 MCTS 完成規劃與搜索;也可以在模型內部學習策略,如 Dreamer 的 actor-critic,或像 WAM 一樣聯合生成未來與動作。對于反事實推理,模型需要在同一背景下比較不同動作可能導致的結果;對于長時程任務,模型則需要借助子目標、技能和記憶機制,將復雜任務分解為更可執行的規劃過程。
4. 可靠具身行動
當世界模型用于真實具身行動時,模型偏差、sim-to-real 差距、累積誤差和目標錯配會影響執行可靠性,也可能帶來樂觀或悲觀偏差。因此,模型需要通過校準與自我改進循環持續修正,并借助不確定性感知的數據采集,將內部預測與真實反饋對齊。
![]()
圖|世界模型主要訓練與學習范式概覽。
世界模型的路線圖
研究團隊指出,發展一個穩健的未來物理世界模型,需要三個漸進階段。
第一,構建統一多模態世界模型。模型需要整合圖像、視頻、3D 結構、狀態、動作和語義推理等異步信號。統一多模態應通過漸進課程學習實現:先建立穩定圖像語義,再引入視頻、狀態、動作和具身數據,并用緊湊潛在動作區分可控變化與背景外觀。
第二,學習統一物理表征。多樣模態需要被蒸餾為一個高度壓縮的內部狀態,使渲染、仿真和規劃都能從中解碼下游任務所需信息。該表征需要兼具物理 grounding、仿真就緒、幾何自適應和緊湊性,并保留動態、接觸、因果結構等決策相關信息。PhysGaussian 已展示早期方向,但如何學習可演化、持久且融合外觀、物理與語義的緊湊狀態,仍是核心挑戰。
第三,擴展為基礎規模交互式模擬器。未來世界模型應成為閉環、可復用環境,讓 Agent 在真實執行前安全探索、評估和優化動作。這需要可控交互架構,融合力覺、觸覺、接觸和本體感受等物理 grounding 數據,并通過嚴格閉環驗證,確保預測符合動作因果、長期穩定性和真實執行結果。
![]()
圖|下一代世界模型發展的階段性路線圖。
不足與未來方向
研究團隊也提到,目前世界模型在真實交互、安全約束和長時程控制中仍存在短板。具體如下:
1.數據不對稱
渲染器可依賴海量圖像和視頻學習外觀,但模擬器和規劃器需要更稀缺的結構化數據,如仿真資產、機器人軌跡、任務結果、觸覺和力反饋。未來,世界模型仍需要普遍、非侵入、連續的真實世界交互數據反饋。
2.感知保真度與物理精度不匹配
視覺上逼真的未來,不一定物理上合理、可執行或可規劃。未來,世界模型不能只追求畫面真實感,還要預測可行動結果,并借助 3D 幾何、接觸、力、材料、任務反饋和閉環反饋持續校準。
3.累積預測誤差
一步預測誤差會在長時程滾動中遞歸放大,甚至被規劃器利用,生成現實中不可執行的高價值軌跡。未來,世界模型需要降低一步誤差,并讓預測誤差在決策時間尺度上保持有界、可校準、可控制。
4.sim-to-real 遷移
仿真與真實物理之間始終存在殘差,在接觸豐富、部分可觀測和高維動作場景中尤為明顯。未來,世界模型仍需要結合本體感受、觸覺、力反饋和結構化機器人狀態,并借助物理歸納偏置、狀態表征與推理時自適應校正,縮小仿真到真實的差距。
5.評估與基準
現有評估仍較碎片化,視頻模型重視覺質量,控制任務重成功率,機器人系統重泛化與安全。面向真實交互,世界模型評估還需覆蓋因果一致性、動作可控性、長時程穩定性、物理 grounded、閉環執行和低延遲推理,并平衡可復現性與現實復雜度。
6. 安全、透明性與可持續性
物理世界模型在真實部署中仍面臨安全探索、風險評估、推理約束和不確定性控制等挑
戰。未來,它還需要處理人機對齊、環境反饋和多 Agent 協調,并結合控制理論與形式化驗證,提供可解釋、可驗證的穩定性保證。
更多技術細節,詳見原論文。
作者:夏千斯
如需轉載或投稿,請直接在本文章評論區內留言
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.