2026 年 6 月,FaceMind Research Asia 在 arXiv 發布《Looped World Models》(LoopWM)論文,首次將循環(Looped)Transformer 架構系統性引入世界建模領域,打破了傳統世界模型 “長程精度 - 計算成本 - 誤差累積” 的不可能三角,并提出迭代潛深度(Iterative Latent Depth) 作為世界模型獨立于參數規模、數據量的第四縮放軸。這項工作不僅是架構層面的創新,更暗含著對 “AI 如何模擬世界、如何思考世界” 的底層認知重構。
![]()
1. 世界模型到底在學什么?
所謂世界模型,并不是簡單地生成下一幀圖像,也不是只回答“接下來會發生什么”。它真正要學習的是:在某個狀態下,如果智能體采取某個動作,世界會如何變化。
換句話說,世界模型試圖在 AI 內部建立一個可推演的“小世界”:
我現在看到什么?我下一步做什么?做完之后,環境會變成什么樣?獎勵、風險、終止條件會如何變化?
這也是為什么世界模型對強化學習、具身智能、自動駕駛、機器人和游戲智能如此重要。論文將世界模型定義為學習環境如何隨動作演化的模型,并把它放在 PlaNet、Dreamer、IRIS、DIAMOND、Genie、Sora 等世界建模脈絡中討論。
2. 傳統世界模型為什么會陷入“不可能三角”?
問題出在長程預測。
如果只預測一步,模型可以靠局部模式完成任務;但如果要連續預測五步、十步、一百步,任何小錯誤都會被后續步驟不斷放大。一次輕微偏差,會變成后續狀態的錯誤輸入;錯誤輸入再生成新的錯誤輸出,于是誤差層層滾動,形成符合誤差。
解決這個問題,直覺上需要更深的計算:模型要多想幾層,才能穩定地推演復雜動力學。但更深的模型意味著更多參數、更高部署成本,也可能在長程 rollouts 中更容易不穩定。論文摘要正是從這個張力出發:忠實的長程模擬需要深計算,但更深模型昂貴且容易誤差累積。
于是三角出現了:
長程精度要高,就需要更多計算。
計算成本要低,就不能無限加深模型。
誤差累積要少,又要求模型在長序列中保持穩定。
LoopWM 的切入點是:不要簡單地把模型做得更大,而是讓同一個模型模塊被反復使用,讓“深度”從參數規模中解耦出來。
3. Looped Transformer 改變了什么?
傳統 Transformer 通常是固定層數:一層、兩層、三十層、八十層。輸入從第一層走到最后一層,計算深度在模型設計時就被寫死了。
Looped Transformer 的想法不同:它讓同一個 Transformer block 被重復調用。不是堆很多不同的層,而是把一個共享參數的模塊循環使用多次。這樣,模型可以擁有更大的“有效計算深度”,卻不必線性增加參數量。
LoopWM 把這個思想引入世界建模:它在 latent state,也就是潛在狀態空間中,對環境狀態進行多輪迭代修正。論文稱其核心是一個 looped dynamics core:它接收前一潛在狀態、當前觀測 embedding 和動作 embedding,通過參數共享的 Transformer block 多次迭代,生成下一潛在狀態。
這就像一個人不是看一眼就下判斷,而是在腦中反復模擬:
“如果我推這個杯子,它會往哪邊倒?”
“桌面摩擦力會不會影響軌跡?”
“它碰到邊緣后會不會翻轉?”
LoopWM 的 loop,不是物理時間上的“下一秒、再下一秒”,而是認知時間上的“再想一遍、再修正一遍”。
4. 為什么這不是簡單的“重復計算”?
關鍵在于:它重復的不是輸出圖像,而是潛在狀態。
傳統世界模型往往每一步都要預測觀測、獎勵、終止狀態等顯式結果。這樣做雖然直觀,但成本高,而且每一步顯式解碼都可能把誤差暴露并固化。
LoopWM 引入 deferred decoding,也就是“延遲解碼”:模型先在 latent space 中連續滾動、推演、修正,最后再進行一次解碼。論文描述,deferred decoding 會替代逐步解碼,在多個 action step 中不調用 decoder,只在終點調用一次 decoder;這樣形成了兩層循環:外層是動作步,內層是潛在狀態迭代修正。
這背后的思想很重要:
世界不是每一刻都必須被渲染成圖像,才能被理解。
智能體可以先在內部抽象空間中推演因果結構,必要時再把結果“落地”為可見的觀測。
這類似人類想象:我們不一定在腦中高清渲染每一幀畫面,而是保留一種結構化的、可操作的內部狀態。
5. 什么是“迭代潛深度”?
傳統 AI scaling 通常圍繞三個軸:
參數規模:模型有多大。
數據規模:訓練看過多少數據。
計算規模:訓練和推理用了多少 FLOPs。
LoopWM 提出的“迭代潛深度”可以理解為第四個軸:在不顯著增加參數的情況下,模型可以在 latent space 中多迭代幾次。
它不是“模型更大”,而是“同一個模型多想幾輪”。
它不是“數據更多”,而是“同一個狀態被反復精煉”。
它不是“層數固定變深”,而是“深度可以按任務難度動態變化”。
論文明確提出,LoopWM 將 iterative latent depth 建立為一種新的世界模擬 scaling axis,并且這個軸與模型大小、數據量相互正交。
這就是它最有啟發性的地方:
智能不一定只來自更大的網絡,也可能來自可復用的思考過程。
6. 自適應計算為什么重要?
真實世界的變化并不均勻。
一顆球在空中勻速飛行,可能很容易預測。
兩個物體碰撞、液體傾倒、機器人抓取失敗,則需要更復雜的推演。
如果所有狀態都用同樣的計算深度,就是把簡單問題算得太貴,把復雜問題算得不夠。
LoopWM 的 adaptive computation 思路是:簡單轉移少循環幾次,復雜轉移多循環幾次。論文舉例說,靜態場景、自由飛行等簡單轉移需要較少處理,而碰撞、接觸動力學等復雜事件需要更深的迭代修正。
這是一種更像“思考”的計算分配:
不是所有事情都值得深思。
但真正困難的地方,必須允許模型停下來多想幾遍。
7. 穩定性問題怎么解決?
循環結構有一個天然風險:
如果每次迭代都放大誤差,那么循環越多,結果越崩。
所以 LoopWM 引入 spectrally-constrained residual dynamics,也就是通過譜約束來穩定潛在狀態更新。論文稱這種約束可以讓 latent transition 在任意 rollout length 下保持有界,并在結論中強調 spectral-norm constraints 為穩定 rollout 提供形式化保證。
直觀地說,LoopWM 不只是讓模型反復想;它還要保證每次反復不是胡思亂想,而是在一個受控的動力系統中逐步修正。
這就是“循環”與“發散”的區別:
沒有約束的循環,可能是幻覺放大器。
有穩定機制的循環,才可能成為推理放大器。
8. 實驗結果說明了什么?
論文在 ScienceWorld 和 AlfWorld 等任務上報告了實驗結果。ScienceWorld 上,LoopWM 約 1B 參數模型的整體結果為 EM 68.4%、Token F1 85.3%、BLEU-4 80.7%、Entity 83.9%,論文將其與 claude-opus-4-6-max 等基線比較,并強調其參數效率。
在 AlfWorld 上,LoopWM 的總體結果為 EM 51.6%、Token F1 80.4%、BLEU-4 71.6%、Entity 81.1%;論文稱其在 BLEU 上領先,在 EM 和 Token F1 上位居第二,同時也指出 entity score 仍有優化空間。
更重要的是,論文強調 deferred decoding 在 rollout 累積時更有用:隨著多步推演增加,延遲解碼的收益更明顯。
不過,這里要保持謹慎:這是一篇 technical report,很多結論仍需要更多獨立復現、消融實驗和社區檢驗。尤其是“100× 參數效率”這類表述,最好理解為論文報告的實驗性主張,而不是已經被廣泛確認的定論。
9. 它真正重構的“世界觀”是什么?
LoopWM 最有意思的地方,不只是架構改進,而是它隱含了一種關于智能的世界觀轉換。
第一,世界不是靜態圖像,而是可迭代的動力系統。
傳統生成模型容易把世界理解為“下一個 token”或“下一幀圖像”。LoopWM 更強調狀態、動作和轉移:世界是由狀態變化構成的,理解世界就是理解變化規則。
第二,思考不是一次前向傳播,而是反復修正。
固定深度模型像“一眼判斷”;LoopWM 更像“內部演算”。這暗示一種認知隱喻:智能不是把輸入映射到輸出,而是在內部空間中構造、檢驗、修正一個世界狀態。
第三,想象不一定需要完全渲染。
Deferred decoding 的哲學意味很強:智能體可以先在抽象潛空間中推演,只在需要時把結果翻譯成可觀察形式。這接近人類的“低分辨率想象”:我們常常知道事情會怎樣發展,卻不需要在腦中生成每一幀高清畫面。
第四,智能的稀缺資源不是參數,而是可分配的思考深度。
過去的 scaling 敘事偏向“更大模型、更多數據”。LoopWM 暗示另一條路:讓模型擁有可調節的內部推演時間。簡單情況快速通過,復雜情況多輪迭代。智能因此不只是容量問題,也是調度問題。
第五,穩定的世界模型必須有邊界。
循環帶來深度,也帶來發散風險。譜約束的隱喻是:想象力必須被動力學約束。沒有約束的想象會漂移成幻覺;有約束的想象才可能成為可用于規劃的模擬。
10. 總結,LoopWM 的核心一句話是什么?
LoopWM 不是簡單地讓世界模型變大,而是讓世界模型學會在潛在空間中反復推演、穩定修正、按需加深,并在必要時才把內部想象解碼為外部觀測。
它把“世界建模”從一次性預測,推向了迭代式模擬;
把“模型深度”從參數堆疊,推向了可復用的潛在計算;
把“AI 看世界”,推向了“AI 在內部反復模擬世界”。
如果說傳統 Transformer 更像一條從輸入到輸出的直線,那么 LoopWM 更像一個閉環:
觀察世界,進入潛空間;
采取動作,更新狀態;
反復修正,保持穩定;
最后解碼,回到世界。
這正是它的世界觀隱喻:
真正的智能,不是更快地給出答案,而是在內部擁有一個可以被反復運行、校正和約束的世界。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.