今天,世界模型幾乎成為 AI 領(lǐng)域最受關(guān)注的話題之一,但對于“什么才是真正的世界模型”卻依然存在巨大分歧。有人認(rèn)為它只是視頻生成的延伸,也有人認(rèn)為只有能夠理解物理規(guī)律、支持機(jī)器人行動的系統(tǒng)才是真正的世界模型。
清華大學(xué)智能產(chǎn)業(yè)研究院(AIR)助理教授趙昊提出了另一種答案——原生 4D 世界模型。在他看來,僅僅生成一段看起來連貫的視頻,還不足以說明模型理解了世界。真正面向自動駕駛和機(jī)器人的世界模型,需要進(jìn)一步描述幾何、時間、光學(xué)屬性以及物體間的力學(xué)關(guān)系。
從室內(nèi)布局、三維場景理解與幾何約束,到 NeRF、自動駕駛仿真、4D 生成,再到推進(jìn)至 3D 生成、機(jī)器人策略學(xué)習(xí)和 4D 世界模型,過去十幾年,趙昊的研究路線幾乎完整經(jīng)歷了空間智能的發(fā)展過程。
![]()
(來源:受訪者)
在這次對話中,我們試圖追問的并不是“世界模型是否重要”,而是一個更具體的問題:為什么必須是 4D?這條強(qiáng)調(diào)顯式幾何與物理表征的路線,究竟是下一代基礎(chǔ)模型,還是在大規(guī)模視頻模型成熟前的一種階段性方案?
以下是我們的對話:
從場景理解到 4D 世界模型:一條清晰的技術(shù)演進(jìn)路線
DeepTech:在 AI 從看見世界邁向理解與干預(yù)世界的過程中,三維場景生成、神經(jīng)渲染與生成式仿真這三個概念頻繁出現(xiàn),它們之間是一種怎樣的關(guān)系?
趙昊:三維場景理解到三維場景生成,是一個挺自然的延伸。如果把這個時間拉回到我讀博期間,當(dāng)時,計算機(jī)視覺領(lǐng)域認(rèn)為最重要的技術(shù)就是三維場景理解,它最大的落地場景是自動駕駛,后面自然延伸到了三維場景生成。實際上,神經(jīng)渲染是三維場景生成的一個重要的技術(shù),而生成式仿真又是一個更大的概念,你可以理解為它是三維場景生成和神經(jīng)渲染的應(yīng)用。
DeepTech:從語言模型到 4D 世界模型,多模態(tài)大模型是如何一步步演進(jìn)的?
趙昊:從整個領(lǐng)域的發(fā)展脈絡(luò)看,多模態(tài)大模型已經(jīng)歷了數(shù)代演進(jìn),AI 在不同階段遇到了不同的瓶頸難題。
![]()
圖丨多模態(tài)原生4D世界模型基模的演進(jìn)(來源:受訪者)
如果按照我們團(tuán)隊對多模態(tài)模型的劃分,第一代是以大語言模型 Token 為代表,如 OpenAI 的 ChatGPT 和 Meta 的 Llama 3,主要解決語言理解、推理與對話,但其瓶頸在于互聯(lián)網(wǎng)語料已基本用盡,難以繼續(xù)通過原有范式提升。
現(xiàn)在智能體(Agent)從范式上看并沒有什么顯著的變化,只是在應(yīng)用和架構(gòu)上更先進(jìn)了。以 Anthropic 為例,它現(xiàn)在的一個提升方式是在各種環(huán)境中,讓智能體做強(qiáng)化學(xué)習(xí),比如編程(coding)的環(huán)境,這里的編程環(huán)境也是一個世界模型。
第二代融合了圖像 Token 和文本 Token,典型代表是 GPT Image2.0 和 Nano Banana,實現(xiàn)了圖文理解、生圖與編輯。第一代和第二代多模態(tài)大模型的共同問題是,無法解決物理世界的真實問題。
當(dāng)前,行業(yè)正朝著更復(fù)雜的代際邁進(jìn)。第三代引入了視頻 Token,如 Seedance 和 Sora,它們開始處理時間動態(tài)與動作連續(xù)性,但并沒有完全成熟。第四代發(fā)展為加入 3D Token,它所關(guān)注的是空間結(jié)構(gòu)和物理屬性,比如 Trellis.2。
第五代可稱為 4D World Token,進(jìn)一步整合空間、時間、物理與交互,這也是我們團(tuán)隊近期重點的發(fā)展方向。AI 是第四次工業(yè)革命的核心,它的演進(jìn)路線很清晰:從理解語言和圖像,到最終理解、生成并推演物理世界,并驅(qū)動智能體在世界中行動。
DeepTech:過去一年,Dexora、Trellis.2、機(jī)器人生成式機(jī)械設(shè)計等工作都是 Best Paper 級別。很多人會覺得跨度很大,這些成果在整個技術(shù)路線中分別承擔(dān)什么角色?
趙昊:Dexora 是首個原生支持雙臂雙手高自由度操作的開源 VLA 系統(tǒng)(ICRA 2026 Best Paper Final List)[1],通過混合遙操流程和判別器加權(quán)訓(xùn)練,在靈巧性基準(zhǔn)測試中顯著優(yōu)于現(xiàn)有基線模型。通過1萬條真機(jī)數(shù)據(jù),驗證了大量的仿真數(shù)據(jù)可以帶來高自由度靈巧手操作。
![]()
(來源:https://dexoravla.github.io/)
第二個工作是原生物理光學(xué)屬性的高分辨率 3D 生成式人工智能(AIGC)基模 Trellis.2(CVPR 2026 最佳學(xué)生論文)[2],它的核心是從原生三維數(shù)據(jù)中學(xué)習(xí)結(jié)構(gòu)化的隱式表征,解決了原生 3D Token 的問題。
其中,O-Voxel 表征中不僅有幾何的信息,還有所有的光學(xué)屬性的信息。原生的意思就是指所有的這些幾何和光學(xué)屬性,包括透明度、粗糙度、金屬感,還有基礎(chǔ)顏色全部都是通過原生的 3D Token 進(jìn)行編碼的。
![]()
(來源:https://microsoft.github.io/TRELLIS.2)
第三項工作是“Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots”(RSS 2026 Best Paper Final List)[3]。它是一個生成式的機(jī)械設(shè)計,其實就是任意給出一個二維的人臉肖像,不僅能夠生成它的三維模型,還把里面的機(jī)械結(jié)構(gòu)也生成出來。包括尤達(dá)大師、精靈、《泰坦尼克號》中的杰克、露絲,還有《白蛇傳》中的許仙、白素貞、小青等等。
總體來說,這個系統(tǒng)能自動設(shè)計一個個性化、無碰撞的面部機(jī)制,并將其轉(zhuǎn)化為可制造的機(jī)器人頭部,同時生成實時的說話和傾聽表情。從一張圖片到一個實體的、可對話的機(jī)器人面孔,整個過程將專業(yè)機(jī)械設(shè)計時間從 22.8 小時縮短至 11.7 分鐘。
![]()
(來源:https://github.com/ZZongzheng0918/automated-facial-)
DeepTech:這些工作看起來分別屬于機(jī)器人、3D 生成和世界模型,但你一直強(qiáng)調(diào),它們其實都屬于物理 AI。為什么今天世界模型會成為連接這些方向的共同底座?
趙昊:即便以語言模型為核心的 Agent,在執(zhí)行編程等任務(wù)時,也需要與一個能夠反饋狀態(tài)變化的外部環(huán)境交互;從廣義角度看,這類環(huán)境具有某些世界模型的功能。
隨著中期演化,當(dāng)前的多模態(tài)大模型,無論是視頻生成、圖片編輯,還是三維、四維生成,仍然無法解決具身智能和自動駕駛所面臨的問題,也缺乏對物理人工智能(Physical AI)的感知能力。
因此,世界模型已成為當(dāng)下的核心主題,領(lǐng)域內(nèi)也隨之涌現(xiàn)出許多新進(jìn)展。例如,我們的 Dexora 就是利用大規(guī)模仿真數(shù)據(jù)和高精度遙操作數(shù)據(jù),訓(xùn)練了面向高自由度雙臂雙手操作的決策模型。
另一方面,Trellis.2 原生 3D Token,使得下一代及下下一代多模態(tài)大模型成為可能。同時,三維 AIGC 也超越了單純的三維模型生成,進(jìn)入了物理 AI 階段,例如可用于生成機(jī)械結(jié)構(gòu)。
DeepTech:此前,你們有一系列自動駕駛世界模型工作如 MARS、UniScene、DiST-4D、OmniNWM等。這些成果在論文中已經(jīng)展示了完整系統(tǒng)能力,但論文結(jié)果與客戶真正可用的產(chǎn)品之間,通常存在很長距離。在你看來,它們還沒走向商業(yè)化的原因可能有哪些?
趙昊:有一部分是產(chǎn)業(yè)周期的原因,之前還沒有到那個階段,以前自動駕駛的范式相對沒有收斂。所以,之前大家也很難讓做模型的人用一個統(tǒng)一的方法去 scale up 它。而現(xiàn)在,這些東西都已經(jīng)把雛形搭好了,基本的原理也都有了。
那為什么還存在距離?因為過去三年,從 2023 年 MARS 發(fā)表的時候,到現(xiàn)在 2026 年,這些技術(shù)還在不斷演進(jìn),但現(xiàn)在基本上已經(jīng)收斂,到了一個可以用持續(xù)的數(shù)據(jù)、算力投入,加上工程團(tuán)隊和客戶迭代,把自動駕駛的世界模型給做出來的階段。
![]()
(來源:https://arlo0o.github.io/OmniNWM/)
現(xiàn)在自動駕駛的范式已經(jīng)比較收斂,是可以 scale up 的時候了。之前沒有做延伸,是因為技術(shù)沒有收斂。如果沒有一個確定的方案,方案沒有收斂,那么用持續(xù)的數(shù)據(jù)、算力投入、工程團(tuán)隊和客戶反饋,可能最后也沒有什么實際效果。
DeepTech:你早期研究室內(nèi)布局、三維場景理解與幾何約束,之后進(jìn)入 NeRF、自動駕駛仿真、4D 生成和機(jī)器人世界模型。回過頭看,這是一條從一開始就明確的技術(shù)路線,還是在視頻生成、擴(kuò)散模型和具身智能興起后,才逐漸收斂成今天的 4D 世界模型?
趙昊:雖然現(xiàn)在大領(lǐng)域的共識是自動駕駛模型的市場付費意愿還沒那么強(qiáng),但我記得之前有人說過,自動駕駛會是 AI 一個非常重要的 workload。
我們且不說具身智能還在投資期和成長期,真正有人實打?qū)嵧度胭Y金的方向,就是自動駕駛。自動駕駛要消耗很多算力、很多卡,還有視頻生成和編程,這是三個已經(jīng)比較 solid 的 workload 了。目前,自動駕駛現(xiàn)在還“卡”在 L2.99,必須要有一個大規(guī)模量產(chǎn)的世界模型,才可以真正把它推到 L4。
我覺得很有意思,你剛才說的和我在談話開始時候說過的三維場景理解是一致的。從三維場景理解到三維場景生成基本上是學(xué)術(shù)界一個正常的轉(zhuǎn)向,所以,也可以說一開始就明確了技術(shù)路徑。
DeepTech:領(lǐng)域內(nèi)有沒有一些進(jìn)展,是印證或啟發(fā)了從三維場景理解到四維世界模型可能會是發(fā)展趨勢的?
趙昊:有篇論文“Rendering Synthetic Objects into Legacy Photographs”(SIGGRAPH Asia 2011,后發(fā)表于 ACM Transactions on Graphics)[5]。它先研究房間布局、場景理解、幾何約束,然后再做生成,把物體放進(jìn)去,本質(zhì)上就是先做三維場景理解,再做三維或四維的場景生成,這和我們討論的技術(shù)路線完全對得上。
![]()
(來源:https://experts.illinois.edu/en/publications/render)
這篇論文可以說是我們領(lǐng)域的一個經(jīng)典,它恰好體現(xiàn)了先理解后生成的思路。你要問我是不是一開始就明確了技術(shù)點,那還真是,因為在當(dāng)時計算機(jī)圖形學(xué)領(lǐng)域頂會 SIGGRAPH,我追隨的那些該領(lǐng)域的資深專家走的就是這個技術(shù)路線。
后來視頻生成、擴(kuò)散模型和具身智能崛起以后,推動了這一方向的發(fā)展,也讓人們意識到這件事已經(jīng)具備了可行性。我第一次真正意識到這一點,是在讀博期間讀到這篇論文的時候,當(dāng)時就堅定了從三維場景理解到四維世界模型的發(fā)展路徑。
DeepTech:世界模型需要長期基礎(chǔ)研究,也需要數(shù)據(jù)、算力、產(chǎn)品和高強(qiáng)度交付。與純工業(yè)界出身的團(tuán)隊相比,學(xué)院派如果想推動相關(guān)技術(shù)或項目商業(yè)化落地,真正的優(yōu)勢是什么?
趙昊:這涉及到一個技術(shù)、商業(yè)項目或產(chǎn)業(yè)方向的本質(zhì)問題。世界上有很多學(xué)院派創(chuàng)業(yè),比如軟件定義網(wǎng)絡(luò)(SDN)就是典型,世界模型尤其如此,現(xiàn)在聲量最高的楊立昆(Yann LeCun)和李飛飛都是學(xué)院派代表。
學(xué)院派做商業(yè)化和工業(yè)團(tuán)隊的商業(yè)模式各有不同。舉例來說,騰訊和字節(jié)是典型的產(chǎn)品驅(qū)動型公司,產(chǎn)品好、體驗好,微信、抖音、王者榮耀都是把人性體驗?zāi)媚蟮綐O致的產(chǎn)品。阿里則是一個典型的平臺型公司,管理和生態(tài)最重要。產(chǎn)品公司的技術(shù)當(dāng)然是核心要素,但產(chǎn)品驅(qū)動型公司更多是把成熟技術(shù)做到好的體驗。
所以如果硬要分類,世界上大概有產(chǎn)品型、平臺型和技術(shù)型三類公司,AI 顯然屬于技術(shù)型。像 GPT 或語言模型,必然是 OpenAI 這樣的全明星科學(xué)家團(tuán)隊才能做出來。
當(dāng)然,產(chǎn)品型公司以前也做過相關(guān)嘗試,比如蘋果的 Siri。在大模型出現(xiàn)之前,它已經(jīng)通過大量的產(chǎn)品定義和預(yù)設(shè)問答,在沒有大模型的情況下把產(chǎn)品體驗做到了極致。所以從 Siri 到 GPT,本質(zhì)上是從產(chǎn)品型業(yè)態(tài)向技術(shù)型業(yè)態(tài)的轉(zhuǎn)變。
什么是真正的 4D 原生?
DeepTech:世界模型是近期大家都在討論的話題,但說法并不一致,比如有生成視頻、生成三維場景、訓(xùn)練機(jī)器人,還有輔助自動駕駛都號稱自己是世界模型,那到底什么是世界模型?
趙昊:世界模型最核心的就是刻畫世界的變化。無論是生成視頻、三維場景,還是在其中訓(xùn)練機(jī)器人、做自動駕駛,本質(zhì)上都是在刻畫世界的變化。
至于 State 用什么方式來表達(dá),其實有很多種形式,它可以包括語言模型在編程環(huán)境中的狀態(tài)變化,AlphaGo 下圍棋時的棋盤向量,生成圖片可以理解為用離散的二維圖像狀態(tài)來刻畫變化,視頻則是通過視頻 Token 的變化來體現(xiàn),三維的、四維的都是世界模型,聯(lián)合嵌入預(yù)測架構(gòu)(JEPA)本質(zhì)上也是一維的世界模型。
所以,世界模型的定義很清楚:刻畫從 State t 到 State t+1 的變化,只是不同模型采用的狀態(tài)維度不同,有的是一維、二維,有的是三維、四維。它們最核心的區(qū)別在于,如果采用一維或二維的 Token,天然缺乏四維物理世界所需的表征,包括物理屬性和光學(xué)屬性,因此很難真正刻畫世界的變化。
神經(jīng)網(wǎng)絡(luò)的可解釋性本身就很差,如果用一維 Token 去表達(dá)世界變化,既難以解釋,也難以修正。二維視頻生成也經(jīng)常遇到不符合物理規(guī)律的問題,但由于表征本身就是二維的,出了問題也“束手無策”,網(wǎng)絡(luò)本身就是個黑盒。
所以,要真正解決物理 AI 的問題,包括自動駕駛、具身智能以及物理真實的游戲和影視,還是需要四維表征才能真正解決這些問題。關(guān)鍵就在于,四維表征更可解釋、更明確、更可依賴,這是其他維度無法替代的。
DeepTech:為什么三維場景加上一個時間軸,還不能算團(tuán)隊所定義的物理原生 4D 世界模型?第四維除了時間之外,還應(yīng)該包含什么?
趙昊:從本質(zhì)上來看,世界模型的物理屬性主要分為熱學(xué)屬性、電磁學(xué)屬性、光學(xué)屬性和力學(xué)屬性,我們現(xiàn)在主要關(guān)注的是力學(xué)屬性和光學(xué)屬性。但電磁學(xué)也很重要,比如無人機(jī)的世界模型就需要關(guān)心電磁學(xué)和反無人機(jī)的問題;熱學(xué)屬性同樣關(guān)鍵,它關(guān)系到自動駕駛車輛和機(jī)器人的散熱。
純?nèi)S場景加一個時間軸,其實只是 3.5D 的世界模型,而不是真正的 4D。因為每一幀之間沒有通過光學(xué)和力學(xué)的變化建立聯(lián)系,每一幀都只是一個獨立的三維場景,你并不知道每個點的受力、速度和動量。
只有把力學(xué)屬性如楊氏模量、密度、動量、受力等都刻畫進(jìn)去,才能讓時間軸上的每一幀真正關(guān)聯(lián)起來,形成完整的、4D 原生的世界模型表達(dá)物體狀態(tài)、身份和運動軌跡。
非 4D 原生的模型,比如 3D 模型或視頻模型,并沒有刻畫這些東西。必須要包含物理屬性,其中熱學(xué)和電磁學(xué)我們暫時還沒深入,光學(xué)和力學(xué)才是當(dāng)前的核心。沒有這些屬性,就只是一個 3.5D 的模型。
DeepTech:你和團(tuán)隊提出 4D World Token,為什么要把連續(xù)的物理世界 Token 化?
趙昊:首先三維世界、三維模型本身都是連續(xù)的,Token 化的。比如 Trellis.2[2]也是有一個變分自編碼器(VAE),然后在一個網(wǎng)格上,把三維模型變成三維 Token,然后再去做生成。
其次,視頻模型其實也是 Token 化的,無論是 Seedance、Sora 還是萬象,它其實都是有一個 VAE,把它變成視頻 Token,圖片也同樣會把這個東西變成 Token 的。所以,語言模型變成 Token 化這件事,是現(xiàn)代多模態(tài)大模型的一個慣例。
我認(rèn)為,除非量子計算、神經(jīng)擬態(tài)計算這些新的計算機(jī)架構(gòu)能有突破,我們在很長一段時間內(nèi)還是需要把連續(xù)的物理世界 Token 化,在 4D 中也是一樣。
DeepTech:在強(qiáng)化學(xué)習(xí)的定義中,環(huán)境模型往往不僅要預(yù)測狀態(tài)變化,還可能需要預(yù)測獎勵或價值;而計算機(jī)視覺領(lǐng)域的世界模型通常更關(guān)注視頻、幾何或未來狀態(tài)。你認(rèn)為,面向智能體的世界模型是否必須提供獎勵信號?如果不同任務(wù)對應(yīng)不同的獎勵,獎勵本身應(yīng)該是由通用的獎勵模型還是由獨立的價值模型承擔(dān)?
趙昊:我覺得這個問題非常專業(yè)。獎勵必須在 4D 表征上才好定義。首先獎勵非常重要,獎勵就是你僅僅預(yù)測物理狀態(tài)的變化是不夠的。有很多種世界模型都是從 State t 到 State t+1,但有的是一維表征,有的是二維視頻生成模型。
實際上,它就是一個二維表征的世界模型,這個狀態(tài)是一維、二維、三維、四維的區(qū)別,關(guān)鍵在于你要怎樣去定義,怎么表達(dá)這個狀態(tài),你就在這個狀態(tài)上怎么去定義它的獎勵。
因此,世界模型必須要有好的獎勵才可以。它也許需要獨立的價值模型來承擔(dān),但這樣就涉及到你到底要表征成什么樣。一維只能通過神經(jīng)網(wǎng)絡(luò)盲目映射,二維不能理解空間關(guān)系,三維無法理解“快快的”或者“輕輕的”這種獎勵。
所以,對涉及空間關(guān)系、動態(tài)過程和物理交互的任務(wù)而言,完整的 4D 表征有助于把獎勵定義得更明確、更可解釋。
技術(shù)路線之爭:幾何、查詢范式與 Scaling Law
DeepTech:從你們的研究看,無論是 UniScene、ORV 還是其他 4D 生成工作,都非常強(qiáng)調(diào)幾何、占據(jù)和時空結(jié)構(gòu)。但根據(jù)大模型路線,只要數(shù)據(jù)和算力足夠,模型可以從像素中自行涌現(xiàn)三維結(jié)構(gòu)與物理規(guī)律。所以,幾何先驗究竟是團(tuán)隊的長期壁壘,還是在模型和數(shù)據(jù)規(guī)模不足時必須使用的一根“拐杖”?
趙昊:我從兩個角度來回答這個問題。二維的表征它有可能自然地學(xué)出三維結(jié)構(gòu)和物理規(guī)律,但前提是數(shù)據(jù)和算力足夠。然而,這些數(shù)據(jù)還是要靠四維的模型去生成的,我覺得這個邏輯是必然的。
在我看來,幾何先驗的作用不是一個“拐杖”。我預(yù)言,四維世界模型未來將會是一個大模型,而二維的模型可能是從 4D 模型中提取出來的一個小模型。所以,它們之間的關(guān)系是:我們的 4D 世界模型是“重”模型,而 JEPA 這樣的是“輕”模型。至于數(shù)據(jù)和模型規(guī)模不足的問題,未來這種純大模型路線,還是需要像我們這樣的 4D 世界模型來提供數(shù)據(jù)才行。
對于長期壁壘,我的看法是:純的二維大模型,即便未來被驗證可行,也必然是在我們這種四維模型做成功之后,利用我們生成的 4D 數(shù)據(jù)來訓(xùn)練的。因為大模型需要海量數(shù)據(jù),而我們正是提供這些數(shù)據(jù)的角色。
并且,它們的算力消耗遠(yuǎn)低于我們。所以,一旦我們的路線走通,其他路線可以提取我們的成果,變成一個二維表征的模型,但我們同樣能做它們做的事——我們可以降維,但它們無法升維,做不了我們做的事。
DeepTech:你曾判斷,基于查詢的幾何基礎(chǔ)模型會成為趨勢。如果模型最終能夠在隱空間直接查詢?nèi)我鈺r空位置的信息,是否意味著顯式三維重建、網(wǎng)格、點云乃至占據(jù)表示都會逐漸退到后臺?你判斷的是查詢式幾何,但這條路線的終點,會不會恰恰是模型不再顯式構(gòu)建幾何?
趙昊:這里需要澄清一個事實,查詢式(query-based)Transformer 實際上是一種架構(gòu),盡管它們之間存在千絲萬縷的聯(lián)系,但經(jīng)常有人把架構(gòu)與表征混淆。
首先,任何的深度學(xué)習(xí),無論從最早的卷積神經(jīng)網(wǎng)絡(luò)(CNN),到現(xiàn)在的 Transformer,都有輸入、網(wǎng)絡(luò)和輸出。表征其實是定義了網(wǎng)絡(luò)的輸出,架構(gòu)是網(wǎng)絡(luò)本身。
query-based Transformer 是架構(gòu),而四維的才是表征,即模型最終的輸出。就像清華趙行老師團(tuán)隊的研究“Fast World Action Model”[6],它可以不做視頻的解碼,只用隱空間來做,這相當(dāng)于表征。它首先必須要有四維的表征,但 query-based Transformer 可以把它解碼出來,這就是架構(gòu)和表征之間的區(qū)別。
DeepTech:視頻模型仍會生成違反常識的畫面,但 Genie 3 已經(jīng)能夠?qū)崟r生成可探索的交互環(huán)境,并在一定時間內(nèi)保持視覺和環(huán)境一致性。如果視頻生成模型繼續(xù)擴(kuò)大數(shù)據(jù)、參數(shù)和交互軌跡,它是否可能自然演化成真正的世界模型?
趙昊:首先 Genie 3 范式很有意思,但它也在演變中。我們團(tuán)隊已經(jīng)做了很多有四維表征的世界模型,比如自動駕駛領(lǐng)域的 Omni NWM[4],它其實就是一個六視角的 Genie 3,同時還具備四維的語義和幾何表征,可以理解為四維版的 Genie 3。
另外我們還有一個工作,是視頻生成框架 LightX(ICLR 2026)[7],它是一個鏡頭與光照“雙可控”的 4D 視頻生成模型,可為固定機(jī)位視頻賦予動態(tài)運鏡和可調(diào)光照的全新維度。可以將它理解為一個被重新打光的 Genie 3,也可以像 Genie 3 那樣在里面自由走動。
![]()
(來源:https://github.com/tqtqliu/light-x)
我的核心觀點是:Genie 3 作為生成式模型,繼續(xù)擴(kuò)大數(shù)據(jù)確實可以演變成真正的世界模型,但前提是必須加上四維表征。而我們在該方向已經(jīng)有了一些成果,比如 OmniNWM 和 LightX 都是四維版本的 Genie 3。所以它可以演變,但不僅僅是擴(kuò)大數(shù)據(jù),還需要引入四維表征——這正是我們要做的方向。
DeepTech:MARS 已經(jīng)嘗試將真實的道路重建為實例可控的仿真場,傳統(tǒng)的仿真引擎為什么還需要世界模型?如果是依賴傳統(tǒng)仿真,它究竟是一種新一代模擬器,還是只在傳統(tǒng)仿真引擎外部增加了一層生成式視覺呈現(xiàn)?
趙昊:我覺得這個問題也比較關(guān)鍵。傳統(tǒng)仿真確實能夠提供顯式的幾何和物理規(guī)律,這點沒錯。但是,傳統(tǒng)仿真引擎提供的顯式幾何和物理規(guī)律還不夠好,它有大量的問題無法建模。
所謂的顯式幾何和物理規(guī)律,就是從 State t 到 State t+1 的變化。如果傳統(tǒng)仿真能夠徹底解決 State t+1 的問題,我們確實就不需要做世界模型了。但問題在于,它還不夠好,有很多微妙的東西是傳統(tǒng)仿真引擎無法刻畫的。
舉個例子,傳統(tǒng)仿真一直在糾結(jié)于湍流和疲勞這些問題。如果它真的能做到,世界模型早就實現(xiàn)了。正是因為傳統(tǒng)仿真引擎無法很好地建模這些物理規(guī)律,所以才需要世界模型。第五代世界模型就是把一切變成 Token,讓神經(jīng)網(wǎng)絡(luò)直接去學(xué)習(xí)物理規(guī)律,目標(biāo)是解決傳統(tǒng)仿真引擎解決不了的問題。
DeepTech:機(jī)器人和自動駕駛不需要每一片樹葉都符合真實規(guī)律,卻非常依賴碰撞、質(zhì)量、摩擦、接觸、遮擋和物體恒存。那么應(yīng)該怎樣確定哪些誤差可以容忍,哪些誤差會讓世界模型失去訓(xùn)練價值?
趙昊:這本質(zhì)上是對物理規(guī)律要刻畫得多細(xì)的問題。傳統(tǒng)的仿真引擎能夠仿真風(fēng)洞實驗或機(jī)械臂抓取,但無法刻畫每一片樹葉的物理規(guī)律,因為傳統(tǒng)仿真引擎本身是受限的。
所以,我們想要做的正是能夠把每一片樹葉都刻畫出來的世界模型。雖然很難,但這其實是一個“信仰”問題。就像在 GPT 誕生之前,可能有些研究自然語言處理(NLP)的學(xué)者可能會說,如果只做問答或?qū)嶓w識別,并不需要了解世界上所有的知識,只需要一些領(lǐng)域特定的表征就夠了。
但技術(shù)發(fā)展到后來,真正勝出的恰恰是那個了解世界上所有知識的大模型,并且它降維打擊了所有子任務(wù)。所以,我們認(rèn)為 4D 世界模型是下一代基模,是下一個智譜、下一個 GPT,那就應(yīng)該直接奔著最高的目標(biāo)——去做一個能夠理解所有物理規(guī)律的世界模型,然后降維打擊所有機(jī)器人和自動駕駛的問題。
既然已經(jīng)開始做世界模型,就應(yīng)該把所有問題都解決掉,就像 GPT 把所有知識都囊括進(jìn)去,再去降維打擊所有子任務(wù)一樣。這才是一個做基模應(yīng)有的“苦澀的教訓(xùn)”(bitter lesson)和規(guī)模法則(Scaling Law)的思路。
數(shù)據(jù)與學(xué)習(xí):世界模型如何獲得因果和行動能力
DeepTech:語言模型可以從互聯(lián)網(wǎng)上獲得大量文本,但世界模型需要的不只是畫面,還需要動作、狀態(tài)變化、傳感器信息和結(jié)果。在你看來,起步階段最稀缺的是哪類數(shù)據(jù)?公開數(shù)據(jù)、真實機(jī)器人軌跡、自動駕駛數(shù)據(jù)、游戲數(shù)據(jù)和仿真數(shù)據(jù)分別承擔(dān)什么作用?
趙昊:首先,公開數(shù)據(jù)、真實數(shù)據(jù)、自動駕駛數(shù)據(jù),這些統(tǒng)一稱為真實數(shù)據(jù);游戲數(shù)據(jù)、仿真數(shù)據(jù)則統(tǒng)稱為仿真數(shù)據(jù)。仿真數(shù)據(jù)之所以重要,是因為幾何和速度信息無法通過人工標(biāo)注獲得,而仿真數(shù)據(jù)中的幾何、速度信息是絕對精準(zhǔn)的。
當(dāng)然,仿真數(shù)據(jù)存在仿真到現(xiàn)實(Sim-to-Real)的差距,而神經(jīng)渲染的一個重要用途,就是通過在真實數(shù)據(jù)上進(jìn)行自監(jiān)督學(xué)習(xí),來縮小甚至消除這一差距。
正因為我們現(xiàn)在要做的是 4D Token,仿真數(shù)據(jù)中的四維標(biāo)記在力學(xué)信息和幾何信息上是絕對精準(zhǔn)的,相比之下,真實數(shù)據(jù)中重建出來的幾何和速度信息反而沒有那么準(zhǔn)確。由于仿真數(shù)據(jù)存在 Sim-to-Real 差距,我們的基本思路是:需要在真實數(shù)據(jù)上做自監(jiān)督,來減少這個差距。
在所有仿真數(shù)據(jù)中,最具挑戰(zhàn)性的是接觸力學(xué)仿真。比如,我們團(tuán)隊做的 RTX-IPC 仿真,生成的數(shù)據(jù)就非常真實。面向靈巧手等高密度動態(tài)接觸場景,較 StiffGIPC 實現(xiàn)平均達(dá)到了端到端加速 1.7 倍,可提供更高效的底層計算能力。
DeepTech:世界模型究竟能夠替代自動駕駛中的哪一部分真實數(shù)據(jù)采集和路測?它更適合用于訓(xùn)練、長尾場景生成,還是安全評測?哪些數(shù)據(jù)和驗證無論如何仍然必須來自真實道路?
趙昊:世界模型用于長尾場景生成、安全評測以及普通的感知訓(xùn)練,這些都是自動駕駛在 L2 和 L2.99 級別的典型應(yīng)用,而且已經(jīng)落地了。之前自動駕駛世界模型之所以沒有量產(chǎn),是因為這些應(yīng)用太細(xì)碎,而現(xiàn)在自動駕駛世界模型已經(jīng)開始收斂成一個大模型的業(yè)態(tài)。
現(xiàn)在,自動駕駛已經(jīng)進(jìn)入了 4D 世界模型的新時代。對于L4級別,真正有用的世界模型,是像特斯拉在 2025 年 10 月公開的“神經(jīng)世界模擬器”那樣,能夠進(jìn)入量產(chǎn)系統(tǒng)訓(xùn)練與閉環(huán)評測流程的模型,以及我們推出的可量產(chǎn)、六視角、具有四維表征的 OmniNWM。它有可能會真正改變自動駕駛和自動駕駛世界模型的格局。要進(jìn)入L4的自動駕駛世界模型時代,核心思路是:先訓(xùn)練一個自動駕駛的世界模型基模,然后車企在此基礎(chǔ)上做強(qiáng)化學(xué)習(xí)(RL),這樣才能真正達(dá)到 L4。
DeepTech:當(dāng)模型生成的視頻、3D 場景和軌跡不斷回流到訓(xùn)練集中,錯誤是否會被下一輪模型繼續(xù)學(xué)習(xí)和放大?你和團(tuán)隊怎樣判斷一條合成軌跡有資格進(jìn)入預(yù)訓(xùn)練或后訓(xùn)練數(shù)據(jù)?
趙昊:這也是一個有意思的現(xiàn)象。仿真數(shù)據(jù)的優(yōu)勢在于沒有錯誤,提供的幾何和物理信息絕對精準(zhǔn),因此其生成的模型誤差不會影響利用神經(jīng)渲染在真實數(shù)據(jù)上做自監(jiān)督來減小 Sim-to-Real 差距。
關(guān)于 Sim-to-Real 差距和誤差積累的問題,答案是一樣的:我們一部分?jǐn)?shù)據(jù)沒有錯誤但有 Sim-to-Real 差距,另一部分真實數(shù)據(jù)沒有 Sim-to-Real 差距但可能有錯誤。通過將這兩種數(shù)據(jù)混合起來訓(xùn)練,利用自監(jiān)督方式提供訓(xùn)練信號,持續(xù)提升我們的 4D 世界模型。
質(zhì)疑、評測與無法回避的難題
DeepTech:目前團(tuán)隊是否在推進(jìn)技術(shù)的工業(yè)落地或合作?是否有一些有趣的案例可以與我們分享?
趙昊:我們團(tuán)隊目前較成熟的能力和工業(yè)合作,主要集中在自動駕駛、面向3D打印的三維內(nèi)容生成等無接觸或弱接觸場景。一旦涉及到具身智能中復(fù)雜的接觸力學(xué)(contact-rich),仿真和交付難度都會顯著提高。至于自動駕駛領(lǐng)域,剛才提到的那些 L2 到 L2.99 的場景,我們已經(jīng)有工業(yè)合作的案例了。
DeepTech:你聽到過對世界模型最有分量的質(zhì)疑是什么,比如視頻生成到底算不算是世界模型?
趙昊:我覺得視頻生成肯定是世界模型中很重要的一個部分。無論是一維表征,比如 JEPA,它也會生成一些視頻,雖然質(zhì)量很差;二維就更不用說,本身就是生成視頻的;三維、四維的我們最后也還是會渲染出一個視頻來。所以,視頻生成肯定是世界模型一個重要的出口,無論哪種狀態(tài)表征,最后多少都會涉及到視頻生成。
最有分量的質(zhì)疑,我覺得就是模型誤差會不斷積累,這是一個事實。現(xiàn)在無論用哪種方式生成視頻都各有千秋,但現(xiàn)有模型即便能夠輸出更長視頻,也很難在超過 1 分鐘的尺度上持續(xù)保持可靠的身份、幾何、物理和交互一致性。
DeepTech:那如果想要做超過 1 分鐘的視頻,需要在哪項技術(shù)能力方面進(jìn)行突破?
趙昊:說實話,還挺難的。
DeepTech:因為它不是一個單點的技術(shù)突破?
趙昊:對,它可能需要更好的卡,這需要 GPU 的突破才有可能真正實現(xiàn)。如果說領(lǐng)域內(nèi)有一些討論或者質(zhì)疑,我覺得很多問題是能解決的,但真正沒法解決的是,無論你用哪種方法,還是很難突破生成超過 1 分鐘的視頻。
當(dāng)然 1 分鐘以內(nèi)已經(jīng)很有用了,你可以用好多個 1 分鐘。現(xiàn)在真正長程的流式世界模型,要時間很長,還是很難的。我覺得在這方面,我們的 4D 表征是一個很有前景的解決路徑。
DeepTech:目前,世界模型缺少統(tǒng)一評測。視頻質(zhì)量不能說明動作預(yù)測正確,單個機(jī)器人任務(wù)的成功也不能證明擁有通用物理理解。如果理解物理世界沒有一個明確目標(biāo)函數(shù),我們怎樣知道模型學(xué)對了?
趙昊:目前,我們確實暫時還沒有能力去做這么大規(guī)模的評測。但我想表達(dá)一個觀點:判斷模型是否真正理解物理世界,最終的評測標(biāo)準(zhǔn)應(yīng)當(dāng)與 4D 世界模型對齊。這個想法雖然有些激進(jìn),但我認(rèn)為應(yīng)該先把具備 4D 表征的世界模型做出來,因為它確實在理解物理世界。
之后,其他基于純二維或一維狀態(tài)的世界模型,都可以與這種顯式 4D 表征進(jìn)行對齊。從整個行業(yè)來看,也是應(yīng)該優(yōu)先推進(jìn) 4D 世界模型的研究,因為 4D 表征本身就蘊含著對物理世界的深層理解,可以作為各種路徑的通用對齊基準(zhǔn)。
DeepTech:問一個大膽的預(yù)測——在幾何先驗、4D World Token、query-based Transformer 架構(gòu)、獎勵機(jī)制和跨行業(yè)基座模型這些判斷中,哪一項最可能在未來三年被證明是錯的?
趙昊:這個還挺有意思的。我覺得原理上前四個都是對的,唯一一個可能是錯的,就是跨行業(yè)基模可能不對,在未來三年內(nèi)大家也許會判斷它實在是太難做了。
DeepTech:出現(xiàn)什么實驗或市場信號,你會改變團(tuán)隊的技術(shù)路線?如果核心假設(shè)不成立,團(tuán)隊是否有 Plan B?
趙昊:首先我必須澄清一下,這里有一個可能會讓人誤解的地方,我們的技術(shù)路線并不是只有 4D Token。第五代多模態(tài)大模型實際上囊括了前四代的所有路線,可以說,語言、圖像、視頻、3D 和 4D 等多種表征自然都是它的子集,這些路線只是我通往第五代多模態(tài)大模型的一個折中方案,所以它沒有 Plan B。
如果你要說出現(xiàn)什么市場信號我們會有所調(diào)整,也許我們在第五代、五種 Token 混合訓(xùn)練的時候,有一些子集已經(jīng)帶來巨大商業(yè)價值,我可能會優(yōu)先用那些路線去做,去解決屆時大家最關(guān)注的那些有意思的問題。
參考資料:
1.https://dexoravla.github.io/
2.https://microsoft.github.io/TRELLIS.2
3.https://github.com/ZZongzheng0918/automated-facial-mechanisms-synthesis
4.https://arlo0o.github.io/OmniNWM/
5.https://experts.illinois.edu/en/publications/rendering-synthetic-objects-into-legacy-photographs
6.https://huggingface.co/papers/2603.16666
7.https://github.com/tqtqliu/light-x
8.https://opendrivelab.com/RISE/
9.個人主頁:https://sites.google.com/view/fromandto
運營/排版:何晨龍
注:封面由 AI 輔助生成
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.