7月20日,WAIC 2026期間,生數(shù)科技與萬興科技聯(lián)合舉辦“世界模型驅(qū)動下的AI影視生產(chǎn)力新范式”專題論壇。論壇上,生數(shù)科技創(chuàng)始人、清華大學(xué)人工智能研究院副院長朱軍發(fā)表題為《通用世界模型:連接數(shù)字世界與物理世界的新基礎(chǔ)設(shè)施》的主題演講,系統(tǒng)分享了通用世界模型的技術(shù)演進(jìn)、核心能力及產(chǎn)業(yè)應(yīng)用路徑。
朱軍表示,人工智能正在從理解和生成數(shù)字內(nèi)容,進(jìn)一步走向?qū)κ澜缫?guī)律的建模、推理、預(yù)測與行動。通用世界模型將成為連接數(shù)字世界與物理世界的重要基礎(chǔ)設(shè)施,推動AI從“生成世界”邁向“理解世界、預(yù)測世界、行動于世界”。
![]()
以下為演講全文:
尊敬的各位嘉賓,大家上午好!
首先,非常感謝大家百忙之中參加我們的論壇。我們非常榮幸能夠與萬興科技一起,在世界人工智能大會舉辦這場面向未來的論壇。
大家都知道,大模型正從語言模型走向多模態(tài)模型,再進(jìn)一步走向世界模型,技術(shù)能力不斷突破。同時,AI也在從單一工具逐步發(fā)展為支撐產(chǎn)業(yè)生產(chǎn)力的基礎(chǔ)設(shè)施,這正是我們發(fā)起今天這場論壇的重要初衷。接下來,我會用一點(diǎn)時間,跟大家簡要分享一下我們所看到的基礎(chǔ)模型發(fā)展趨勢。
![]()
首先,從原理上來看,什么是世界模型?
我們先來看人的世界模型。這里有一個簡單的定義。大家都有過騎自行車或者開車的經(jīng)歷,在做出動作之前,我們會在大腦中形成一個小模型,幫助我們理解環(huán)境、想象不同動作可能產(chǎn)生的結(jié)果、規(guī)劃行動,最終指導(dǎo)動作輸出。這就是人的世界模型,它能夠幫助我們適應(yīng)復(fù)雜環(huán)境,并作出安全、可靠的行動。
今天,全世界都在關(guān)注如何構(gòu)建機(jī)器的世界模型。機(jī)器世界模型相關(guān)的研究很多,前沿進(jìn)展也非常快。但從本質(zhì)上來看,機(jī)器的世界模型主要需要具備三項(xiàng)能力。
第一,對環(huán)境進(jìn)行精準(zhǔn)理解;第二,能夠基于當(dāng)前狀態(tài)和即將采取的動作進(jìn)行預(yù)測和想象;第三,能夠在預(yù)測過程中學(xué)習(xí)并采取行動。總體而言,我們認(rèn)為機(jī)器世界模型至少要實(shí)現(xiàn)理解、想象和行動的一體化。
從這里可以看出,世界模型與普通模型的區(qū)別在于,它不僅要回答“是什么”,實(shí)現(xiàn)對世界的理解, 還要回答“為什么”,以及“這樣做會產(chǎn)生什么后果”。這個領(lǐng)域目前最大的變革,是從專用模型走向通用模型,并形成Scaling Law。包括視頻模型和世界模型在內(nèi),大家都希望遵循Scaling Law,推動通用能力取得重大進(jìn)展。
要做通用模型,首先需要回答一個問題:我們應(yīng)該使用什么樣的數(shù)據(jù)?根據(jù)理解和建模世界的目標(biāo),我們梳理了相關(guān)數(shù)據(jù),形成了六層數(shù)據(jù)金字塔。從底層向上,分別包括通用互聯(lián)網(wǎng)視頻、第一視角的人類動作視頻,以及機(jī)器人相關(guān)的操作數(shù)據(jù)等。
![]()
在機(jī)器人軌跡采集過程中,大量數(shù)據(jù)也是以視頻形式承載的。機(jī)器人通常配備多個相機(jī),用于拍攝環(huán)境和機(jī)器人的動作。總體來看,視頻是這套數(shù)據(jù)體系中最主要的格式,因?yàn)樗亲畋憬荨⒆钊菀子涗浭澜缱兓臄?shù)據(jù)載體。
數(shù)據(jù)金字塔的底層具有海量的數(shù)據(jù)規(guī)模,而在機(jī)器人專用操作數(shù)據(jù)方面,如何收集足夠多的數(shù)據(jù),一直是行業(yè)面臨的巨大難題。
我們的目標(biāo)是打造通用基模,因此在數(shù)據(jù)使用上有幾個原則:第一,數(shù)據(jù)規(guī)模要足夠大;第二,數(shù)據(jù)類型要盡可能全面;第三,要盡可能使用真實(shí)數(shù)據(jù)。這也是我們從大模型訓(xùn)練中總結(jié)出的規(guī)律。過去,這些數(shù)據(jù)為什么沒有被充分利用起來?一個重要原因是,普通視頻與機(jī)器人動作軌跡之間缺少直接對應(yīng)關(guān)系。
今天,我們想和大家分享的是,如何通過生成式方法和底層技術(shù)原理,讓海量視頻數(shù)據(jù)轉(zhuǎn)化為高質(zhì)量、有價值的訓(xùn)練數(shù)據(jù)。因此,我們看到,世界模型首先會在數(shù)字世界中成長,但最終目的不只是生成數(shù)字內(nèi)容,還要進(jìn)一步走向物理世界,在更加廣泛的場景中發(fā)揮價值。
有了前面的數(shù)據(jù),接下來要考慮的是,如何真正發(fā)揮這些數(shù)據(jù)的價值。
我們的目標(biāo)是打造通用模型,而通用模型需要通用架構(gòu)。簡單地將不同模塊串聯(lián)或并聯(lián)起來,并不是最理想的方式。我們希望在統(tǒng)一架構(gòu)中,實(shí)現(xiàn)理解、想象和行動的一體化。我們較早開始探索這一方向,并提出了全球首個MoT統(tǒng)一架構(gòu),將理解專家、生成專家和行動專家統(tǒng)一在同一個模型中,通過統(tǒng)一目標(biāo)進(jìn)行訓(xùn)練。
![]()
因?yàn)樗且粋€一體化模型,所以在使用過程中可以自由切換不同的輸出形態(tài)。對于機(jī)器人,它可以直接輸出動作;對于創(chuàng)作者,它可以直接輸出高質(zhì)量的像素級視頻;也可以根據(jù)任務(wù)需要進(jìn)行聯(lián)合輸出,在一個模型中統(tǒng)一完成不同任務(wù)。生數(shù)科技正在做的就是這樣一件事情 「通用世界模型」。
![]()
上面展示的是兩類模型:世界生成模型與世界動作模型。一類與今天的論壇直接相關(guān),面向數(shù)字內(nèi)容生產(chǎn)和高質(zhì)量影視生產(chǎn);另一類則是為具身智能行業(yè)提供機(jī)器人的“大腦”。
在數(shù)字內(nèi)容方向,對應(yīng)的是Vidu Q3等模型。目前,我們已經(jīng)取得了很多成果,也推動了內(nèi)容生產(chǎn)力的提升。
對于一家做基模的公司來說,我們最大的體會是,通過海量視頻數(shù)據(jù)的大規(guī)模訓(xùn)練和Scaling Law,模型可以實(shí)現(xiàn)更加精準(zhǔn)的理解,以及高動態(tài)、高一致性的生成創(chuàng)新,而且這些創(chuàng)新往往是組合式的。這些能力在過去的傳統(tǒng)方案中很難實(shí)現(xiàn)。如今,在視頻大模型中,我們已經(jīng)率先實(shí)現(xiàn)了理解和想象,也就是前面所說世界模型三項(xiàng)能力中的前兩項(xiàng)。
![]()
近期,我們還發(fā)布了實(shí)時生成模型。視頻模型不再只是簡單地生成素材,也可以成為實(shí)時交互模型。以數(shù)字人場景為例,傳統(tǒng)方式通常需要預(yù)設(shè)有限的動作模板,驅(qū)動面部表情和口型。現(xiàn)在,我們采用的是完全流式的生成方式,角色的表現(xiàn)可以更加自然、靈活,也更加擬人化。
![]()
它不僅可以實(shí)時交互,還能夠支持無限時長的連續(xù)對話。這也打開了很多想象空間。在需要流式、實(shí)時交互的場景中,可以直接使用視頻大模型提供相關(guān)解決方案。
當(dāng)前,流式視頻生成主要面臨幾方面的局限。
第一,缺少實(shí)時的用戶干預(yù);第二,缺少語音顯示控制。語言對人來說是一種非常自然的交互形式,特別是在實(shí)時交互場景中,語言是非常重要的輸入形態(tài);第三,長時間生成的穩(wěn)定性通常不足;第四,推理和部署能力不足。對于流式生成而言,無論是推理時延還是推理成本,都有非常高的要求。
針對這些問題,我們進(jìn)行了一系列技術(shù)突破。模型可以端到端地理解語音指令,實(shí)現(xiàn)實(shí)時交互和指令跟隨,完全通過對話方式,還原人類最自然的交流形態(tài)。用戶也可以定義自己的角色,通過設(shè)定人物形象、音色和相關(guān)描述,打造具有特定人設(shè)的實(shí)時交互角色。目前,模型可以實(shí)現(xiàn)540P的視頻輸出,最高幀率達(dá)到42FPS。
![]()
但我們的最終目標(biāo),并不只是停留在數(shù)字內(nèi)容生成上。無論是前面提到的Vidu視頻生成,還是Vidu S1的流式生成,都是在為進(jìn)一步走向?qū)崟r的物理交互做準(zhǔn)備。這些核心技術(shù)也可以支撐模型在物理世界中的行動。
這也是我們今年4月份發(fā)布的最新模型。它可以基于同一個模型底座,同時驅(qū)動多種異構(gòu)機(jī)器人本體,完成復(fù)雜的長程任務(wù)。
![]()
我們?nèi)〉玫囊粋€重要進(jìn)展是,基于較強(qiáng)的通用基模,可以用更加高效的方式,讓不同機(jī)器人本體快速學(xué)習(xí)復(fù)雜技能。這里展示了一些例子。用戶可能只需要給出一條文字指令,比如讓機(jī)器人完成插花、澆水等任務(wù)。模型可以理解語言描述,將任務(wù)分解為一系列步驟,并精準(zhǔn)生成完成任務(wù)所需的動作指令,最終控制機(jī)器人完成整個任務(wù)。
畫面中展示的是機(jī)器人的“大腦”,也就是我們的基座模型正在預(yù)測未來狀態(tài)。可以看到,模型預(yù)測的狀態(tài)與真實(shí)發(fā)生的狀態(tài)非常接近。這說明機(jī)器人不只是能夠執(zhí)行任務(wù),還能夠?qū)ξ磥磉M(jìn)行預(yù)測和想象,并基于這種想象,更好地規(guī)劃和輸出動作。
這也是新一代基座模型與傳統(tǒng)VLA方法最本質(zhì)的區(qū)別之一。傳統(tǒng)VLA更多是在擬合軌跡:給模型演示一定數(shù)量的軌跡,讓機(jī)器人進(jìn)行模仿,并在一定范圍內(nèi)實(shí)現(xiàn)泛化。通過生成式預(yù)訓(xùn)練機(jī)制,機(jī)器人可以基于對未來的想象來規(guī)劃動作,輸出的動作也更加可靠、穩(wěn)定、安全和高效。同時,通用基模可以支持跨場景、跨任務(wù)的泛化。
圖中展示的是傳統(tǒng)VLA范式的對比結(jié)果。藍(lán)色曲線代表我們?nèi)ツ?2月開源的版本,綠色曲線代表最新采用更強(qiáng)視頻模型的版本。圖中的結(jié)果越靠近左上角,意味著模型可以使用更少的數(shù)據(jù),學(xué)習(xí)到質(zhì)量更高的任務(wù)能力。可以看到,最新版本的提升非常顯著。
這意味著,通過通用基座模型,可以大幅提升機(jī)器人學(xué)習(xí)任務(wù)的效率和成功率。相關(guān)模型在多個榜單中也處于領(lǐng)先位置,特別是在跨場景、跨任務(wù)的泛化方面,能夠達(dá)到非常高的成功率,取得了行業(yè)領(lǐng)先的模型效果。
我們今天討論的通用世界模型,不再只是視頻模型的升級,也不是語言模型的簡單延伸,而是推動AI從生成內(nèi)容,邁向理解世界、推演世界,并與世界實(shí)時交互的新范式。
![]()
最后,我想簡單介紹一下生數(shù)科技在這一過程中的發(fā)展歷程。
生數(shù)科技從成立之初就定位于基礎(chǔ)模型,并以視頻建模作為出發(fā)點(diǎn)。在這個過程中,我們深刻認(rèn)識到,視頻模型基于對世界的深層理解,可以達(dá)到非常高的能力上限,而且這個上限仍在不斷拓展。這也是我們一直堅(jiān)持探索的方向。我們希望通過高質(zhì)量的基模,更加高效地服務(wù)高質(zhì)量內(nèi)容生產(chǎn)和具身機(jī)器人的產(chǎn)業(yè)落地。
過去短短兩年時間,大家可以看到,視頻基模已經(jīng)從最初展示技術(shù)可能性,發(fā)展到今天真正進(jìn)入產(chǎn)業(yè)、支撐生產(chǎn)力場景。這是一個非常快速的變化過程。
最后,對于未來的展望...
![]()
今天和大家分享的是基礎(chǔ)模型的故事。生數(shù)科技定位于基礎(chǔ)大模型,希望以更高的效率和更高的質(zhì)量,為合作伙伴和整個行業(yè)提供模型能力。
我們的第一個體會是,視頻數(shù)據(jù)是語言之外一種非常豐富、規(guī)模龐大且十分寶貴的信息載體,能夠記錄和描述這個世界。
第二,基于視頻的大規(guī)模預(yù)訓(xùn)練,模型可以實(shí)現(xiàn)精準(zhǔn)理解、高質(zhì)量和高一致性的想象與預(yù)測,并進(jìn)一步形成可泛化、跨任務(wù)、跨本體的行動能力。這也是我們一直致力于探索的方向。
我們已經(jīng)看到,在持續(xù)提升預(yù)訓(xùn)練能力的基礎(chǔ)上,再配合高效的后訓(xùn)練,可以推動整個行業(yè)實(shí)現(xiàn)快速迭代和落地。
這也是我們一直致力于打造的技術(shù)范式。希望能夠與在座的各位,以及更多行業(yè)同仁開展合作,共同探索通用世界模型的智能上限與產(chǎn)業(yè)落地的更多可能。
我的分享就到這里,謝謝大家!
歡迎關(guān)注【華商韜略】,識風(fēng)云人物,讀韜略傳奇。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.