![]()
一個(gè)永不結(jié)束的AI世界正式開服。720p/60fps滿血輸出,內(nèi)置雙Agent讓場景徹底「活」了,人人皆可當(dāng)造物主。
這個(gè)夏天,一部叫《后室》的電影,成了現(xiàn)象級爆款。
沒有超級英雄、沒有大場面,甚至幾乎不靠臺詞推進(jìn)。全片僅靠一個(gè)空間撐起:
霉舊的地毯、嘶嘶作響的日光燈、令人窒息的黃色墻紙,構(gòu)成了一條看不見盡頭的長廊。
![]()
然而,就在《后室》席卷全球院線的同一時(shí)刻,另一群人做成了一件更瘋狂的事——
他們用AI實(shí)時(shí)「生成」了這個(gè)走不到頭的黃色房間,還讓你能親自走進(jìn)去。
![]()
只需上傳一張圖片,讓AI生成圖中的世界,一個(gè)新世界的「大門」就打開了。
全程60秒,孤身一人徘徊在無邊無際的黃色房間時(shí),那種身臨其境的戰(zhàn)栗與恐懼,將直擊靈魂。
![]()
實(shí)現(xiàn)這一刻的,就是今天正式開源的全新一代「實(shí)時(shí)交互世界模型」——LingBot-World 2。
如今,2.0一經(jīng)發(fā)布,迅速空降Reddit熱榜,其顛覆性的實(shí)力讓全網(wǎng)為之驚嘆。
![]()
![]()
![]()
一個(gè)走不到頭的黃色房間,AI讓它「活」了過來。
它的誕生證明了一件事:AI已經(jīng)不滿足于僅僅「生成一個(gè)世界」,它現(xiàn)在要做的,是實(shí)時(shí)「運(yùn)行一個(gè)世界」。
這一次,世界自己長了出來
從「十分鐘」到「小時(shí)級」,一個(gè)不停機(jī)的世界
LingBot-World 2.0最直觀的進(jìn)化,率先體現(xiàn)在時(shí)間維度上。
一直以來,視頻世界模型都有個(gè)備受詬病的頑疾——「長時(shí)漂移」(Long-horizon Drifting)。
只要生成的時(shí)間軸一拉長,物體就開始扭曲、細(xì)節(jié)不可逆轉(zhuǎn)地塌陷、主體離奇消失、場景結(jié)構(gòu)全線崩壞。
你剛剛建好的一棟房子,鏡頭轉(zhuǎn)一圈回來,原地就成了一片廢墟。一個(gè)連「記性」都沒有的模型,談何構(gòu)建「世界」?
此前,LingBot-World 1.0憑借一套可擴(kuò)展的數(shù)據(jù)引擎和多階段訓(xùn)練,將連續(xù)無損生成做到了近十分鐘,初戰(zhàn)告捷;但這顯然不是終局。
這一次,2.0直接把度量單位換了:支持小時(shí)級時(shí)長的實(shí)時(shí)生成,且長時(shí)間運(yùn)行畫質(zhì)無可見衰減。
![]()
世界第一次能夠真正地「持續(xù)存在」,化身為一個(gè)永不停機(jī)的世界。
你可以直接把自己「生成」到雪山群峰的環(huán)抱之中。乘著滑翔傘,以第一視角翱翔在一片翠綠的山谷之上,迎面而來的,只有仿佛連綿不絕的真實(shí)視界。
上傳一張莫奈的《印象·日出》,隨著鏡頭不斷后撤,這幅原本扁平、靜止的油畫,竟直接向外生成出了一個(gè)立體的真實(shí)空間。畫外的港口、建筑與水波,全都被無縫補(bǔ)全。
![]()
不僅僅是時(shí)間維度的抗漂移,在物理空間的「錨定」上,2.0同樣展現(xiàn)出了同樣的嚴(yán)謹(jǐn)。
在神廟廢墟中,以第一視角不斷左右環(huán)顧。日光穿過石柱,光線變化如真實(shí)世界般自然,建筑群沒有出現(xiàn)任何模型常見的扭曲或形變。
![]()
騎馬穿越游戲世界,腳下的草地在實(shí)時(shí)演算并向后退去,但天際線外的巨型天體和遠(yuǎn)方城堡卻始終屹立。每一次轉(zhuǎn)動視角,世界的反饋都嚴(yán)絲合縫。
720p/60fps實(shí)時(shí)生成,跨過「游戲級」門檻
如果說時(shí)長決定了世界的耐力,那么幀率就決定了世界的「手感」。
一個(gè)世界模型要真正做到「可玩」,畫面就必須對你的每一次操作給出即時(shí)反饋,慢半拍都會讓人瞬間出戲。
這里的生死線,是幀率和延遲。而LingBot-World 2.0極大地補(bǔ)齊了這塊短板——在720p的分辨率下穩(wěn)定跑出60fps。
畫面跟著指令即時(shí)反饋,轉(zhuǎn)身、加速、急停,幾乎感覺不到延遲。
比如在「沙漠滑沙」這類高速移動的復(fù)雜場景中,它依然能保持近乎零延遲的實(shí)時(shí)演算與畫面更新。
![]()
哪怕是挑戰(zhàn)同時(shí)渲染「霸王龍?zhí)由⒒鹕絿姲l(fā)、隕石墜落且烈火蔓延」這種大片級的災(zāi)難場景,也能精準(zhǔn)拿捏極其復(fù)雜的動態(tài)光影與環(huán)境交互。
攻擊、射箭、施法,一句話改世界
橫亙在「逼真」與「世界」之間的另一道天塹,是交互太淺。
在1.0時(shí)代,你能對世界做的干預(yù)主要停留在移動和轉(zhuǎn)換視角,也就是簡單的WASD加鼠標(biāo)。
到了LingBot-World 2.0,動作庫被大幅擴(kuò)容,一口氣加入了攻擊、施法、射擊等復(fù)雜交互。
生成一個(gè)戴黑色尖頂帽、穿長風(fēng)衣的巫師,背景設(shè)定在霧氣彌漫的城市街頭。
當(dāng)你按下鍵盤觸發(fā)不同的「攻擊」指令時(shí),上一秒還在雨中漫步的角色,下一秒就會猛然揮起魔杖,釋放出極具視覺沖擊力的華麗法術(shù),將場景的沉浸感瞬間拉滿。
![]()
![]()
![]()
左右滑動查看
在令人血脈賁張的第一視角射擊游戲中,系統(tǒng)的動作解算能力更為硬核。
只需按下系統(tǒng)設(shè)定的「近戰(zhàn)」或「遠(yuǎn)程」鍵,VLM就會根據(jù)你的交戰(zhàn)距離和戰(zhàn)況需求,實(shí)時(shí)為你「捏」出最契合的戰(zhàn)斗反饋。
伴隨著滿屏飛濺的火花與極具沖擊力的爆炸光影,你可以一路摧枯拉朽,直接轟殺襲來的重裝機(jī)甲、魔法巨獸,乃至正面硬剛長著巨翼的最終Boss。
![]()
![]()
與此同時(shí),它還支持更豐富的,由文本驅(qū)動的事件注入——你可以通過直接打字來改寫世界。
從「能移動」到「能行動」,世界模型的交互維度被徹底打開了。
當(dāng)探險(xiǎn)家步入幽暗的洞穴時(shí),你可以在控制臺的輸入框里寫下「突然出現(xiàn)一群蝙蝠」。接下來,好戲開場。
只見,一群蝙蝠就會立刻從深處撲面而來,與角色產(chǎn)生極為真實(shí)的物理互動。
![]()
在控制臺敲下一句「變成冰窟」。眼前的巖洞就會在一瞬間凍結(jié)成湛藍(lán)的冰晶,一個(gè)全新的極寒秘境轟然敞開,任由NPC自由探索。
![]()
更有趣的是,在用Prompt構(gòu)建整個(gè)初始世界的時(shí)候,甚至能直接把「交互規(guī)則」一并給做出來。
比如,當(dāng)你創(chuàng)造一只在云海上滑翔的雄鷹時(shí),可以同步在設(shè)定中寫明:將「翅膀閃耀」、「風(fēng)暴襲來」、「急速側(cè)轉(zhuǎn)」等特定的干預(yù)事件,分別綁定在鍵盤的 1、2、3 鍵上。
![]()
內(nèi)置Agent,讓世界自己「長」起來
在2.0之前,幾乎所有實(shí)時(shí)世界模型,都共享一個(gè)隱藏的默認(rèn)設(shè)定:世界是被動的。
一旦失去外部輸入,整個(gè)世界就會像按下暫停鍵的電影,瞬間陷入停滯。
2.0在這里裝上了一顆會自己跳動的「心臟」,稱之為Agentic Harness。
于是,世界第一次擁有了自主性:你不操作,它也會自己往前演化。天氣會變,角色會動,新的事件會不請自來,它主動propose新的可能。
我們僅僅是上傳一張靜止的油畫,故事便開始了自我繁衍:
不一會兒,畫中的服務(wù)員端上了咖啡,街邊開始出現(xiàn)熙熙攘攘的路人、穿梭的車輛。
一個(gè)畫中的世界,正在真實(shí)地「長」出來。
一套雙層設(shè)計(jì),同時(shí)拿下「長」與「快」
LingBot-World 2.0能讓世界活起來,背后真正的核心,深植在「因果」二字里。
幾乎同一時(shí)間,螞蟻團(tuán)隊(duì)放出了一份技術(shù)報(bào)告,讓我們一起深扒背后的原理。
![]()
技術(shù)報(bào)告開宗明義,引用了大衛(wèi)·休謨《人性論》的一句話——原因必先于結(jié)果。
因果推理的第一原則是:結(jié)果永不先于原因,未來由過去塑造,反之則不成立。
這一次,2.0把這條哲學(xué)原則,直接寫進(jìn)了架構(gòu)。
![]()
它把世界模擬形式化為一個(gè)沿時(shí)間軸的因果生成過程:每一個(gè)狀態(tài),只依賴它的歷史上下文與當(dāng)前輸入。
團(tuán)隊(duì)在訓(xùn)練全程原生地強(qiáng)制這種「因果性」。
![]()
在此之上,是一套「教師-學(xué)生」的兩階段設(shè)計(jì),堪稱整篇論文的骨架。
第一階段是預(yù)訓(xùn)練,先煉一個(gè)「教師」。
一個(gè)能長時(shí)間穩(wěn)定、且能被動作精確控制的「因果世界模型」。
為了對付前面那只漂移虎,團(tuán)隊(duì)設(shè)計(jì)了一種叫MoBA(雙向與自回歸混合)的注意力掩碼。
通俗說,就是在保證「只能看過去、不能偷看未來」的前提下,又給模型補(bǔ)了一點(diǎn)全局視野,專門用來抑制長序列里的過擬合和畫質(zhì)塌陷。
這一步換來的,是報(bào)告反復(fù)強(qiáng)調(diào)的一個(gè)詞:抗漂移(anti-drifting)。
![]()
但光有一個(gè)強(qiáng)大的「教師模型」還不夠,它太慢,沒法實(shí)時(shí)生成。
于是第二階段后訓(xùn)練階段,再蒸餾出一個(gè)「學(xué)生」。
即用一致性蒸餾把去噪步數(shù)大幅壓縮,再用「分布匹配蒸餾」(DMD)提升畫質(zhì)、壓制漂移。
最關(guān)鍵的是,模型自己長時(shí)間跑出來的軌跡上做校正,進(jìn)一步壓住累積誤差。最終,它能在720p分辨率、60fps幀率下,撐起一個(gè)永遠(yuǎn)不必結(jié)束的可交互世界。
而這套設(shè)計(jì)究竟成不成,論文給了一個(gè)近乎「耐力賽」的證據(jù)——
長達(dá)一小時(shí),跨越20個(gè)不同場景,從竹林運(yùn)河一路走到月宮、地球之窗,全程畫質(zhì)沒有可見的衰減。
因此,它的穩(wěn)定,是一種結(jié)構(gòu)性的屬性,而非某段「運(yùn)氣好」的短片才有的曇花一現(xiàn)。
裝上大腦與小腦
讓「死」的世界活過來,也是LingBot-World 2.0真正想講的故事。
為此,它裝了一顆會自己跳動的「心臟」,團(tuán)隊(duì)將其稱之為Agentic Harness。這是一套很妙的「大腦—小腦」協(xié)同架構(gòu)。
一個(gè)視覺語言模型(VLM)當(dāng)「大腦」,負(fù)責(zé)宏觀的語義規(guī)則與因果推理。它持續(xù)觀察當(dāng)前畫面、預(yù)判用戶行為的邏輯后果,然后拋出一個(gè)個(gè)明確的「事件提案」。
而底層的視頻生成模型(DiT)當(dāng)「小腦」,負(fù)責(zé)把這些語義決策落地成符合物理直覺、連貫流暢的畫面。
大腦想,小腦做,一個(gè)負(fù)責(zé)「接下來該發(fā)生什么」,一個(gè)負(fù)責(zé)「把它畫出來」。
![]()
因此,這套框架里跑著兩個(gè)各司其職的Agent:Pilot Agent + Director Agent。
Pilot Agent,負(fù)責(zé)規(guī)劃和執(zhí)行角色的行為;
Director Agent,像一位隱形的導(dǎo)演,在場景推進(jìn)的過程中,基于當(dāng)前世界的狀態(tài),實(shí)時(shí)生成并注入新的事件與環(huán)境元素。
一個(gè)當(dāng)演員,一個(gè)當(dāng)導(dǎo)演,兩者合力,把一個(gè)「逐幀預(yù)測器」真正變成了一個(gè)像模像樣的世界:
自我維持、目標(biāo)驅(qū)動、開放無盡,沒有誰在背后逐幀寫好劇本。
而人類和這個(gè)世界打交道的方式,也一下子豐富了起來。
一種是「直接語義交互」:做個(gè)動作,大腦就地判斷合不合物理常識、該發(fā)生什么后果。
另一種是「物體級交互」:借助SAM分割追蹤,選中場景里某個(gè)具體物體,對它單獨(dú)下指令,系統(tǒng)會一路追蹤它、保持空間一致。
于是,一個(gè)雙向演化的循環(huán)第一次真正閉合——
你的每一次動作都在改寫世界狀態(tài),而「大腦」又根據(jù)新的世界狀態(tài),不斷拋回新的事件與意外。
你影響世界,世界回應(yīng)你,再反過來給你驚喜。
從「被動響應(yīng)」到「主動演化」,這是LingBot-World 2.0與所有停留在「生成」層面的模型之間最深的一道分水嶺。
一個(gè)「活世界」,能長出多少種未來?
當(dāng)世界能持續(xù)運(yùn)行、能自我演化、能多人共享,它的價(jià)值就遠(yuǎn)不止「好玩」兩個(gè)字。
最先被點(diǎn)亮的,大概是游戲和創(chuàng)作。
過去做一款開放世界,得靠一支團(tuán)隊(duì)一磚一瓦把地圖、劇情、事件全都預(yù)先寫死。
而在LingBot-World 2.0里,直接開一臺服務(wù)器,讓世界自己生長,劇情不必事先編排,玩家走到哪,世界就演化到哪。
對創(chuàng)作者來說,這幾乎換了一門手藝:與其逐幀去摳畫面,不如像導(dǎo)演一樣,用一個(gè)個(gè)Action和Event去調(diào)度一個(gè)會自己運(yùn)轉(zhuǎn)的片場。
![]()
屏幕之外,一個(gè)能持續(xù)演化、事件豐富、還能隨你交互的虛擬世界,恰恰是機(jī)器人夢寐以求的訓(xùn)練場。
真實(shí)世界里,讓機(jī)器人試錯(cuò)一次的成本高得嚇人;而在一個(gè)高保真的「數(shù)字演練場」里,它可以低成本地跑上千萬次。
![]()
自動駕駛,同樣如此。
AI世界能把一些極端情況造出來,讓車在虛擬馬路上反復(fù)練,練到形成「肌肉記憶」。
等它真正上路那天,這些要命的瞬間,它早在數(shù)字世界里經(jīng)歷過千百回了。
而對學(xué)術(shù)圈來說,2.0更是一塊難得的「公共地基」——一個(gè)開源的、事件驅(qū)動的、會自我演化的世界底座,誰都可以拿去接著往下研究。
多人同服,1.3B單卡可跑
Lingbot-World 2.0還專門開發(fā)了一套接口,支持多人同時(shí)進(jìn)入同一個(gè)世界。
![]()
這一次,2.0一共提供了兩個(gè)開源版本——
一個(gè)是14B主模型,面向最強(qiáng)畫質(zhì)、研究驗(yàn)證與復(fù)雜交互世界;
另一個(gè)是1.3B輕量模型,專為普及而生,一張消費(fèi)級顯卡就能輕松部署。
主模型負(fù)責(zé)把能力上限頂?shù)阶罡撸p量模型負(fù)責(zé)把社區(qū)可用性拉到最廣,二者兼顧,誰都不落下。
如今,Lingbot-World 2.0權(quán)重、代碼與在線體驗(yàn)入口,都已隨論文一并放出——
Website:
https://technology.robbyant.com/lingbot-world-v2
Model:
https://huggingface.co/collections/robbyant/lingbot-world-v2
https://modelscope.cn/collections/Robbyant/LingBot-World-V2
Code:
https://github.com/Robbyant/lingbot-world-v2
在線體驗(yàn)地址:
https://www.reactor.inc/lingbot-world-v2
Tech Report:
https://github.com/Robbyant/lingbot-world-v2/blob/main/paper.pdf
另外,所有人還能通過螞蟻靈光App的「世界模型」功能,在手機(jī)上直接走進(jìn)這個(gè)AI世界。
文章來源:新智元。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.