![]()
![]()
黃鐵軍發表智源大會閉幕演講
出品|搜狐科技
作者|梁昌均
“智能之路——吾道一以貫之。”在6月13日落幕的第八屆智源大會上,北京大學教授黃鐵軍在閉幕演講中如此作結這些年探尋智能之路的感悟。
他另一更為人熟知的身份是——北京智源研究院理事長。
2018年,也就是GPT-1出現的那一年,以及成為AI主流架構的Transformer誕生的后一年,黃鐵軍作為創始院長參與成立智源研究院,其成為國內最早開啟大模型研究的機構之一。
六年后,黃鐵軍卸任院長成為智源理事長,具備豐富產研經驗的王仲遠接任院長,兩人攜手開啟新一輪的智能之旅。
當年春節期間,Sora橫空出世,預示著大模型從語言加速拓展到多模態領域。雖然Sora最終走向關閉結局,但其提出的世界模擬器概念一定程度啟發了如今火爆的世界模型。
智源也未停止探索腳步。從悟道系列,到悟界系列,智源的研究重心從語言模態擴展到多模態,再到如今的世界模型,持續推動AI從數字世界走向物理世界。
此次大會,智源帶來多款基座模型,包括全球首個通用世界基座模型悟界·Physis-v0.1、全球首個理解與生成統一的多模態神經科學大模型悟界·Brainμ1.0等,并透露正在研發具身智能模型悟界·RoboBrain Orca。
智源希望定義推動AI技術的新變革、新范式。搜狐科技參會也感受到,今年智源大會重點已轉向世界模型、具身智能,有關論壇爆滿,具身CEO們成為被觀眾圍堵的明星新勢力。
大會前后,搜狐科技先后對話了黃鐵軍和王仲遠。他們分享了AI下一代發展范式,闡釋了為何世界模型將是具身智能突破和邁向AGI的必經之路,以及對AI未來發展的思考。
![]()
從預測Token到預測狀態
如果要評選出今年智源大會最熱的一個詞,那可能非世界模型莫屬。這正反映了智源在AI前沿方向上的探索和引領——從大語言模型,到多模態,再到世界模型。
這背后也將是一次重大的AI范式的轉變。
“Next Token Prediction做到極致之后,我們深刻感覺到AI正在孕育巨大的范式變革,就是演進到Next State Prediction或者Next Physical State Prediction。”王仲遠表示。
早在兩年前,智源就提出世界模型將是AI下一個重要的演化方向,隨后發布悟界·Emu3和·Emu3.5,推進多模態世界模型的演進,并希望構建面向物理世界的AI基座模型。
世界模型并非全新概念。早在1943年,心理學家Kenneth提出的“心智模型”被廣泛被認為是世界模型的理論源頭。
隨著具身智能爆發,以及圖靈獎得主楊立昆、斯坦福李飛飛等人的推崇,世界模型今年以來越來越受關注。但概念缺乏共識,如視頻生成模型到底是不是世界模型,業內就存在爭論。
李飛飛此前發文就提到,世界模型是當今AI領域最重要、最被濫用的術語之一。計算機視覺、機器人學、強化學習和生成式AI都在聲稱正在構建世界模型,但所指的東西截然不同。
她按照功能將世界模型分為三類:輸出像素的渲染器,輸出狀態的模擬器,輸出行動的規劃器。“當三者開始融合,實現統一的世界模型,才意味著AI真正走向理解世界。”
智源則根據技術路線對世界模型進行了分類。第一類是以語言為中心的世界模型,如大語言模型、VLM、VLA。第二類是以像素為中心,如視頻生成模型,以及WAM(世界動作模型)。
第三類是以三維結構為中心的世界模型,包括3D重建,李飛飛提出的空間智能即為此類。第四類則是以視覺表征為軸心的世界模型,楊立昆提出的JEPA就是以此為起點。
“這些都是在往真正的世界模型走近的過程,可能都抓住了某一個方面的特征,就跟盲人摸象一樣,世界模型大概現在還處這么一個早期的階段。”黃鐵軍表示。
王仲遠認為,這些世界模型距離真正面向物理世界的基座模型都有很大距離,現在對怎么訓練世界模型,技術沒有收斂,數據遠遠不夠,沒有找到方法路徑,也需要開展評測等工作。
![]()
他表示,智源希望正本清源,讓大家意識到世界模型的核心本質是下一個物理狀態的預測。只有當行業形成共識以后,訓練模型的數據和方法才會收斂和歸攏。
對于世界模型面臨的瓶頸,王仲遠認為,數據肯定是缺乏的,特別是真實物理世界的數據。
在黃鐵軍看來,世界模型的數據模式將發生變化,不再是之前的離線、靜態方式,而是要需要越來越多的在線、實時的交互性的數據。
“隨著穿戴式設備越來越多,人在工作生活中更多地被數字化,這些第一視角、實時同步采集的數據,將成為未來世界模型特別重要的數據來源。”黃鐵軍表示。
王仲遠甚至判斷,隨著AI硬件越來越多,并不斷采集大量真實物理世界數據以后,有了物理世界的互聯網,才有可能真正催生跨時代的世界模型。
對于世界模型,智源希望走一條新路——語言和視覺融合,即潛空間表征。通過壓縮各類多模態數據,原生統一訓練、統一建模,在統一潛空間表征各種真實物理世界的狀態。
“我們認為將來統一的潛空間建模不僅僅是視覺空間,而是全模態潛空間,很有可能是世界模型真正下一個可能的路徑。”王仲遠表示,不排除世界模型也將形成大一統。
黃鐵軍表示,作為研究機構,智源做世界模型會堅持獨創的技術路線,已經證明可行的部分,會批判地用,但一定也會有創新和領先的地方。
![]()
具身智能突破的關鍵
談及世界模型和AGI的關系,黃鐵軍認為,世界模型是其中最重要的部分,就像大腦是人身體最重要的部分一樣。
“但原則上講,世界模型是為具身智能而生的。”黃鐵軍解釋稱,具身智能的剛需或特點是很多時候是靠機器人看見、聽見,感知此時此刻是這樣,然后推想未來什么樣。
因此,真正面向具身智能的世界模型應該是:要有傳感器,包括眼睛、聽覺、觸覺,在盡可能多的輸入情況下,又能對未來一段時間做出推測,而且要精準、準確。
王仲遠同樣認為,世界模型很有可能是具身智能實現更大突破的重要基座模型的關鍵,而具身模型將是世界模型很重要的應用場景。
目前,具身智能行業提到的世界模型更多的是以像素為中心(如VLA)或者以視頻生成和Action的聯合訓練,并聚焦某個或某些場景進行布局。
“這是目前大多數具身智能企業的做法,不需要泛化到所有的場景里面去,能把其中明確的場景做好就可以了。”
黃鐵軍認為,做VLA還是世界模型,這兩件事并不矛盾。“企業一定是用比較成熟的技術來解決比較明確、特定場景的問題,但從研究機構角度來說,肯定還是希望具身智能實現通用水平。”
不過,王仲遠認為,這類技術路線依然是治標不治本的方法。
他提到,為什么現在機器人不能像人類一樣到處走,執行各種任務?因為缺乏世界常識、物理規律,雖然可以在操作臺、流水線上很好完成一些特定任務,但不具備泛化性和通用性。
但不同于人對真實物理規律很容易理解,目前具身模型還難以掌握物理規律、物理常識等知識,也不具備時間和空間等感知和決策推演,導致模型難以在真實世界規模應用。
黃鐵軍表示,目前還有很多優化工作要做。現在能采到圖像、采到視頻,就直接拿來訓練,還沒到精細化考慮視覺信號到底應該怎么表達、計算應該如何更有效,這些工作才剛開始。
同時,他認為,目前具身智能采集和獲取數據的方式應該進行模型變革,要考慮成本、合理性、便利性等因素。
“現在機器人行業都在搞很多數據采集中心,用機器人或人控制機器人去采集數據,這可能是一種成本不一定合理的方式,而人戴上設備邊工作邊采數據的方式則相對合理。這些第一視角的數據是很好去訓練具身智能或世界模型的數據,成本比原來要降很多。”
黃鐵軍強調,機器人一定要對物理世界有自己的模型,掌握萬事萬物的規律,但現在還在早期階段。雖然目前行業有各自打法,將來可能會有通用的具身大腦作為基礎,每種機器人或每個企業根據需要再去微調,再去做自己的垂類模型。
他判斷,短期以人作為參照物,至少在做工作的時候,機器人大概未來兩三年有可能達到人的水平,同時希望它像人一樣在有限的低功耗情況下更靈敏、更精確。
![]()
AI自進化后將不可控
對于世界模型的未來,王仲遠判斷,真正的世界模型誕生至少還需要好幾年的時間,很可能卡在一個地方三五年都沒有突破,也可能突然就突破了。
“未來三到五年都會是世界模型持續演進和迭代的階段,期待隨著數字世界大模型的成熟,能夠加速面向物理世界AI基座模型、世界模型的迭代和演進。”
這也正是黃鐵軍分享的“吾道一以貫之”的內在含義。“智源雖然做了這么多方向,但主線就是做越來越強的智能系統,越來越像人。”
這具體有兩個方法論。一個是結構決定功能,Transformer就是結構,可能有革命性的變革。“AI長遠發展,需要探索比Transformer更強大、更高效的神經結構和身體結構。”
另一個則是功能塑造結構,原來通過語言、多模態,現在利用實時數據、腦數據去訓練,都是為了把模型的功能運轉起來。
黃鐵軍還回顧了智源大會兩年前的提出的AGI演進五級時間表,認為目前已達到Level 1(認知超人),人類面臨“躺平”或“理性信任”的選擇,具身超人的Level 1預計2035年左右實現,最高層級的Level 5表示脫離人類知識和大腦架構,可能意味著AGI獨自探索宇宙。
![]()
隨著AI能力的越發強大,人類社會對它的風險擔憂也越發強烈。Anthropic此前發文表示,AI將朝著遞歸自我進化(CSI)的方向演進。圖靈獎得主辛頓則多次表示,AI系統已經具備了某種程度的自主意識。
黃鐵軍表示,這涉及到意識的定義,如果狹義的意識是人的意識,AI肯定還沒有,但現在很多AI系統確實表現出來一種有意識的智能主體的行為反饋。
“你怎么對待它,它的行為會產生很大的不同,圖靈測試也是從行為的角度來定義。從這個意義上講,說AI有意識,也不能說不合理。”
對于AI是否會自我進化,黃鐵軍認為,這是可行的,但是不可控。從它現在具備的智能行為來說,它有可能實現復制自己、保護自己,甚至自進化。
“AI真正的自進化差不多已經在危險邊緣,一旦實現自進化,智能程度遠超人類之后,那真的不可控。”
這可能會給人類社會帶來巨大的變化沖擊。“人類現在有很多不可控,外星人來了,行星撞地球,不是只有AI不可控。”黃鐵軍則相對樂觀地相信,AI和人有很大概率可以共存。
王仲遠表示,目前AI安全問題更多不再是暢想類,而是實實在在的問題。“我們還是非常樂觀地相信會創造出新的增量價值和新的機會,人類要和新技術共存,伴隨演進和演化。”
他強調,全世界已經經歷過幾輪大的技術發展,都有應對經驗,相信人類社會有能力應對。“但這不是一家科研機構能單獨解決的,而是需要大家共同努力。”
![]()
![]()
運營編輯 | 曹倩 審核|孟莎莎
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.