![]()
7月19日,在2026世界人工智能大會期間,昆侖萬維主辦世界模型與多模態范式躍遷論壇,昆侖萬維董事長兼CEO方漢提出,2026是世界模型元年。他表示:“AI不再只停留在生成內容,他開始理解世界怎么運行,預判行動會帶來什么結果。我們篤定判斷2026年是世界模型的元年。”
這一判斷的背后,并不只是模型從文本、圖像、視頻走向更復雜生成任務的線性延伸。在方漢看來,真正的分水嶺在于,模型能否在更低成本的數據供給下持續擴展,并由此獲得對陌生環境的理解、預測和泛化能力。接受對話時,他將技術路線概括為:不同路徑最終會向端到端的世界模型收斂,只有能夠規模化擴展的路線,才可能支撐通用能力的繼續提升。
![]()
(昆侖萬維模型產品矩陣)
以視頻模型為參照,方漢認為,當數據量達到足夠規模,模型能力會出現明顯躍遷;而具身智能和視覺世界模型也需要跨過相似的門檻。他預計,真正推動端到端模型能力躍遷的數據量,可能至少需要千萬小時量級。眼下行業中可用數據仍處于較早階段,如何用更低成本采集到覆蓋更多場景的數據,決定了世界模型能否從概念走向可擴展的工程體系。
在他看來,第一視角視頻數據是重要變量。與必須在真實機器人上完成的采集相比,手機、頭戴設備等記錄下的人類操作視頻,成本更低、場景更多,也更容易形成規模。方漢透露,團隊曾以約20萬小時第一視角數據做小規模驗證,在RoboCasa 365基準測試中將模型表現提升約8個百分點。他強調,這還不是大規模訓練后的結論,但已經說明,第一視角數據能夠為世界模型的擴展提供一條值得繼續驗證的路徑。
這也解釋了昆侖萬維從虛擬世界走向物理世界的調整。方漢在對話中表示,公司此前在視頻、游戲世界模型上的積累,與具身智能所需的部分技術能力具有連續性;面向真實機器人,問題則從“能否生成”進一步變為“能否理解動作后果,并在開放環境中泛化”。他認為,物理世界的約束會壓縮無依據生成的空間,真正困難的是面對不同家庭、工廠和任務時,模型能否保持穩定的理解與決策能力。“后訓練非常重要,因為沒有后訓練,你就沒辦法往真機上落。”方漢說。
據了解,針對具身智能賽道,昆侖萬維近日成立了黎曼動力機器人公司,至此,形成了在“世界模型+具身智能+AI音樂生成”全模態賽道上的完整布局。
對于具身智能方向,方漢在現場提出:“世界模型將走出屏幕,走進物理世界,為此我們帶來了黎曼1.0,它讓機器人在行動之前先做推演,環境會怎么變化,動作會帶來什么后果,出了意外該怎么調整。我們相信具身智能未來的競爭不會停留在某一臺機器、某一項任務上。誰能訓練出在陌生環境里仍然能看得懂、做得對的通用模型,誰就能拿到物理智能時代的入場券。這也是中國智能制造和機器人產業真正需要的底層能力。”
而相比物理世界,游戲或許會更早承接世界模型的產品化。方漢在現場判斷,未來3到5年,世界模型會成為游戲行業的基礎設施,內容生產的方式會被徹底刷新。
游戲之外,音樂是昆侖萬維押注的另一條內容賽道。方漢表示:“AI音樂將從技術實驗變成大眾創作工具。Muerka是全球前兩名的音樂生成大模型,也是第一款真正沒有AIV的音樂生成大模型。過去很多AI音樂聽起來規整但缺少溫度,聽完記不住,而Muerka要解決的就是這個問題。我們認為當普通人也能把一個模糊的靈感變成一首完整的有情緒的歌,音樂產業的創作生態就會發生根本性的變化,這不是替代音樂人,而是讓創作的門檻降下來,讓更多人有機會表達自己。”
對于商業化,方漢的判斷相對直接:“付費意愿最高的肯定是視頻和音樂。”他認為,生成式內容降低了專業創作門檻,也會帶來更長尾的需求。海外用戶的訂閱習慣更成熟,國內則仍以免費使用為主,但在編程、視頻和音樂等場景中,訂閱與按調用量付費已經出現。隨著推理成本繼續下降,免費產品與付費服務也可能在不同能力和場景間并存。
最后,方漢總結道:“三個模型,三個產業預判背后是同一個方向,讓AI從會生成走向懂世界能行動。這不僅是我們一家公司的回答,也是中國AI從研發走向產業應用的一個縮影。2026年世界模型元年,昆侖為率先交卷。”(定西)
