7月19日,正值2026世界人工智能大會(WAIC)期間,昆侖萬維“世界模型與多模態范式躍遷”專場論壇在上海西岸國際會展中心隆重舉行。作為深耕AI科技領域的領軍企業,昆侖萬維在這場論壇上宣布核心模型重磅升級——Matrix-Game 3.5世界模型、Mureka v9.5與O3音樂模型,全面覆蓋世界模型、AIGC創作等前沿賽道。昆侖萬維董事長兼CEO方漢在論壇上宣布:2026年為“世界模型元年” ,標志著AI從內容生成走向對物理世界的理解與交互的關鍵轉折。
![]()
![]()
本屆WAIC的規格之高,前所未有。國家主席習近平出席大會開幕式并發表主旨講話。這是WAIC舉辦以來,首次由最高層級領導人出席。大會由外交部、國家發展改革委、工信部等十余個部委與上海市政府共同主辦。展覽總面積首次突破10萬平方米,1100余家企業參展,3000余項展品集中亮相,超300款產品全球首發。智算、具身智能兩大核心賽道各匯聚超200家企業。140余場論壇密集舉行,9位圖靈獎、諾貝爾獎得主到場分享。這是一場真正意義上的國家級、國際頂級AI盛會。
方漢:2026是“世界模型元年”,三大產業預判錨定未來方向
在論壇主旨演講環節,昆侖萬維董事長兼CEO方漢正式宣布2026年為“世界模型元年” 。他指出,過去兩年AI行業的核心命題是“生成”——生成文字、圖像、視頻、音樂。而從2026年開始,AI的核心命題將轉向“理解”與“交互”——讓AI真正理解物理世界的運行規律,并能與真實環境進行閉環互動。世界模型正是實現這一跨越的關鍵技術底座。
![]()
昆侖萬維董事長兼CEO方漢
方漢在演講中系統闡述了三大產業預判:
第一,世界模型將走出屏幕,進入物理世界。我們洞察到,具身智能正從實驗室走向真實環境,這一趨勢要求機器人在行動前先進行環境推演——預判動作后果、評估環境變化、及時調整應對策略。這種能力的突破,將使競爭焦點從單一任務轉向陌生環境下的通用模型能力;誰能訓練出在復雜場景中依然“看得懂、做得對”的模型,誰就拿到物理智能時代的入場券,這也是中國智能制造和機器人產業真正亟需的底層能力。
第二,游戲行業將率先被世界模型改變。開放世界游戲不再依賴數百人團隊數年的手工搭建,Matrix-Game 3.5 讓虛擬世界隨玩家行動實時生長、持續演化。未來三到五年,世界模型將成為游戲行業的基礎設施,徹底刷新內容生產方式,而國產模型已在這一賽道領跑全球。
第三,AI音樂、AI視頻等工具將從技術試驗變成大眾創作工具,促進 AIGC 的深層發展。Mureka 作為中國最強、全球前兩名的音樂生成模型,率先去除“AI味”,讓普通人也能把模糊靈感轉化為有情緒、有溫度的作品。這并非替代音樂人,而是大幅降低創作門檻,讓更多人的表達得以釋放,從而根本性改變音樂乃至整個 AIGC 產業的創作生態。
三個產業預判,背后是同一個方向:讓AI從“會生成”走向"懂世界"、"能行動"。方漢表示,這不只是昆侖萬維一家公司的回答,更是中國AI從研發走向產業應用的一個縮影。
AI模型全球升級,掀起全模態內容生成革命
本次論壇上,昆侖萬維集中完成了核心模型的全球重磅升級。
2.1 Matrix-Game 3.5:Patch級記憶注入,重新定義交互世界模型
作為昆侖萬維世界模型系列的最新迭代,Matrix-Game 3.5在本次論壇上帶來了革命性的技術升級。
Skywork首席科學家成宇在論壇上正式發布了Matrix-Game 3.5世界模型。Matrix-Game 3.5聚焦可交互世界模型技術,實現了Patch級別的記憶注入與系統級性能優化,5B模型在720p分辨率下可實現單卡20FPS實時生成,具備1分鐘記憶能力。
![]()
Skywork首席科學家成宇
成宇指出,世界模型是具身智能的“無限數據引擎”。傳統數據采集面臨人工成本高昂、實機采集耗時耗力、效率極低的痛點,無法滿足大模型規模化需求。Matrix-Game 3.5構建了支撐下一代世界模型的無限數據生產體系,突破傳統瓶頸,打造三條自動化數據生產管線,輸出Video+Pose+Action+Language的高質量訓練數據,目前已積累超500萬高質量視頻切片、超1萬有效訓練小時數、覆蓋1200余個游戲場景。
在技術架構上,Matrix-Game 3.5創新性地將歷史幀切分為帶有3D坐標的Patch Memory(通過Depth+Pose Lift到世界坐標系),推理時根據當前相機視錐檢索可見Patch并重新投影到當前視角形成Mosaic,再作為Memory Token注入DiT,實現長期一致性的Patch級空間記憶。這一設計將Frame-level FOV Memory升級為Patch-level FOV Memory,帶來四大核心優勢:更準確的空間記憶檢索與跨幀一致性、更穩定的相機運動生成、最大程度保留基座模型動態生成能力的In-context Learning、以及用戶可自由編輯記憶塊的可控記憶能力。
此外,Matrix-Game 3.5在推理加速層面實現了DiT推理與VAE解碼的全鏈路優化,通過“減少模型吞吐+DiT模型優化+VAE剪枝”三重手段,達成單卡20FPS 720p實時推理的業界領先性能,讓高質量世界模型真正具備實時交互能力。
Matrix-Game從1.0到3.5始終堅持開源路線。3.5版本宣布核心架構開源,吸引全球開發者共建生態。Matrix-Game 2.0是實時交互式世界模型技術范式中首個開源的實現方案,Matrix-Game 3.0則首次系統性地將記憶問題納入開源解決方案。
此前,DiT作者、紐約大學助理教授謝賽寧團隊基于Matrix-Game 2.0的開源底座,發布了全球首個多人視頻世界模型Solaris,也從學術圈的實際使用上印證了這套開源方案的基礎模型價值。NVIDIA和浙大聯合發布的工作Light Interaction基于Matrix-Game 3.0模型進行研發。另外,NVIDIA的SANA-WM和Adobe的RELIC等國際頭部大廠世界模型均將Matrix-Game相關模型作為對比基準。
2.2. Mureka v9.5與O3:最沒有AI味的AI音樂模型,讓音樂進入“版本化制作”時代
Mureka v9.5&O3 音樂大模型的發布,成為本次論壇最具情感沖擊力的時刻之一。
從SkyMusic 1.0內測到Mureka v9.5&O3,昆侖萬維的音樂模型走過了一條從“作品成立”到“創作可控”再到“多模態創作”的演進路徑。而v9.5版本首次喊出 “最沒有AI味的AI音樂模型” 這一口號——它不再依賴聲部堆砌和復雜編配制造“厲害”的第一印象,而是在真實的音樂框架中,以更為克制的方式處理編配、人聲、情緒與Prompt意圖,讓音樂表達更自然、更真誠。O3 建立在新版 V9.5 之上,并通過 test-time scaling 擴展 MusiCoT 的推理過程。它不是簡單地“生成得更多”或“想得更久”,而是讓模型在生成過程中持續審視當前表達:局部旋律是否仍服務全曲目標,編配是否遮蔽人聲,情緒是否提前透支,結構是否正在偏離最初意圖。額外推理空間被用于回看偏差與自我修正,使音樂 CoT 能夠逐步收斂,而不是一次決定后一路向前。
![]()
歌曲的主觀評分
從評測結果看,V9.5 沿著 MusiCoT 路線完成了更扎實的底座升級:旋律、人聲、音質和編曲全面提升,指令精準度從 6.92 提升至 7.62。它不再把“更滿、更復雜”當作唯一標準,而是在真實音樂框架中更克制地處理編配、人聲、情緒和 Prompt 意圖,讓歌曲更自然、更真誠。O3 則建立在 V9.5 之上,通過持續推演、回看偏差和修正后續決策,進一步強化旋律發展、編曲結構與指令理解,使歌曲結構更完整、情緒更連貫、段落關系更合理。簡單來說,V9.5 負責把歌做得更自然,O3 負責讓模型在交付前多看、多想、多修一遍。
今天,一首歌經常和視頻一起被消費。短視頻、游戲、影視預告、品牌片和虛擬人演出,都需要聲音與畫面共同表達。
Mureka 這次重磅升級,也把音樂與視頻 MV 接進了同一條創作鏈路。用戶可以從一張圖、一段視頻或 moodboard 開始,讓系統理解畫面的節奏、人物、空間和情緒,再生成與之匹配的音樂;當然,也可以從一首歌開始,讓 Agent 理解歌詞敘事、節拍編曲和情緒起伏,繼續生成角色與 MV 的視覺方案。歌詞決定敘事、節拍決定剪輯、旋律決定記憶點、畫面決定傳播場景。Agent 要做的,是讓這些信息在同一個創作目標下持續傳遞,而不是把幾個生成工具簡單拼在一起。
更為重要的是,Mureka已從單一的音樂生成工具演進為完整的“版本化制作”平臺。其差異不僅來自模型效果,更來自“模型訓練—推理時選優—版本化創作工具—平臺分發”的系統組合。同一創意可快速生成多版本,支持在旋律、人聲、結構等維度進行局部保留與替換;Studio將“操作DAW”轉化為“指揮創作”,降低門檻、抬高上限。同時,Mureka推出Character功能——一段聲音、一張照片即可生成專屬歌手角色,并貫穿歌曲、MV全鏈路;AI配樂能自動分析視頻畫面的場景、動作與情緒,創作更貼合內容的音樂;Mureka Agent則通過自然語言一次對話調用整曲生成、單軌生成、Remix、延伸、MIDI導出、聲音克隆等全部能力,全程無需切換界面。
正如昆侖萬維所提出的愿景:AI音樂不再是簡單的消費內容,而是升級為一種自我表達的語言。用戶不僅是被動聆聽者,更是主動表達者與參與者。Mureka正以模型能力、創作工具與平臺分發的完整閉環,重新定義AI時代的音樂創作生態,讓每個普通人的靈感都能有溫度地落地,從“一個想法”到“歌詞—人聲—角色—歌曲—MV”的完整創作鏈路,全面釋放AIGC的深層創作力。
院士與行業領袖齊聚,共話世界模型未來
本次論壇還邀請了多位重量級嘉賓。中國科學院院士、南京大學教授、副校長周志華受邀發表主旨演講,圍繞世界模型的前沿方向展開了深度分享。此外,我們邀請了黎曼動力機器人創始人劉揚教授和Reactor Technologies, Inc. CEO兼聯合創始人Alberto Taiuti分別介紹了黎曼機器人模型 1.0 版和Reactor加速世界模型在全球落地的經驗。
![]()
中國科學院院士、南京大學教授、副校長周志華
中國科學院院士、南京大學副校長周志華教授在題為《關于世界模型的討論》的主旨演講中,將世界模型劃分為感知層、理解層與決策層,并著重指出決策層世界模型長期面臨“多步推演復合誤差平方級放大”與“樣本復雜度過高”兩大理論瓶頸。
他分享了團隊的最新突破:通過分布匹配技術可將推演誤差從平方級壓至線性級,驗證了長序列推演的可行性。同時,通過創新性地逆向運用貝爾曼方程,將所需樣本量降至原來的根號T分之一,為在戰斗機操控、智能工廠等代價高昂的現實任務中構建決策世界模型提供了理論基礎。他還提出“學件”概念——由模型與AI自動生成的“規約”共同構成,允許多個異構模型在不公開數據的前提下進行復用與組裝,為世界模型從單產線定制走向可成長、可演化的模型生態開辟了新路徑。
![]()
黎曼動力機器人創始人劉揚教授
黎曼動力機器人近期推出的 Riemann-1.0,是其成立以來首個公開發布的成果——面向 Physical AI 的新一代 Embodied World Action Model。該模型基于超過23.2 萬小時多源具身交互數據訓練,統一融合第一視角人類視頻、UMI 示教與異構機器人軌跡,并提出全因果世界動作建模架構與三階段漸進式具身預訓練框架。Riemann-1.0 不再停留于仿真環境中的離線評估,而是在多個國際主流機器人 Benchmark 與真實機器人任務上同步實現仿真與真機雙 SOTA,為機器人操作、實時自適應控制及高頻人機協作等 Physical AI 場景提供了從“理解世界”到“干預世界”的生成式行動基礎設施。
![]()
真機評測:四大家居任務全面領先
Reactor Technologies, Inc. CEO兼聯合創始人Alberto Taiuti 則從產業落地角度指出,世界模型已從靜態、高延遲、無狀態的媒體生成范式,躍遷至有狀態、實時交互、具備因果邏輯的新范式。他強調,世界模型不再只是生成視頻或圖像,而是能夠持續推演環境變化并支持雙向人機交互的“生成式軟件”雛形。他以公司同名平臺“Reactor”為例,展示了為世界模型原生設計的開發者基礎設施如何在保持極低延遲與流式傳輸的同時,支持機器人、游戲、仿真等高頻交互場景。
![]()
Reactor Technologies, Inc. CEO兼聯合創始人Alberto Taiuti
在具身智能對談環節,黎曼動力機器人創始人劉揚與破殼機器人創始人、清華大學交叉信息研究院助理教授許華哲圍繞“具身世界模型的ChatGPT時刻”展開深度對話,探討了世界模型與VLA的邊界、機器人通用世界模型的訓練瓶頸、具身智能的Scaling Law以及家庭機器人PMF等核心議題。
![]()
全模態內容革命:AI重塑視頻、游戲、音樂與全球文娛
論壇壓軸環節舉行了“全模態內容革命——AI重塑視頻、游戲、音樂與全球文娛”圓桌對話,由甲子光年創始人張一甲主持。昆侖萬維董事長兼CEO方漢,中國電影家協會副主席黃曉明,演員王珞丹,愛奇藝高級副總裁楊海濤,青年導演崔睿共同參與。
![]()
從左至右分別為:甲子光年創始人張一甲,昆侖萬維董事長兼CEO方漢,中國電影家協會副主席黃曉明,演員王珞丹,愛奇藝高級副總裁楊海濤,青年導演崔睿
圓桌圍繞AI與文娛產業的深度融合展開討論:從演員和導演的AI創作初體驗到AI演員與真人創作者的價值博弈,從AI重構平臺內容生態到全模態AI重塑文娛賽道終局。嘉賓們一致認為,AI是文娛行業最好的工具與最大的革新者,而人類創作者永遠是內容的靈魂締造者,人機協同將成為全球文娛行業的新發展范式。
![]()
王珞丹以親身體驗,道出AI創作的"痛并快樂著"——為求一個理想鏡頭熬夜"抽卡"至凌晨四點,反復調整提示詞卻遲遲得不到想要的畫面,直到清晨才終于抽到滿意的鏡頭。她坦言自己作為"小白"創作者,從分鏡、數字資產到人物設定一步步摸索,在這個過程中請朋友幫忙才得以完成。她認為創作者首先是一個判斷者和決策者,需要用審美去篩選和決定最終呈現的畫面,而AI能帶來超出想象的運鏡和流動性。她相信觀眾在意的是故事能否打動人心,而非媒介形態;創作者始終是表達的核心。
![]()
黃曉明提到自己曾看了一部朋友制作的AI電影,三個月前看時還能明顯看出AI表演的痕跡,但最近再看時,即便被告知那是AI生成,他已經完全分辨不出來了,"細節到臉上的斑點毛孔,甚至微表情、毛孔都在演戲"——這種指數級的技術迭代讓他真的驚到了。AI不僅改變了他的創作方式,也融入了他的日常體驗——他今天用Mureka生成了兩首歌,效果很不錯:“我很喜歡楊宗緯的風格,就讓Mureka照著《空白格》生了一首抒情的,歌詞還挺觸動人心的。”從創作到投資,他對AI保持高度開放態度,明確表示很想去投資一些AI相關的項目——無論是科技方向還是影視方向。
崔睿指出,AI已在實際創作中顯著提升了前期故事板的制作效率,讓導演能以更低成本、更短時間完成視覺預演;后期階段,AI還能有效補足因天氣等客觀因素無法實拍的鏡頭缺失。在他看來,AI在影視制作中最能發揮價值的場景,恰恰是那些人力成本最高、執行最繁瑣的“技術難題”——比如需要成千上萬群演的大場面,這正是AI最擅長解決的領域。提及昆侖萬維的AI視頻模型SkyReels,他認為一致性非常突出——能有效解決創作者最頭疼的“抽卡”效率問題,在系列化制作中保持人物、物體的穩定統一,避免反復嘗試的無效勞動;同時音畫同步能力也值得肯定。整體來看,他認為AI視頻工具值得創作者去嘗試和使用。
楊海濤從平臺數據出發,透露愛奇藝后臺每日收到超3000部AI短劇與上千部AI漫畫,AI內容觀看數據持續提升。他以愛奇藝"燎原計劃"扶持的網絡電影《勿念》為例,AI在電影鏡頭特效制作方面實現超50%的提效,從導演構思到成片可節約三周以上的時間,他預計暑期將上線更多AI參與的網絡故事片。
方漢作為技術方表態,承諾將持續降低創作門檻與Token成本,實現"人人如龍"的文化平權。他坦言技術上的難點并非大場面、爆炸等傳統拍攝中昂貴的鏡頭,反而是小眾場景數據量不足導致效果不佳;同時解釋AI生成人像"塑料感"的來源是擴散模型的去噪機制將所有面孔平均化,因此讓模型更真實是所有從業者的共同目標。他預測后AI時代,演員需學導演、導演需學表演,角色邊界將日益模糊。
所有嘉賓共同指向一個共識:AI不會消解人的創造力,反而倒逼創作者更珍視自身的獨特體驗與情感表達,在技術賦能下回歸內容的本真。
從“生成內容”到“理解物理世界”:昆侖萬維的下一個十年
從2022年“All in AGI與AIGC”戰略確立,到2026年“世界模型元年”的正式宣告,昆侖萬維完成了從全模態內容生成到可交互世界模型的關鍵躍遷。在世界模型和AIGC方向上,昆侖萬維交出了全球領先的答卷。
2026年,昆侖萬維正以世界模型為支點,撬動AGI時代的下一場多模態范式革命。
世界模型元年,未來已來。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.