當行業(yè)還在不斷刷新畫質、時長和可控性的同時,另一場挑戰(zhàn)也開始出現(xiàn)。
Hailuo等模型,都已經(jīng)能夠生成長達數(shù)十秒甚至數(shù)分鐘、高一致性、高可控性的內容。在Artificial Analysis等國際第三方榜單上,中國視頻模型也已經(jīng)長期位居全球第一梯隊,與Google等國際廠商共同定義著這一輪視頻生成技術的發(fā)展方向。
如果把時間撥回兩年前,很少有人會認為,視頻生成會成為這一輪AI競爭中進化最快的方向。
彼時,AI生成的視頻往往只有幾秒鐘,人物容易崩壞,動作缺乏物理規(guī)律,鏡頭切換混亂,更不用說生成對白、環(huán)境聲等復雜內容。等待幾十分鐘甚至更長時間,只換來一段充滿"AI味"的短片,是當時許多人對視頻模型最深刻的印象。
短短兩年,這條技術曲線卻幾乎以所有人都沒預料到的速度陡然向上。
今天,無論是OpenAI的Sora、Google的Veo,還是來自中國的可靈、MiniMax
但當行業(yè)還在不斷刷新畫質、時長和可控性的同時,另一場挑戰(zhàn)也開始出現(xiàn)。
視頻模型需要處理的人物、動作、鏡頭、場景越來越復雜,統(tǒng)一音視頻之后,還要同時理解對白、環(huán)境聲和背景音樂。模型規(guī)模不斷擴大,訓練成本、推理成本以及跨機器通信開銷也隨之快速攀升。過去依靠不斷放大Dense Transformer規(guī)模來提升能力的路徑,開始越來越接近它的邊界。
類似的問題,大語言模型已經(jīng)經(jīng)歷過一次。
而大語言模型給出的解決方案之一,就是MoE(Mixture of Experts)。它讓模型擁有更大的總參數(shù)規(guī)模,卻只在每次推理時激活其中少量專家,從而將模型容量與單次計算量部分解耦,也重新打開了Scaling Law。
那么,當視頻生成同樣走到模型規(guī)模與計算成本的十字路口,它是否也會進入屬于自己的MoE時代?
Sand.ai此次發(fā)布并開源千億級MoE視頻生成模型MAGI-2 Preview,或許正試圖回答這個問題。它總參數(shù)約114B,但單次前向計算僅激活約6B參數(shù);更重要的是,這是全球少有團隊將千億級MoE真正應用到統(tǒng)一音視頻生成模型,并完整開源模型權重、代碼以及訓練系統(tǒng)。
![]()
在全球視頻生成模型榜單Artificial Analysis的Image to Video上,MAGI-2 Preview排名全球第六。
對于一款114B參數(shù)的統(tǒng)一音視頻模型來說,真正令人意外的是,其成本并沒有隨著模型擴大而線性增長。據(jù)Sand.ai測算,生成1080P視頻的成本約為每10秒0.5元。
對于Sand.ai來說,這是MAGI系列的又一次迭代;對于整個行業(yè)來說,它可能意味著視頻生成開始嘗試另一種擴展路線。
視頻生成,開始撞上新的Scaling Law
從2024年年初開始,視頻生成幾乎沿著一條明線在狂飆。
從最初粗糙的“動圖”嘗試,到如今分鐘級的高清生成、精準的人物一致性,以及極其復雜的調度鏡頭;更進一步,它正跨越單純的畫面渲染,向著集對白、環(huán)境聲與背景音樂于一體的“音視頻統(tǒng)一生成”演進。無論是OpenAI、Google,還是字節(jié)跳動、快手、MiniMax等國內團隊,都在持續(xù)刷新這個賽道的上限。
這輪爆發(fā)背后,支撐整個產業(yè)狂奔的唯一鐵律就是把模型做得更大。
無論是大語言模型、具身智能,還是視頻模型,這一輪AI浪潮最底層的信仰始終只有一個——Scaling Law。
參數(shù)規(guī)模的膨脹,意味著模型能夠刻畫更龐大的物理規(guī)律、捕捉更微妙的光影與微表情。行業(yè)曾篤信,只要源源不斷地壓入數(shù)據(jù)與算力,規(guī)模效應就終將兌現(xiàn)為驚艷的能力躍遷。
然而進入2026年,這條靠強行膨脹Dense(密集模型)規(guī)模來換取能力提升的路徑,已經(jīng)撞上了物理與商業(yè)的雙重高墻。
關鍵的癥結在于,視頻生成本身就是AI領域最重的計算任務,沒有之一。相比一維的文本,視頻需要同時在二維空間和一維時間上做高強度的特征建模;而當音視頻統(tǒng)一生成成為行業(yè)新標準后,文本、圖像、音頻多模態(tài)被揉進同一個模型,單段視頻包含的信息量呈幾何級激增。
在傳統(tǒng)的Dense架構下,模型每處理一個Token,都需要將數(shù)千億參數(shù)完整地跑一遍。當模態(tài)疊加、Token數(shù)量指數(shù)級膨脹時,算力成本、GPU之間的通信帶寬開銷以及推理延遲正急速邁向失控。
行業(yè)不得不開始直面一個殘酷的現(xiàn)實:靠粗暴堆疊模型規(guī)模來延續(xù)Scaling Law的時代,正在觸頂。當算力賬本逼近承受極限,模型究竟還能如何繼續(xù)Scaling?
對這個問題,隔壁的大語言模型(LLM)賽道已經(jīng)率先交出了答卷。從Mixtral到DeepSeek、Qwen,MoE(混合專家)架構逐漸成為絕對主流。它的邏輯優(yōu)雅且直觀:通過構建極其龐大的總參數(shù)庫,但在每次推理時只根據(jù)任務精確激活少量的專家模塊,成功將模型容量與單次計算成本實現(xiàn)了物理解耦,讓Scaling Law繼續(xù)成立。
但為什么在LLM領域大放異彩的MoE,卻遲遲沒能在視頻生成領域落地?
因為視頻生成無法簡單照搬文本模型的套路,最大的區(qū)別來自Token。
首先是數(shù)據(jù)量級的降維打擊。一篇幾百字的文本,經(jīng)過Tokenizer離散化后不過幾百個Token;而一段十幾秒的高清音視頻,即便經(jīng)過高倍率壓縮,離散化后的Token數(shù)量也輕易飆升至數(shù)萬甚至數(shù)十萬級別。
其次是時空關聯(lián)的極其復雜。文本Token之間主要處理上下文的語義關系,而視頻Token卻要同時承擔空間像素的平滑、跨幀時間軸的連續(xù)性,以及音畫同步的毫秒級對齊。當統(tǒng)一音視頻模型出現(xiàn)后,每一個Token還需要不斷與對白、口型、環(huán)境聲等信息保持同步。
![]()
也就是說,視頻模型不僅處理的數(shù)據(jù)更多,每個Token之間需要建模的關系也更加復雜。
這樣的特性會讓MoE遇到工程挑戰(zhàn)。當海量的Token伴隨著極其復雜的跨幀注意力機制涌入MoE系統(tǒng)時,災難發(fā)生了。每一個Token都需要實時進行專家選擇、路由與分配。如果將千億級的MoE拆解到成百上千張GPU卡上,數(shù)萬個Token在不同節(jié)點間頻繁切換專家,會導致設備間的通信帶寬瞬間被擠爆,路由開銷甚至會直接反吞掉MoE帶來的計算節(jié)省。
再加上跨機器的負載均衡、顯存碎片的極致打理、訓練中隨時可能出現(xiàn)的專家坍縮與梯度爆炸……對于千億級的視頻MoE而言,寫出一個MoE的算法公式或許只需幾天,但要讓一套支持千億MoE視頻訓練的底層系統(tǒng)穩(wěn)定跑起來,此前全行業(yè)都沒有現(xiàn)成的參考答案。
這也解釋了為何在過去很長一段時間里,盡管全行業(yè)都覬覦MoE的成本紅利,但在視頻生成領域,千億級MoE的實戰(zhàn)驗證始終處于一片空白。
連續(xù)三次“非共識”,Sand.ai一直在回答同一個問題
如果把Sand.ai此次發(fā)布的MAGI-2 Preview看作一次獨立更新,那便很容易忽略它真正的意義。
事實上,這已經(jīng)是Sand.ai連續(xù)第三次選擇一條當時并非行業(yè)主流的技術路線。回過頭來看,這幾次選擇看似分別發(fā)生在模型架構、模態(tài)融合和訓練方式上,實際上都在回答同一個問題,即視頻模型如何繼續(xù)逼近真實世界。
最早的分歧出現(xiàn)在視頻生成路線之爭。
事實上,這波AIGC浪潮之所以能一夜爆火并徹底席卷全球,最原初的火種正是Diffusion(擴散模型)。因此過去很長一段時間,Diffusion幾乎是視頻生成領域無可爭議的底層范式。其核心邏輯在于“從噪聲中重構畫面”——模型從一片混沌的隨機噪聲出發(fā),通過數(shù)十輪極其精密的去噪預測,一步步塑造出高清晰度、高連續(xù)性的視頻幀。
而Sand.ai則在2024年底創(chuàng)立之初,就選擇了另一條路——Autoregressive(自回歸)。
在Sand.ai看來,視頻并不是一組彼此獨立的圖片,而是一段沿著時間持續(xù)展開的連續(xù)序列。模型如果能夠像生成文本一樣,逐幀預測未來,就更容易學習動作之間的因果關系,也更容易擴展到更長的視頻生成。這一判斷最終落在了2025年4月發(fā)布的Magi-1上,也讓Sand.ai成為很早公開驗證自回歸視頻路線的團隊之一。
緊接著,Sand.ai又把問題向前推進了一步。
現(xiàn)實世界從來不是只有畫面。人物說話時,口型、聲音、動作和環(huán)境變化始終同步發(fā)生。但過去很長一段時間,大多數(shù)視頻模型仍然將畫面和聲音分開生成,再通過后處理進行拼接。
2025年9月,Sand.ai開始將統(tǒng)一音視頻作為下一步技術方向,通過Gaga-1嘗試把文本、視頻和音頻放進同一個Transformer,讓不同模態(tài)從模型第一層開始持續(xù)交換信息,共同完成生成過程,而不是采取業(yè)界流行的等畫面生成之后再補充聲音。2026年3月發(fā)布的daVinci-MagiHuman,則進一步驗證了這一方向。
到了MAGI-2 Preview,問題再次發(fā)生變化。
隨著統(tǒng)一音視頻模型不斷擴大,Dense Transformer帶來的訓練和推理成本開始快速增長。正如前文所說,繼續(xù)擴大模型規(guī)模,意味著每一次計算都需要激活全部參數(shù),模型容量越大,算力、通信和推理開銷也同步增加。
于是,Sand.ai把第三次技術判斷放在了模型擴展方式上。
MAGI-2 Preview采用Multi-Head MoE架構,將一個Token拆分為多個子空間,每個子空間獨立選擇專家參與計算。這意味著,模型雖然擁有114B總參數(shù),但一次前向計算真正激活的只有約6B參數(shù)。
這也改變了模型繼續(xù)擴展的方式。
怎么理解?Multi-Head MoE讓模型內部擁有更多專家,卻只在每次計算時激活其中一小部分,讓模型容量與單次計算量實現(xiàn)一定程度的解耦。對于統(tǒng)一音視頻模型而言,這意味著模型可以把更多參數(shù)用于學習更復雜的時間關系、物理規(guī)律以及多模態(tài)交互,而不必讓每一次推理都承擔全部計算代價。這也讓視頻模型在繼續(xù)擴展時,多了一條不同于Dense Transformer的新路徑。
![]()
回頭看,Sand.ai過去幾年的技術演進,其實是在不斷突破視頻模型的三道邊界:時間、模態(tài)和規(guī)模。自回歸解決了時間連續(xù)性,統(tǒng)一音視頻解決了多模態(tài)協(xié)同,而Multi-Head MoE解決的,則是模型繼續(xù)擴展所面臨的規(guī)模問題。
不過,對于千億級Multi-Head MoE來說,僅有模型架構還遠遠不夠。前文提到的專家路由、跨設備通信和訓練穩(wěn)定性,都會隨著模型規(guī)模擴大變成新的工程瓶頸。
為了解決這些問題,Sand.ai同步開發(fā)了一整套訓練系統(tǒng)。MagiMoE Kernel Library負責專家路由、Token排序和專家計算,讓海量Token能夠更高效地找到對應專家并完成計算;Head Parallel針對大量細粒度專家?guī)淼耐ㄐ艍毫Γ匦陆M織不同Head之間的計算方式,減少GPU之間頻繁的數(shù)據(jù)交換;分布式優(yōu)化器MagiMuon則負責保障千億參數(shù)、海量專家條件下的訓練穩(wěn)定性,讓超大規(guī)模MoE模型能夠持續(xù)收斂,而不會因為梯度震蕩或負載失衡中途崩潰。
過去幾次技術判斷,在此刻進一步收束。
真正值得關注的,不只有114B
大模型行業(yè)正在發(fā)生一場很有意思的變化:模型越來越強,論文越來越多,但真正能夠影響行業(yè)方向的,往往不是某一家公司的自我定義,而是有沒有一套公開、可重復驗證的標準。
世界模型就是一個典型例子。
去年WAIC期間,幾乎每一家視頻模型公司、機器人公司都在談世界模型,但不同公司打開的卻是不同的榜單:有人展示VBench,有人強調WorldModelBench,也有人拿出Physics-IQ或者機器人任務成功率。直到越來越多公開評測體系出現(xiàn),行業(yè)才開始逐漸形成共同的坐標系。模型到底強不強,不再完全由發(fā)布會決定,而開始由公開數(shù)據(jù)和社區(qū)驗證共同定義。
技術路線也是如此。
過去幾年,Sand.ai連續(xù)選擇了自回歸、統(tǒng)一音視頻以及Multi-Head MoE三條當時并非行業(yè)主流的路線。但無論論文寫得多完整,模型效果多突出,這些判斷本質上仍然來自一家公司的技術選擇。
真正讓一條路線擁有生命力的唯一方法,是讓更多人驗證它,是越來越多人愿意沿著它繼續(xù)前進。
Llama推動了開源大語言模型生態(tài),Stable Diffusion催生了AIGC圖像社區(qū),而DeepSeek則讓越來越多團隊重新思考大模型訓練和推理的技術路線。
Sand.ai此次開源MAGI-2 Preview,爭奪的或許也是同一種影響力。
因此,這次MAGI-2 Preview中的重點很多,參數(shù)是一個,MoE是一個,同步開發(fā)的工程能力也是一個,但還有一個不該被忽視的,是開源。這次,Sand.ai開放了模型權重、代碼以及技術報告。Multi-Head MoE成為整個行業(yè)都可以驗證、復現(xiàn)和繼續(xù)演進的公共技術路線。
研究者可以驗證這種細粒度MoE是否真的更適合視頻生成;開發(fā)者可以圍繞模型繼續(xù)進行微調、量化以及工作流開發(fā);推理框架團隊可以繼續(xù)優(yōu)化專家路由、顯存占用和通信效率;企業(yè)也能夠根據(jù)自己的數(shù)據(jù)環(huán)境進行私有化部署。
更重要的是,這些來自社區(qū)的反饋,會反過來檢驗這條路線本身;于是這條路線最終能走多遠,不再只取決于Sand.ai,而取決于整個開發(fā)者生態(tài)是否愿意繼續(xù)沿著它演進。
模型是否真的能夠繼續(xù)擴展?工程復雜度是否足夠低?訓練成本是否能夠進一步下降?這些問題,不再需要Sand.ai自己回答,而會在一次次復現(xiàn)、部署和優(yōu)化過程中,由整個開發(fā)者社區(qū)共同給出答案。
這也是過去幾年AI競爭正在發(fā)生的一種變化。
上一階段,比拼的是誰能夠訓練出效果最好的模型;下一階段,更重要的競爭,正在逐漸變成誰能夠提出一條足夠開放、足夠穩(wěn)定,也足夠具有擴展性的技術路線,讓更多團隊愿意圍繞它繼續(xù)創(chuàng)新。
Sand.ai給出了自己的答案。這條路線最終是否會成為視頻生成新的Scaling Law,還需要時間驗證;但至少,它已經(jīng)把一次模型發(fā)布,變成了整個行業(yè)共同參與的公開實驗。
圖片來源|企業(yè)供圖
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.