![]()
智東西
作者 楊京麗
編輯 李水青
智東西7月31日報道,今日,MiniMax發布通用全模態生成模型MiniMax H3。該模型能夠統一理解文本、圖像、視頻和聲音,并生成帶原生雙聲道的音視頻,最高支持15秒、2K分辨率輸出。
MiniMax稱,該模型在指令遵循、文字與品牌信息呈現、視頻到視頻動作遷移(V2V Motion Transfer)等方面表現出色,可用于廣告、品牌、電商、產品設計、UI/UX和游戲等場景。
價格方面,MiniMax稱其有能力提供行業內最優的性價比,模型在2K分辨率下每秒價格不到主流模型的1/3,768P分辨率下不到1/2,具體價格暫未公布。
目前,MiniMax H3在第三方評測機構Artificial Analysis的文生視頻有聲榜單中排名第二,Elo得分為1242分,略低于谷歌Gemini Omni Flash的1245分。
![]()
MiniMax計劃在未來幾天內,在符合相關法律法規的前提下,開放模型權重,推動開源生態和國產芯片適配。
一、文本、圖片、視頻、聲音一起輸入,最高輸出15秒2K音視頻
真實創作一般需要融合不同模態的復雜信息,用戶使用MiniMax H3創作時,可以同時輸入參考視頻、人物圖片和聲音,要求模型進行復雜創作。
MiniMax給出的案例中,要求模型“參考視頻1的希區柯克鏡頭運動,讓圖2中的人物唱歌,歌聲參考音頻3”。
參考視頻:
![]()
參考圖片:
![]()
H3會分別提取視頻中的鏡頭運動、圖片中的人物身份和音頻中的聲音特征,再根據自然語言描述組合成新視頻。
在輸出側,H3最高支持15秒、2K分辨率,并能聯合生成人聲、音效和音樂,音頻默認為原生雙聲道。除上述案例外,MiniMax還展示了H3生成電影片頭、游戲UI、動態海報以及廣告電商內容的效果。
游戲UI:
視頻中,角色打開裝備,進入零部件選擇、配置確認和加載界面,最終切換到霓虹燈街道中的游戲畫面。整個交互過程銜接流暢,界面反饋自然,營造出色彩豐富的賽博朋克游戲氛圍。
動態海報:
![]()
畫面開始時,人物以較小比例出現在粉色矩形底部,隨后綠色標題文字從背景中顯現,人物快速放大并向鏡頭伸手,形成沖出海報的立體效果,整體色彩和視覺風格較為統一。
廣告電商:
![]()
電商廣告視頻先后展示模特佩戴銀色護目鏡的面部特寫和側臉,隨后切換至黑白服裝模特的全身鏡頭、眼鏡產品特寫及雙人定妝畫面。不同鏡頭之間的光影、服裝和銀黑配色保持一致,鏡片反光和金屬材質較為突出,已經具備商業廣告的基本質感。
二、統一生成、參考和編輯任務,用自然語言連接不同模態
在H3之前,MiniMax先后研發了Hailuo 01和Hailuo 02兩代視頻模型。其中,Hailuo 01主要完成視頻生成系統的從0到1搭建,Hailuo 02則重點提升架構效率、數據質量和模型規模。
研發H3時,MiniMax將重點從單項能力提升轉向任務統一和泛化。
過往生成模型通常在任務上具有局限性:圖片生成通常被拆分為文生圖、圖片編輯、主體參考、動作參考和風格參考等任務;聲音生成又被分為人聲、音效和音樂;視頻生成則進一步細分為文生視頻、圖生視頻、首尾幀、主體參考、動作參考、音色參考和視頻編輯。
MiniMax認為,這些邊界雖然方便產品定義,卻限制了用戶自由組合素材的能力,也會讓模型在訓練階段過早適應有限的任務形式。H3因此在預訓練階段就混合圖像、視頻、音頻以及多種參考和編輯數據。
H3的預訓練任務包括文生圖、文生視頻和文生音頻。其中,視頻訓練同時覆蓋音頻聯合生成和多鏡頭建模;音頻訓練不再區分人聲、音效和音樂,而是進行統一建模。
參考和編輯任務則覆蓋圖片到圖片、圖片到視頻、音頻到音頻以及音視頻到音視頻等組合。不同素材之間的參考、保留和修改關系,均通過自然語言描述,不被限制在少數預定義任務中。
在數據選擇上,H3的廣義參考和編輯訓練主要采用真實自然數據,以提高數據擴展能力。MiniMax將語言視為連接不同模態和任務的橋梁,希望模型借助語言理解開放式創作意圖,而不是只識別固定功能標簽。
訓練策略上,MiniMax選擇盡早融合不同類型的數據和任務,并通過調整數據配比,讓模型在預訓練階段就形成多模態上下文理解與生成能力。
三、四項技術降低訓練和2K生成成本,后續將融合M系列能力
為實現多模態上下文理解,MiniMax首先構建了Contextual Omni Representation(上下文全模態表示),用語言同時描述目標視頻、參考素材以及不同素材之間的關系。MiniMax通過定制模型和全模態理解管線,大部分素材需要消耗約10萬Token的推理,最終壓縮為平均約4K的Token。
H3-VAE則通過提高視覺信息壓縮率,帶來4倍的序列長度收益,大幅降低訓練和推理成本,并為2K分辨率輸出提供技術支持。
架構方面,MiniMax沒有沿用Hailuo-02架構,而是采用更通用的H3-Omni Transformer。面對擴大3倍的序列長度方差,以及理解和生成任務之間不同的計算負載,H3采用異構訓練架構并優化樣本間負載均衡,MiniMax稱其端到端訓練吞吐提升近30%。
生成2K視頻時,H3也沒有使用獨立超分辨率模塊,而是通過In-context Regeneration(上下文再生),讓基模結合原始多模態上下文重新生成高分辨率畫面。MiniMax稱,這種方式能夠復用基模已有能力,并更好地還原小文字和局部細節。
MiniMax也提到,H3在復雜多模態理解、模型規模和部分場景的畫面精細度上仍有提升空間。后續H系列將進一步融合M系列模型能力,并繼續擴大模型規模、提高畫面分辨率和細節表現。
結語:全模態視頻生成走向統一模型
MiniMax H3試圖用統一的全模態生成架構,取代過去被拆分為文生圖、圖生視頻、音色參考、動作遷移等彼此隔離的任務管線。
隨著模型開始同時接收語言、圖片、視頻和聲音,視頻生成工具的產品形態也可能從“輸入提示詞、生成一段視頻”,逐步轉向理解完整創作意圖,并參與內容生產全過程。
H3能否兌現這一方向,仍要看其在復雜多模態指令穩定性、2K分辨率畫面精細度、音畫同步質量、真實生成成本等方面的實測表現。
來源:MiniMax
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.