![]()
這項由卡內基梅隆大學、威廉與瑪麗學院、奧本大學和威斯康星大學麥迪遜分校聯合開展的研究,于2026年4月發表,論文編號為arXiv:2604.10784,有興趣深入了解的讀者可以通過該編號查詢完整原文。
如果你最近關注過人工智能領域的新聞,一定聽說過越來越多能看懂圖片、寫文章、還能幫你修圖的AI系統。這些"多面手"AI,學界叫它們"統一多模態模型"(Unified Multimodal Models,簡稱UMM),是當前AI研究中最熱門的方向之一。然而,這個領域有一個讓研究者頭疼已久的問題:每個團隊開發出新模型后,都用自己的一套標準來測試,就像不同學校的老師各自出題、各自評分,你根本沒法知道A校的優等生和B校的優等生誰更厲害。
這項研究的核心貢獻,就是建了一個統一的"考場"——TorchUMM。這是業界第一個能把各種不同架構的多模態AI模型放在同一套試卷下統一考核的工具箱。它不僅能評測模型,還能分析模型的行為規律,甚至支持對模型進行進一步訓練。研究團隊通過這套工具,對十幾個主流模型進行了全面測評,揭示了一批之前從未被系統性記錄過的現象,其中最震撼的發現是:那些在某個測試上表現突出的模型,往往在另一個測試上悄悄"翻車"了。
一、多模態AI的"亂考場"問題
回到我們熟悉的學校比喻。假設你是一名家長,想知道自家孩子和隔壁班孩子誰學得更好,但兩個班的老師用的是完全不同的題目、不同的評分標準,甚至考試時的環境也不一樣——有的孩子開卷,有的閉卷。在這種情況下,你拿到的成績單根本沒有可比性。
這正是當前多模態AI評測領域的現狀。研究團隊在論文中指出,不同的模型往往在不同的"考卷"上被單獨測試,評測流程、數據預處理方式、甚至接入模型的接口方式都各有差異。更麻煩的是,一些模型經過特定訓練后,在某個特定測試上表現亮眼,但這種提升是真實的綜合能力提升,還是只是對那道特定題目的"刷題效果"?沒有統一的框架,根本無從判斷。
研究團隊還發現了一個更深層的問題:一個模型經過額外訓練(行話叫"后訓練")后,在某些測試上分數提高了,卻可能在另一些測試上分數悄悄下降了。就像一個學生為了數學競賽拼命刷題,結果語文作文水平退步了。這種"此消彼長"的現象在現有評測體系下很容易被忽視,因為大家只盯著自己擅長的那道題的成績匯報。
正是為了解決這個問題,研究團隊開發了TorchUMM這套工具。它的設計理念可以用一句話概括:所有模型,同一套題,同一套評分規則,同一套環境。
二、TorchUMM是什么,它能做什么
TorchUMM的結構可以用一棟四層樓的建筑來理解。最底層是"基礎設施層",就像樓房的地基,提供了與PyTorch、Hugging Face等主流AI開發庫的兼容接口,以及分布式訓練和統一評分計算等通用功能。在這層地基之上,是"核心功能層",這里住著三類最關鍵的東西:各種AI模型的接入適配器、測試用的數據集和基準,以及各種后訓練方法。再往上一層是"任務執行層",提供了圖像理解、圖像生成、圖像編輯三條獨立的流水線,以及一條跨任務綜合評測通道。最頂層是"應用接口層",用戶可以通過簡單的命令行或Python代碼來調用所有功能,測評結果會自動生成報告。
目前,TorchUMM支持14個主流模型,涵蓋了從1.3億參數的輕量小模型到340億參數的大型模型,架構類型跨越了純自回歸(一種逐步預測下一個詞/像素的方式)、純擴散(一種從噪聲逐步生成清晰圖像的方式)以及兩者結合的混合架構。這些模型包括Bagel、OmniGen2、Emu3系列、Janus系列、Show-o系列、BLIP3-o、TokenFlow、DeepGen和MMaDA等。
在測試內容上,TorchUMM整合了12套基準數據集,覆蓋三大核心能力維度。圖像理解方面,包含MMMU(考察跨學科專業知識推理)、MMBench(全面多選題測試)、MME(感知與認知分離測試)、MM-Vet(復雜開放式推理)和MathVista(數學圖表推理)。圖像生成方面,包含DPG-Bench(細節保真度測試)、GenEval(組合生成測試)和WISE(世界知識融合測試)。圖像編輯方面,包含GEdit-Bench(精細屬性修改測試,含中英文版本)和ImgEdit(單輪與多輪編輯一致性測試)。此外還有兩套跨任務綜合基準:UEval和Uni-MMMU,專門考察模型在需要同時理解和生成的復雜任務上的表現。
后訓練支持方面,TorchUMM目前整合了五種主流方法:標準監督微調(SFT)、交叉推理生成(IRG)、統一思維鏈推理(UniCoT)、重建對齊(RecA)以及自我博弈訓練(UniGame)。
三、圖像生成能力大測評:沒有全能冠軍
研究團隊將14個模型放在同一套評測流水線下,得到了一批頗為出人意料的結果。
先說圖像生成。DeepGen在GenEval(考察能否正確生成"兩只貓坐在紅色椅子上"這類需要組合多個要素的圖像)上拿到了86.59分的最高分,在"畫出正確數量的物體""畫出指定空間關系"這類任務上表現出色。但DeepGen完全不具備圖像理解能力,它只會畫,不會看。Emu3.5在WISE測試上遙遙領先,得分0.633,而最低分的Janus只有0.222,兩者相差近三倍。WISE考察的是模型能否根據涉及文化常識、地理空間、生物物理化學知識的文字描述生成正確圖像,這個巨大的分差說明不同模型在"把世界知識融入圖像"這件事上的能力差距極為懸殊。
有意思的是,OmniGen2和Bagel在DPG-Bench(考察細節保真度)上的得分非常接近,分別是84.51和84.11,說明這兩個模型在生成精細內容時能力相當。而BLIP3-o只有40億參數,卻在GenEval上達到了81.36分,超過了70億參數的Janus-Pro(78.92分),這說明模型大小不等于能力強——架構設計和訓練數據質量的影響往往更加決定性。
四、圖像理解能力大測評:感知強不代表推理強
在圖像理解測評中,Bagel以全面領先的姿態拿下了幾乎所有指標的第一名。在MME感知分(考察能否識別圖中的物體、文字等基礎內容)上,Bagel拿到1691.5分;在MME認知分(考察能否根據圖像內容進行推理判斷)上,Bagel拿到695.4分,而大多數競爭對手的認知分還不到Bagel的一半。在MMMU、MMBench、MM-Vet和MathVista上,Bagel同樣拔得頭籌。
不過,這里有一個非常值得關注的現象:感知分高不等于認知分也高。以Janus-Pro為例,它的感知分是1547.9,在所有模型中排名靠前,但認知分只有293.2,跌到了墊底水平。這就好比一個學生眼神極好,能看清黑板上寫的每一個字,但不太能理解這些字連在一起是什么意思。這種"看得清但想不明"的模式在多個模型上都有體現,說明視覺感知能力和高階推理能力在當前的模型架構中并不是自然捆綁的,是兩個相對獨立的能力模塊。
更有意思的是理解能力和生成能力之間的張力。Emu3.5在圖像生成的WISE測試上遙遙領先,卻在圖像理解的MME感知分上只拿到781.1分,是所有具備理解能力的模型中的最低分。這暗示著,如果一個模型的架構和訓練目標主要針對生成任務進行了優化,它理解圖像細節的能力很可能會受到牽連。Bagel和OmniGen2則在兩個方向上都保持了相對均衡的水平,是"全能選手"的代表。
五、圖像編輯能力大測評:改得對和改得好是兩回事
圖像編輯是三項能力中最復雜的一項,它要求模型既要看懂原圖,又要理解文字指令,還要生成既符合指令又保持原圖風格的新圖像。研究團隊只測試了原生支持編輯能力的模型,包括DeepGen、Bagel、OmniGen2和Emu3.5。
Emu3.5在編輯任務上的表現最為全面,在GEdit-Bench(英文和中文版本)和ImgEdit(含單輪與多輪編輯)上均拿到最高分。特別是在多輪編輯(相當于用戶多次發出修改指令,模型需要記住之前所有的修改歷史)上,Emu3.5的優勢更加明顯:4.89分對比Bagel的4.45分和OmniGen2的3.27分。這說明Emu3.5在處理連續對話式編輯任務時,具備更強的狀態追蹤和連貫性維持能力。
研究團隊在分析中發現了一個貫穿多個模型的共同弱點:語義正確性和感知質量是兩個可以相互獨立的維度。OmniGen2的感知質量分(圖像看起來是否真實、好看)高達7.18,但語義正確性分(圖像是否真的做了用戶要求的修改)只有6.49,差距明顯。這就好比一個裝修師傅,活干得很漂亮,刷的墻面光滑锃亮,但你讓他把白墻刷成藍色,他卻刷成了綠色——結果好看,但不對。當前多數模型都更擅長維持視覺質量,而在精準執行語義修改指令上存在明顯短板。
跨語言方面,DeepGen和Emu3.5在中英文指令下的表現基本一致,說明它們的多語言指令理解能力比較穩健。OmniGen2在中文語義正確性上(6.25)比英文(6.49)有明顯下滑,說明其在中文指令理解上還存在對齊不足的問題。Bagel則在中文測試上反而略有提升,研究團隊推測這可能與Bagel訓練數據中中文內容的比例有關。
六、跨任務綜合評測:現有模型的集體"盲區"
UEval和Uni-MMMU是兩套專門為"真正統一"的多模態模型設計的評測基準,它們考察的是那些需要模型同時動用理解和生成能力的復雜任務。
結果相當令人意外——即便是Bagel這樣在單項測試中表現最強的模型,在某些跨任務題目上也幾乎完全失靈。以迷宮圖像生成為例(給模型一道迷宮,讓它生成對應的解法圖),Bagel的得分只有0.004,約等于零。在滑動拼圖(經典的數字華容道)解題上,得分是0.000。相比之下,Bagel在拼圖重組(把打亂的圖像碎片正確排列)上得到了0.660,在科學圖表推理上得到了0.592,這兩類任務的共同點是答案可以通過直接的視覺對應或語義推理得出,而不需要對結構狀態進行一步一步的迭代操作。
這個對比揭示了當前多模態模型的一個根本性限制:它們在表示層面上統一了視覺和語言,但缺少對中間狀態的顯式追蹤機制、逐步推理能力和可控生成能力。換句話說,它們能把很多東西"塞進"同一個大腦,但這個大腦還沒有學會"一步一步想清楚再做"。
七、后訓練實驗:那些"教訓"往往比進步更有價值
后訓練是指在模型完成基礎訓練之后,針對特定任務或能力進行的進一步優化訓練。研究團隊用TorchUMM對Bagel、Janus-Pro、OmniGen2、BLIP3-o、TokenFlow和Show-o2等多個模型,分別應用了SFT、RecA、UniCoT、IRG和UniGame五種后訓練方法,然后在生成、理解和編輯三類任務上全面測評,得到了一批非常有警示意義的結論。
第一個結論是,最常用的監督微調(SFT)并不是一個可靠的全面提升手段。在Bagel上,SFT把MMMU的準確率從0.519小幅提升到了0.526,看起來有進步,但同時把MMBench從0.843降到了0.820,MM-Vet從65.9降到了61.2,圖像生成的WISE分從0.399驟降到0.227。更極端的例子出現在TokenFlow上:SFT之后,DPG-Bench的得分從71.29跌到了22.16,幾乎是腰斬,而GenEval的分數幾乎沒有變化。Show-o2經過SFT后,三個生成基準指標全線下滑。這說明SFT很容易讓模型在某個特定方向上"過度學習",代價是在其他方向上退步。
第二個結論是,同一種后訓練方法在不同模型上的效果差異極大,沒有一種方法能穩定地在所有模型上都帶來改善。以IRG為例,在Bagel上,它不僅拉低了生成測試(GenEval從78.81降到72.06),還嚴重傷害了理解能力(MMMU從0.519降到0.480),同時讓跨任務評測的UEval分數從30.9跌到了9.1。這種大規模的多方向退步,在不使用統一評測框架的情況下,很可能不會被發現,因為發布者只會挑選表現好的指標匯報。
第三個結論是,不同能力維度對后訓練的敏感度是不同的。圖像生成能力最容易被擾動:UniGame讓Bagel的GenEval從78.81提升到了85.8,但同時把DPG-Bench從84.11拉到了65.77,一個指標漲、一個指標跌,且跌幅更大。圖像理解能力相對穩定,各種后訓練方法對MMMU分數的影響通常在幾個百分點以內。圖像編輯能力的變化則是"混沌"的——RecA和UniCoT在GEdit上有小幅改善,IRG則帶來了明顯退步,沒有一種方法能穩定地推動編輯能力全面提升。
這些發現共同指向一個核心觀點:對多模態模型進行后訓練時,如果只盯著一兩個測試指標看,極容易被誤導,以為某種方法真的在整體上提升了模型能力,而實際上只是換了一種"偏科"方式。
八、架構統一程度越高,能力就越強嗎?
研究團隊專門針對這個問題設計了一組分析,結果打破了一個直覺上很容易接受的假設。
三個被拿來對比的模型分別是MMaDA、Show-o2和OmniGen2,它們在"架構統一程度"上呈現出明顯的梯度差異。MMaDA的統一程度最高,它把文字和圖像都處理成同一種標記序列,在同一個擴散語言模型框架內完成所有任務,理論上是最"純正"的統一多模態模型。Show-o2居中,保留了統一的標記空間,但文字和圖像的生成過程走不同的"出口"。OmniGen2統一程度最低,它用一個視覺語言模型來理解輸入,再驅動一個獨立的視覺生成器輸出圖像,是比較模塊化的設計。
如果"統一程度越高意味著能力越強"這個假設成立,那應該是MMaDA表現最好,其次是Show-o2,OmniGen2最差。但實際結果恰恰相反。在UEval的兩個典型任務上——一個要求模型畫出"如何畫卡通狗"的分步驟教程,另一個要求模型畫出Transformer神經網絡架構圖——OmniGen2是三者中唯一一個能夠認真嘗試完成任務的模型,得分也最高。在第一個任務上,OmniGen2得到0.79分,Show-o2只有0.46分,MMaDA只有0.29分。在第二個任務上,三者都掙扎,但OmniGen2給出了一個勉強像樣的結構圖(0.13分),而Show-o2只有0.07分,MMaDA完全沒有產出有效輸出(0.00分)。
研究團隊在解釋這個現象時非常謹慎,明確指出這個結果不能簡單地理解為"統一架構是壞的"。這三個模型不僅架構統一程度不同,它們還繼承了不同的基礎模型、經過了不同的訓練數據和優化流程。MMaDA基于LLaDA-8B構建,Show-o2繼承自Qwen2.5-7B-Instruct,OmniGen2繼承自Qwen2.5-3B-Instruct。這些基礎的差異本身就會帶來能力上的差距。真正值得注意的教訓是:統一程度作為一個架構特征,其實際效果目前還被各種其他因素所掩蓋,不能單獨成為評價模型優劣的可靠依據。
九、統一訓練對模型"底色"的改變
研究團隊還做了一項更深入的分析:當一個多模態模型從某個強基礎模型初始化,然后經過聯合多模態訓練之后,原來那個基礎模型的行為特征還剩下多少?
研究方法是這樣的:從MathVista基準中取出200個問題,用另一個大型語言模型對每道題生成兩個意思完全相同但措辭不同的變體,這樣每道題就有三個版本。然后讓目標模型分別回答這三個版本,把答案轉換成向量,計算三個答案之間的相似程度——如果模型面對措辭不同但意思相同的問題時,給出的答案差異很大,說明它對這類題目的理解不夠穩定;如果答案很一致,說明它的理解能力比較魯棒。同時,研究團隊還深入模型內部,每隔五層提取一次中間狀態,看看模型在"思考過程"中的一致性。
對比了兩對組合:OmniGen2和它的基礎模型Qwen2.5-VL-3B-Instruct(統一程度較低的一對),以及Show-o2和它的基礎模型Qwen2.5-VL-7B-Instruct(統一程度較高的一對)。
結果是:OmniGen2的答案一致性分布和內部狀態軌跡,與它的基礎模型幾乎完全重疊——換句話說,OmniGen2的聯合訓練對原基礎模型的行為影響非常小,它的"底色"基本上被完整保留了下來。Show-o2則不同:它的基礎模型Qwen2.5-VL-7B-Instruct具有非常穩定、高度一致的答案分布,而Show-o2自己的一致性分布要寬散得多,說明相同問題換一個說法,Show-o2更容易給出不同的答案;在內部狀態上,Show-o2也明顯偏離了基礎模型的軌跡,起點更低,中間層的一致性也更差。
這個發現揭示了統一訓練的一個隱蔽代價:越是激進地把多種任務捆綁在一起訓練,越可能對模型原有的穩定能力造成干擾。適度的模塊化可能是在保留原有能力的同時獲得多模態擴展能力的更穩妥路徑,而完全融合的統一訓練要發揮出理論上的優勢,需要足夠強的數據和優化配方來抵消跨任務干擾帶來的負面影響。
十、TorchUMM的工程設計:如何讓不同的模型"說同一種語言"
在代碼層面,TorchUMM的核心抽象是一個叫做BackboneAdapter的協議接口。每一個被支持的模型,不管內部架構多復雜,都必須實現三個基本方法:一個用來加載模型權重,一個用來執行推理生成,再加上一個模型名稱標識符。這就好比不管你家的電器是哪個品牌、什么功能,只要插頭符合國標,就都能插在同一個插座上。
在配置系統上,TorchUMM采用了三層YAML配置文件的設計。推理配置負責指定模型路徑和生成參數(比如擴散步驟數、引導強度等);評測配置負責把模型和測試基準綁定在一起,指定輸出目錄和評分方式;后訓練配置則定義訓練方法、優化器設置和檢查點保存頻率。切換模型測試時,用戶只需要改一行配置文件中的模型名稱和路徑,不需要改任何代碼。
執行流程上,TorchUMM把整個過程分為推理、評測和后訓練三個階段。推理階段負責把用戶的輸入(圖像、文字、任務類型)標準化成統一格式,然后分發給對應的任務處理器。評測階段通過命令行工具調用,自動加載配置、迭代數據集、保存結構化輸出,雙階段評測(先生成再評分)也被以輕量包裝器的形式原生支持。后訓練階段的代碼與評測代碼完全隔離,訓練完成的檢查點可以直接通過修改評測配置的模型路徑來進行測試,無縫銜接。
擴展性方面,加入一個新模型只需要實現一個適配器子類并注冊,加入新的測試基準只需要實現一個數據處理和評分腳本,加入新的后訓練方法只需要在指定目錄下實現訓練邏輯并注冊入口,三件事都不需要觸碰框架的核心代碼。
說到底,TorchUMM這項工作的價值不只是提供了一個測試工具,更重要的是它系統性地揭示了一個被整個領域長期忽視的問題:當我們宣稱某個新方法提升了多模態AI的能力時,我們真的測全了嗎?單項成績亮眼、整體退步悄無聲息的現象,在這項研究中出現的頻率之高,足以讓所有人停下來重新思考評測方式的可靠性。
這對普通用戶的影響可能并不那么直接,但對那些依賴AI模型做決策的場景來說意義重大。一個在某項指標上表現優秀但在其他維度上存在隱性退步的模型,如果被當作"全面進步"的成果推向應用,可能會帶來意料之外的風險。統一評測框架不是錦上添花,而是確保研究進展真實可靠的基礎設施。
這項研究本身也留下了很多開放性問題值得繼續探索:統一程度更高的架構真的更有潛力嗎?在控制了基礎模型和數據之后,單純的架構統一會帶來什么效果?有沒有一種后訓練方法能夠在所有維度上都帶來穩定提升而不是偏科優化?隨著TorchUMM的開源,研究社區有了一個可以用來回答這些問題的共同平臺。感興趣的讀者可以通過arXiv編號2604.10784查閱完整原文,或訪問GitHub上的AIFrontierLab/TorchUMM項目直接體驗這套工具。
Q&A
Q1:TorchUMM支持哪些多模態模型,具體能做什么測試?
A:TorchUMM目前支持14個主流多模態模型,包括Bagel、OmniGen2、Emu3、Emu3.5、Janus系列、Show-o系列、BLIP3-o、TokenFlow、DeepGen和MMaDA。測試內容覆蓋圖像理解、圖像生成和圖像編輯三大任務,整合了12套基準數據集,所有模型在完全相同的環境下統一評測,結果可以直接對比。
Q2:多模態模型做了監督微調之后為什么反而會在某些測試上退步?
A:監督微調讓模型在特定任務的訓練數據上過度學習,相當于一個學生為了應付某類題目反復刷題,結果大腦"擠掉"了其他知識的存儲空間。TorchUMM的跨任務評測系統性地記錄了這種現象,比如Bagel經過SFT后WISE生成分從0.399跌到0.227,TokenFlow的DPG-Bench從71.29跌到22.16,而在沒有統一評測框架時這類退步很容易被研究者忽略。
Q3:架構統一程度高的多模態模型是否就意味著能力更強?
A:TorchUMM的研究結果表明,架構統一程度和實際能力之間沒有簡單的正比關系。在UEval跨任務測試中,架構統一程度最低的OmniGen2反而表現最好,統一程度最高的MMaDA表現最差。研究團隊指出,這與三個模型繼承的基礎模型不同、訓練數據不同有關,統一架構的潛在優勢目前仍被其他因素所掩蓋,在嚴格控制變量之前無法做出確定性結論。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.