![]()
投稿作者:浙江大學 April團隊
給多模態大模型多看幾道例題,它就一定能答得更好嗎?答案可能恰恰相反。在 UniICL-Bench 上,有模型在感知類理解任務中的平均分從 zero-shot 的 54.8,一路跌到 8-shot 的 6.9。例題越多,模型反而越糊涂。
這一反常現象在統一多模態模型中尤其值得警惕。如今,一個模型既能看圖答題,也能生成、編輯圖片;但當圖像、文字和多組示例被塞進同一段上下文,模型不僅要“看見”,還要判斷:哪道例題在教規則,哪道在示范風格,哪道只是噪聲。示例一多,注意力競爭、錯誤關聯和上下文過載也隨之而來。
為此,浙江大學、上海交通大學、新加坡國立大學與南洋理工大學聯合團隊提出 UniICL,從“示例究竟教會模型什么”出發,首次系統梳理統一多模態上下文學習,并構建 UniICL-760K、UniICL-Bench 與輕量模塊 CAPM。
![]()
論文鏈接:https://arxiv.org/abs/2603.24690
GitHub:https://github.com/xuyicheng-zju/UniICL
數據:https://huggingface.co/datasets/xuyicheng-zju/UniICL-760K
實驗中,UniICL 是論文所比較的統一模型里,唯一在理解與生成兩側都獲得正向 ICL 效率的方法。
![]()
圖|以往的碎片化范式將不同模態和任務彼此隔離,常常會出現隨示例數量增加而性能非單調變化的問題。UniICL 緩解了這一問題,實現了穩定收益。
研究方法
1. 六類能力:先弄清例題到底在教什么
過去的多模態 ICL 研究,常按視覺問答、圖像生成、圖像編輯來劃分任務。UniICL 換了一個更貼近“學習過程”的角度:不先看答案是文字還是圖片,而是看示例在解題時承擔什么角色。
團隊據此歸納出六類能力:感知用例題提示模型該關注哪里;模仿要求復現結構、風格或邏輯模板;概念形成讓模型臨時學會一個新符號或視覺概念;演繹依據因果或時間鏈推導下一步;類比從多組變化里抽出沒有明說的規則;審辯則學習審美、真實性與質量標準。
這并不是給任務簡單排難度,而是在回答一個更關鍵的問題:模型面對示例時,究竟需要調用哪一種“舉一反三”的能力?在任務趨勢分析中,同類任務對的平均相關性達到 0.746,跨類僅為 0.063,說明這六類能力確實呈現出不同的隨示例數變化模式。
2. UniICL-760K:不是簡單收集數據,而是給每道題配好例題
![]()
圖 |UniICL-760K 數據統計
一組 ICL episode,可以理解為“若干道例題 + 一道新題”。UniICL-760K 共包含 766,868 組 episode。團隊先沿真實圖像與生成/編輯數據兩條管線構造細粒度數據,再經過標注校正、幻覺檢查和質量篩選,為每個查詢組裝 8-shot 上下文。整個數據集的構建消耗大約 24000 H20 GPU-hours。
同樣重要的,是“怎么配例題”。對感知、模仿和審辯任務,Feature-Based Assembly 同時比較圖像與文字特征,選出相關但不重復的示例;對概念形成、演繹和類比任務,Intent-Based Assembly 則把查詢拆成結構化條件,尋找意圖真正一致、而不只是畫面看起來相似的示例。比如,新題要求找出“指定區域內穿紅衣的女性”,構圖相似并不夠,類別、顏色與位置必須同時對上。這個細節也解釋了論文最重要的發現之一:給什么例題,往往比給多少例題更重要。
![]()
![]()
圖|UniICL-760K 數據構造與兩類上下文組裝流程
3. UniICL-Bench:不只看最高分,還要看整條學習曲線
如果只報一個最佳分數,很容易掩蓋問題:模型可能在 2-shot 達到高點,到了 4-shot、8-shot 卻迅速退化;也可能原本 zero-shot 就很強,新加入的例題根本沒有被利用。
因此,UniICL-Bench 用 1,250 個與訓練集隔離的 episode 覆蓋六類能力、15 個子任務,并按 0、1、2、4、8-shot 及鏈式任務的原生協議形成 5,650 個測試實例。除干凈上下文外,基準還會隨機替換示例、顛倒順序、混入不匹配示例,觀察模型是否真的讀懂了上下文。
4. CAPM:先讀懂例題之間“發生了什么變化”
標準自注意力會把多組圖文示例攤成長序列,問題、答案和視覺細節很容易攪在一起。團隊設計了一個輕量化可插拔模塊 Context-Adaptive Prototype Modulator(CAPM):先分開提取每個示例的輸入與輸出,再把二者之間的變化壓縮成原型表示,最后根據當前任務,自適應地選擇少數關鍵示例,或匯總多條示例中的共同規律。
CAPM 再通過門控把這些信息送回骨干模型,完整模塊約含 189.2M 參數,只占 14.61B 骨干模型的 1.29%。它的目標并不是替模型重做一遍推理,而是讓模型少被無關例題帶跑偏。
![]()
圖 |CAPM 通過輸入/輸出解耦、原型提取、自適應路由與門控注入,幫助模型利用上下文
研究結果
團隊從峰值能力、整條 shot 曲線、上下文擾動和跨基準泛化四個方面,對 UniICL 進行了評估。
1. 總體表現:理解和生成同時從例題中受益
在 UniICL-Bench 上,UniICL 的理解/生成平均峰值達到 78.9/69.6,相比原始 BAGEL 骨干的 59.3/60.5 明顯提升。
更關鍵的是 ICL 效率。它衡量整條 0—8-shot 曲線相對 zero-shot 基線的面積:正值說明加入示例后整體受益,負值則說明模型平均被示例拖累。UniICL 的理解/生成 ICL 效率達到 +16.9/+4.9,是論文對比的統一模型中唯一兩側均為正的方法。
![]()
![]()
圖|主實驗結果與 shot-scaling 曲線:有些任務從更多例題中受益,有些任務反而出現退化。
2. 穩定性:換錯例題,比調換順序更致命
面對隨機換例、順序顛倒和噪聲混入,UniICL 在理解/生成側的綜合穩定性分數為 1.7%/6.6%,統一模型平均值為 12.4%/10.6%。該分數由擾動下各指標的絕對相對變化曲線積分得到,數值越低越穩定。
實驗中,隨機替換示例造成的影響普遍大于打亂順序。模型更在意的不是例題 1 和例題 2 誰排在前面,而是擺在面前的究竟是不是合適的例題。
3. 消融結果:數據與統一訓練抬高上限,CAPM 穩住曲線
去掉 CAPM 后,依靠 UniICL-760K 和統一訓練,模型已經達到 77.0/68.6 的理解/生成峰值。這說明大部分峰值增益來自系統化數據與聯合訓練。
CAPM 的作用則更集中地體現在“能否持續利用例題”上:加入它后,生成側 ICL 效率從 0.4 提升到 4.9。換句話說,數據與統一訓練讓模型更強,CAPM 讓它面對不同數量的例題時更穩。
示例組裝同樣不可忽視。在 Feature-Based 分支中,相比默認方案,隨機選例會讓生成峰值下降 13.34,生成 ICL 效率下降 15.17;只保留相似度、拿掉多樣性控制,也會出現明顯退化。
![]()
![]()
![]()
圖|穩定性分析與消融實驗分別顯示:UniICL 在三種擾動下具有最好的穩定性以及合適的數據、統一訓練、示例組裝與 CAPM 各自解決不同問題。
4. 跨基準測試:換一套考卷,提升依然存在
在 VL-ICL-Bench 的原始協議下,UniICL 相比 BAGEL 的理解平均峰值從 55.9 提升到 66.4,生成平均峰值從 48.4 提升到 55.5。15 名評估者對 350 個 episode 的盲測也顯示,論文使用的主觀任務指標與人類偏好具有較強一致性。
![]()
![]()
圖 |UniICL 在外部基準上的理解與生成任務中仍保持提升。
不足和未來方向
當然,UniICL 還沒有徹底解決多示例帶來的上下文過載。尤其在精細圖像編輯中,當多個示例包含相互重疊的空間變化,模型往往已經知道“要改什么”,卻未必能準確控制“在哪里改、改到什么程度”。感知類圖像生成的 ICL 效率也仍為負值,說明生成側比理解側更容易受錯誤示例干擾。
當前研究只覆蓋圖像與文本。擴展到視頻和音頻后,時間建模、跨模態同步以及更長上下文都會帶來新的變量;數據管線依賴的外部基礎模型,也可能把自身偏差帶入標注、合成與篩選過程。
研究團隊表示,未來將繼續探索更有效的噪聲過濾與上下文路由,讓模型把已經識別出的編輯意圖落實為更精確的像素操作,并檢驗這套能力分類能否延伸到視頻、音頻等更多模態。
統一多模態模型已經能在一個系統里理解和生成。UniICL 追問的,是再往前一步的問題:當幾道例題擺在模型面前,它能不能真正看懂其中的規律,并穩定地用到下一道題上?
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.