![]()
剛剛,人工智能(AI)頂會 ICML(國際機器學習大會)公布了 2026 年度獎項,包括杰出論文獎(Outstanding Paper Award)、杰出立場論文獎(Outstanding Position Paper Award)以及時間檢驗獎(Test of Time Award)。
其中,清華大學自動化系長聘副教授、博士生導師,清華大學智能產業研究院(AIR)研究員黃高團隊獲得杰出論文獎。
![]()
獲獎名單如下:
ICML 2026 杰出論文獎
![]()
ICML 2026 杰出立場論文獎
![]()
ICML 2026 杰出論文榮譽提名
![]()
ICML 2026 杰出立場論文榮譽提名
![]()
ICML 2026 時間檢驗獎
![]()
以下是獲獎論文詳情。
ICML 2026 杰出論文獎
本屆杰出論文的評選流程分為三輪:項目主席 Alekh Agarwal、Miroslav Dudik、Sharon Li、Martin Jaggi 先從八大主題方向中篩出 53 篇候選論文,壓縮為 22 篇短名單后,交由一個 11 人評選委員會(主席為 Andreas Krause)復核。每篇論文由兩位委員分別評審,最終委員會決定認可兩篇杰出論文與五篇榮譽提名。
The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
作者:Zanlin Ni、Shenzhi Wang、Yang Yue、Tianyu Yu、Weilin Zhao、Yeguo Hua、Tianyi Chen、Jun Song、Cheng Yu、Bo Zheng、Gao Huang
機構:清華大學等
論文鏈接:https://arxiv.org/abs/2601.15165
論文簡介:擴散大語言模型(dLLM)打破了傳統自回歸模型從左到右生成的限制,能夠以任意順序生成 token。直覺上,這種順序自由意味著解空間嚴格超越固定的自回歸軌跡,理論上應能解鎖更強的推理能力,因此不少工作嘗試用強化學習來激發 dLLM 的推理潛力。
然而,這篇論文揭示了一個反直覺的現象:在當前形式下,任意順序生成非但沒有擴展 dLLM 的推理邊界,反而使其收窄。
研究團隊發現,dLLM 會利用這種順序自由繞開對探索至關重要的高不確定性 token,導致解空間過早坍縮。這是一個此前未被充分認識的失效模式。
基于這一發現,研究團隊提出重新審視 dLLM 強化學習后訓練的采樣策略,采用更簡單的固定從左到右生成順序來進行 RL rollout(即 JustGRPO 方案),同時在推理階段保留并行解碼能力。這項工作把“RL rollout 應該采用何種采樣策略”這一尚未被充分探討的問題重新擺上了臺面。
![]()
High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions
作者:Fan Chen、Sinho Chewi、Constantinos Daskalakis、Alexander Rakhlin
機構:麻省理工學院(MIT)、耶魯大學
論文鏈接:https://arxiv.org/abs/2602.01338
論文簡介:這篇論文回答了基于分數(score-based)采樣理論中一個長期懸而未決的問題:僅憑分數(梯度)估計,是否可能只用 polylog(1/ε) 步就達到 ε 誤差,而不是依賴離散化采樣器所需的 poly(1/ε) 步。
核心構造是一階拒絕采樣(First-Order Rejection Sampling,FORS),一種僅依賴一階查詢就能模擬拒絕采樣的元算法,繞開了以往高精度方法所依賴的密度評估。
在數據假設極小的條件下,該方法可實現 O(d·polylog(1/ε)) 的采樣復雜度,相較此前基于分數的結果實現了指數級改進;在非均勻 Lipschitz 及內在維度條件下還能進一步優化,并順帶給出了首個針對一般對數凹分布、僅用梯度查詢的 polylog(1/ε) 復雜度采樣器。
對擴散模型而言,這意味著達到目標采樣精度所需的去噪步數(即分數函數評估次數)原則上可以從多項式降至對數多項式級別,為用更少的函數評估次數實現高精度擴散采樣提供了理論支撐。
ICML 2026 杰出立場論文獎
本屆立場論文賽道的評選由賽道聯合主席 Dale Schuurmans 與 Jerry Zhu 主持。領域主席提名候選論文后,兩位聯合主席各自獨立通讀并評估,結果高度一致,最終選出一篇杰出立場論文與一篇榮譽提名。
Position: The Alignment Community is Unintentionally Building a Censor's Toolkit
作者:Sarah Ball、Phil Hackemann
機構:慕尼黑大學等
論文鏈接:https://openreview.net/pdf?id=dy2HwmOvFX
論文簡介:這篇論文挑戰了一種普遍存在的舒適假設,即“我們所做的對齊研究天然是一股向善的力量”,指出即便是價值對齊這一確保 AI 無害的核心工具本身,也可能被濫用。
論文用充分的現實證據支撐這一論點,且其討論范圍并未局限于某個國家或某家公司,而是覆蓋所有現在及未來可能存在的權力主體。
論文提出了若干緩解對齊濫用風險的方向,提醒整個研究社區正在開發的技術具有兩用性。
ICML 2026 時間檢驗獎
時間檢驗獎的評選由 ICML 2016 聯合項目主席 Kilian Weinberger 主持,候選范圍覆蓋當年所有被 ICML 2016 接收的論文,他們先根據引用量與學術聲譽篩出 8 篇候選論文,再咨詢各自子領域的權威學者評估長期影響力,最終評選出ICML 2026時間檢驗獎。
Asynchronous Methods for Deep Reinforcement Learning
作者:Volodymyr Mnih、Adrià Puigdomènech Badia、Mehdi Mirza、Alex Graves、Timothy P. Lillicrap、Tim Harley、David Silver、Koray Kavukcuoglu
機構:谷歌、蒙特利爾大學
論文鏈接:https://arxiv.org/pdf/1602.01783
論文簡介:這篇論文開創了異步強化學習方法,是 RL 在大語言模型后訓練中取得成功的重要推動因素之一,也重塑了業界實踐強化學習的方式。
其核心洞見,即“并行的多個 actor-learner 能夠穩定訓練過程”,此后啟發了大量后續工作,在機器學習社區留下了持久的影響。
ICML 2026 杰出論文榮譽提名 The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
作者:Mohammad Taufeeque、Stefan Heimersheim、Adam Gleave、Chris Cundy
機構:FAR AI
論文鏈接:https://arxiv.org/abs/2602.15515
論文簡介:這篇論文在一個真實的代碼優化環境中(該環境天然容易誘發獎勵作弊)系統研究了針對白盒“測謊探針”(lie detector)進行訓練所帶來的風險。
研究團隊構建了訓練環境下的分類體系,公然欺騙、混淆激活、混淆策略,并結合理論證明與實驗結果,說明策略梯度方法本身并不會直接產生操縱激活的優化壓力。研究還表明,通過高 KL 正則化配合強探針懲罰,可以在一定程度上緩解對齊失效問題,為可擴展監督提供了有價值的工程基礎。
Motion Attribution for Video Generation
作者:Xindi Wu、Despoina Paschalidou、Jun Gao、Antonio Torralba、Laura Leal-Taixé、Olga Russakovsky、Sanja Fidler、Jonathan Lorraine
機構:英偉達、普林斯頓大學、MIT CSAIL
論文鏈接:https://arxiv.org/abs/2601.08828
論文簡介:這篇論文提出 Motive,一種面向運動的、基于梯度的數據歸因框架,可擴展至大規模高質量視頻數據集與生成模型,用于追蹤單條訓練樣本對視頻生成中運動質量的影響。
該方法通過運動加權的損失掩碼,將時序動態與靜態外觀解耦,實現了高效且可擴展的運動專屬影響力計算。僅使用原始訓練集十分之一規模的高影響力數據,該方法在 VBench 上取得的運動平滑度與動態程度均優于原模型,人類偏好勝率達到 74.1%。
How much can language models memorize?
作者:John Xavier Morris、Chawin Sitawarin、Narine Kokhlikyan、Chuan Guo、G. Edward Suh、Alexander M. Rush、Kamalika Chaudhuri、Saeed Mahloujifar
機構:Meta、谷歌、康奈爾大學、英偉達
論文鏈接:https://arxiv.org/abs/2505.24832
論文簡介:語言模型究竟是在復述存儲的知識,還是在真正泛化,一直存在爭議。這篇論文提出用“柯爾莫哥洛夫式記憶”來衡量模型對一個數據分布究竟學到了多少,并將記憶進一步拆分為“非預期記憶”(模型包含的特定數據集信息)與“泛化”(模型包含的真實數據生成過程信息)兩部分。
該論文用扎實的理論框架區分二者,并配合大規模實證測量,最終給出一個大膽的結論:GPT 系列風格的語言模型每個參數大約能編碼 3.6 比特信息,且模型會先填滿自身容量再進入“頓悟”(grokking)式的泛化階段。
A Random Matrix Perspective on the Consistency of Diffusion Models
作者:Binxu Wang、Jacob A. Zavatone-Veth、Cengiz Pehlevan
機構:哈佛大學等
論文鏈接:https://arxiv.org/abs/2602.02908
論文簡介:近期實證研究發現,擴散模型在確定性采樣下展現出極高的跨訓練一致性,即便用不同數據切分、不同架構訓練,同一個噪聲種子也會被映射到幾乎相同的圖像輸出。
這篇論文用理論證明了這一現象根源于共享的線性高斯統計量:通過一個線性去噪器框架追蹤有限樣本的數據集波動如何扭曲生成結果,作者證明這種一致性并非源自復雜的高階深度學習動態或數據記憶,而是有著線性起源——不同數據切分間共享的經驗高斯統計量(均值與協方差)本身就足以預測大部分跨切分一致性。
這項工作把一個看似神秘的實證現象,轉化為了一個優雅且有數學根基的生成式模型可復現性基準。
To Grok Grokking: Provable Grokking in Ridge Regression
作者:Mingyue Xu、Gal Vardi、Itay Safran
機構:普渡大學等
論文鏈接:https://arxiv.org/abs/2601.19791
論文簡介:Grokking 是指模型先快速過擬合、泛化很差,但訓練足夠久之后才逐漸學會泛化的現象,這一現象之所以引人關注,是因為它暗示了模型何時才真正學到了復雜問題背后的“真實”結構。
此前已有工作對深度模型中的這一現象給出分析,但未能證明全局收斂結果。
這篇論文則在純線性模型這一最基礎的設定下研究 grokking,證明嶺回歸(ridge regression)中會出現兩階段行為。這一發現的價值在于:它證明了 grokking 可以在這樣簡單的設定下出現,為理解 grokking 提供了一個“玩具模型”,就像深度線性網絡此前被證明對分析非線性網絡很有價值一樣。
ICML 2026 杰出立場論文榮譽提名 Position: AI/ML Deepfake Research is Misaligned with AI Generated Non-Consensual Intimate Imagery (AIG-NCII)
作者:Li Qiwei、Wells Lucas Santo、Sarita Schoenebeck、Eric Gilbert
機構:密歇根大學
論文鏈接:https://openreview.net/pdf?id=mLhZzo7BIb
論文簡介:這篇論文指出了當前 Deepfake 研究與 AI 生成的非自愿親密影像(AIG-NCII)問題之間存在的非對齊(misalignment)。論文清晰展示了現有技術研究重心與 AIG-NCII 造成的普遍性傷害之間的差距,說明當前研究對受害者影響的忽視正在加劇而非緩解 AIG-NCII 帶來的負面后果,并提出了一份研究議程清單。作者認為,這篇論文是所有從事該領域研究的人都應該讀一讀的文章。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.