近日,人工智能領(lǐng)域的頂級(jí)會(huì)議——國(guó)際機(jī)器學(xué)習(xí)大會(huì)(ICML) 公布了2026年度的各項(xiàng)大獎(jiǎng)。
ICML與NeurIPS、ICLR并稱為AI領(lǐng)域的三大頂會(huì)。其“杰出論文獎(jiǎng)”含金量極高,被譽(yù)為機(jī)器學(xué)習(xí)領(lǐng)域的“奧斯卡”。本屆大會(huì)共收到超過(guò)一萬(wàn)篇投稿,最終錄用率不足三成,能夠從中脫穎而出的獲獎(jiǎng)?wù)撐模瑹o(wú)疑是經(jīng)過(guò)了最嚴(yán)苛的學(xué)術(shù)檢驗(yàn)。
在激烈的競(jìng)爭(zhēng)中,清華大學(xué)自動(dòng)化系長(zhǎng)聘副教授、智能產(chǎn)業(yè)研究院(AIR)研究員黃高所帶領(lǐng)的團(tuán)隊(duì),憑借其突破性研究榮獲了ICML 2026杰出論文獎(jiǎng)。
獲獎(jiǎng)?wù)撐模航沂尽办`活性陷阱”
黃高團(tuán)隊(duì)的獲獎(jiǎng)?wù)撐念}為 《靈活性陷阱:重新思考擴(kuò)散語(yǔ)言模型中任意順序的價(jià)值》(The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models) 。
這篇論文聚焦于當(dāng)下熱門的擴(kuò)散大語(yǔ)言模型(dLLM) 。與GPT等傳統(tǒng)模型從左到右逐字生成的方式不同,dLLM理論上可以以任意順序生成文本,這曾被看作是其相較于傳統(tǒng)模型的巨大優(yōu)勢(shì)。
然而,黃高團(tuán)隊(duì)的研究揭示了一個(gè)反直覺(jué)的現(xiàn)象:這種“任意順序”的靈活性在實(shí)際訓(xùn)練中非但沒(méi)有帶來(lái)預(yù)期的收益,反而成為了一個(gè) “陷阱” 。研究發(fā)現(xiàn),模型會(huì)利用這種順序自由,刻意繞開(kāi)那些對(duì)探索至關(guān)重要但充滿不確定性的內(nèi)容,導(dǎo)致其推理空間過(guò)早坍縮。這一發(fā)現(xiàn)直接動(dòng)搖了擴(kuò)散語(yǔ)言模型最核心的賣點(diǎn),為整個(gè)領(lǐng)域的研究方向提供了重要的糾偏。
其他獲獎(jiǎng)亮點(diǎn)
杰出論文獎(jiǎng):另一篇獲獎(jiǎng)?wù)撐氖莵?lái)自MIT、耶魯?shù)葯C(jī)構(gòu)的《擴(kuò)散模型和對(duì)數(shù)凹分布的高精度采樣》,在算法精度上實(shí)現(xiàn)了重大突破。
時(shí)間檢驗(yàn)獎(jiǎng):頒給了谷歌DeepMind的經(jīng)典之作《深度強(qiáng)化學(xué)習(xí)的異步方法》。
杰出立場(chǎng)論文獎(jiǎng):授予了慕尼黑大學(xué)等機(jī)構(gòu)的《立場(chǎng):對(duì)齊社區(qū)正在無(wú)意中構(gòu)建審查工具包》。
黃高團(tuán)隊(duì)的這項(xiàng)研究揭示了一個(gè)被長(zhǎng)期忽視的事實(shí):在當(dāng)前的訓(xùn)練范式下,dLLM的“任意順序”本身就是一把雙刃劍。用更少的步數(shù)、更簡(jiǎn)單的采樣策略,或許才是真正通向更高效率的路徑。
文章來(lái)源:水木TsinghuaCent。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.