“對于機器人而言,在訓練環境中完成任務并不算最難,真正困難的是進入一個沒有見過的房間、面對新的物體或任務時,仍然能夠作出正確判斷。
這背后對應著具身智能的一項核心能力——泛化。一個機器人大腦究竟學到了可以遷移的規律,還是僅僅以復雜方式“記住”了訓練數據?過去,我們可以通過成功率評價機器人做得對不對,卻很難直接衡量其內部策略到底有多復雜、能否適應新環境。
千訣科技聯合清華大學團隊為此提出了一把新的神經網絡“復雜度標尺”——有效階(Effective Degree,ED)。它將抽象的“簡單性偏置”轉化為一個能夠在真實規模模型上計算、比較并直接參與訓練的指標,讓研究者不僅可以測量模型學到的規律有多復雜,還能在訓練中主動減少不必要的高階變化。
這項研究目前驗證于視覺、語言、視覺—語言模型和強化學習等任務。其潛在價值在于,為機器人大腦篩選模型、診斷訓練過擬合,以及提升策略面對新任務和新環境時的泛化能力,提供一種新的技術路徑。
值得關注的是,這條研究路線還與圖靈獎得主 Yann LeCun 團隊近期受到關注的世界模型理論形成呼應,而千訣科技與清華團隊對相似方法論視角的公開研究,比 LeCun 團隊早約一年。
今年 5 月, Yann LeCun 與 David Klindt、Randall Balestriero 的論文《When Does LeJEPA Learn a World Model?》一經發布便獲得廣泛關注。論文從隱變量可辨識性的角度研究 LeJEPA 驅動的世界模型,并用 Hermite 多項式將高斯世界中的函數按非線性次數分解:非線性階數越高,在 LeJEPA 的 alignment 目標下受到的懲罰越強,因此線性恢復真實隱變量成為最優解。
值得注意的是,清華大學自動化系陳峰教授和千訣科技的聯合團隊(第一作者章天任)就在 ICML 2025 論文《When Do Neural Networks Learn World Models?》中采用了相近的方法論視角:將“學習世界模型”形式化為對數據生成隱變量的恢復(辨識)問題,并通過正交函數基將復雜函數分解為不同階次,研究神經網絡在解空間的低階偏置如何促使真實隱變量變得可辨識。
兩項研究使用的數學工具并不完全相同:千訣-清華團隊研究多任務學習設定下具有低階偏好的神經網絡模型,使用 Fourier-Walsh 變換分析離散布爾世界;LeCun 等人研究 LeJEPA 及帶平穩動力學的高斯世界,使用 Hermite 多項式進行譜分解。但二者嘗試回答的關鍵問題和技術路徑又是相似的:從隱變量可辨識性出發,用函數的階次刻畫“簡單性”,再借助訓練目標對低階解的偏好,解釋模型何時能夠恢復世界的真實結構。
如今,千訣-清華團隊又把這條理論線索向現實模型推進了一步。
在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,研究團隊不再只問“低階偏好為何能幫助模型學到世界結構”,而是進一步追問:這種偏好能不能在真實的 ResNet、ViT、語言模型和強化學習策略網絡上被直接測量,甚至被主動優化?
他們給出的答案是“有效階”(Effective Degree,ED):沿真實數據點之間的插值路徑觀察高維神經網絡,用正交多項式擬合模型輸出,再根據不同階次成分的權重計算函數復雜度。由此,“簡單性偏置”從團隊上一項工作中的理論假設,變成了一個兼具通用性、可計算性和可微性的實用工具。
要理解 ED 解決了什么問題,還要回到深度學習中的一個經典謎題:為什么參數量遠多于訓練樣本的神經網絡,依然能在未見數據上表現良好?
一個廣為接受的解釋是“簡單性偏置”(simplicity bias):面對許多都能擬合訓練數據的函數,神經網絡及其訓練過程并非隨機選擇,而是更傾向于學到相對簡單的那個。類似奧卡姆剃刀,越簡單的規律,往往越有可能超越有限樣本,遷移到新的數據分布。
但一個基礎問題始終沒有令人滿意的答案:對于現代深度神經網絡,我們究竟該如何定義并測量“簡單”?
參數范數、損失面的 sharpness、Jacobian 范數、線性區域數量、壓縮長度……已有研究提出了不少候選指標,但往往難以同時做到三點:
- 通用性(generality):不依賴某一種特定網絡架構或任務;
- 可量化(quantifiable):能在真實規模的已訓練模型上穩定計算;
- 可優化(optimizable):不僅能事后評價模型,還能通過梯度直接參與訓練。
千訣-清華團隊嘗試給出一個同時滿足上述要求的答案。
他們提出了一種多項式表征(polynomial representations)方法:
- 用數據點之間的插值路徑“切開”高維神經網絡,并以正交多項式近似網絡沿路徑的行為;
- 用多項式表征的有效階(effective degree,ED)衡量神經函數的簡單性;
- 將 ED 進一步變成可微的正則項,實現對神經函數復雜度的在線優化。
實驗中,ED 不只是一個事后分析指標:在多個benchmark上,ED 都可以相當精確地預測出模型的實際generalization gap;在對神經網絡 grokking 現象的分析中,ED 也呈現出比參數范數、sharpness 等指標更穩定的信號。更進一步,由于整個度量過程可微,研究團隊還將 ED 寫入訓練目標,在圖像、文本、視覺-語言模型和強化學習任務中直接優化模型的函數復雜度,并由此帶來泛化性能的提升。
論文標題:Quantifying and Optimizing Simplicity via Polynomial Representations
論文作者:章天任、李向欣、肖明昊、陳冠宇、陳峰
論文地址:https://arxiv.org/abs/2605.29823
代碼地址:https://github.com/xinzaixinzai/Effective-Degree
01.
“簡單” 為什么難以測量?
衡量神經網絡復雜度的一種常見思路是觀察參數空間。例如,參數范數越小,或者局部損失面越平坦(也即sharpness越小),模型也許就越簡單。
但參數并不等于函數。同一個函數可以由尺度和參數化方式截然不同的權重實現;即便網絡輸出完全不變,一次重參數化也可能顯著改變參數范數或 sharpness。換言之,這些指標有時反映的是模型“如何被寫出來”,而不一定是模型實現的函數本身有多復雜。
另一種更直接的思路,是在函數空間里定義復雜度。線性函數通常比二次函數簡單,二次函數又比高階振蕩函數簡單,因此按多項式次數衡量非線性程度十分自然。
然而,現代神經網絡往往是從高維輸入到高維輸出的黑盒函數。如果直接在原始空間擬合多元多項式,基函數數量會隨維度和階數發生組合爆炸,在真實模型上幾乎不可計算。
研究團隊由此采用了一個降維視角:不試圖一次看清整個高維函數,而是沿數據分布附近的許多一維路徑觀察它。
02.
沿數據路徑,給高維神經網絡做“函數切片”
給定從數據分布中采樣的兩個樣本 x?、x?,團隊在二者之間構造插值路徑:x(α) = αx? + (1-α)x?,α ∈ [0,1]
對于神經網絡 f,模型沿這條路徑的輸出就變成了一個關于單變量 α 的函數。一個原本高維且復雜的神經函數,由此轉化為許多條一維的“函數切片”。
接下來,團隊使用 Chebyshev 正交多項式近似每條路徑上的模型行為。如果模型輸出沿路徑接近線性變化,能量會集中在低階系數上;如果輸出頻繁振蕩,就需要更多高階項才能描述。
一個自然的問題是:把高維函數限制到一維路徑,會不會破壞原有的復雜度排序?論文給出的理論結果顯示:對于多元多項式,只要插值方向來自具有密度的數據分布,隨機路徑幾乎必然保留其代數階;也即,對多條路徑取平均后,不同階多項式的復雜度順序仍能被正確區分。
在實際計算中,研究團隊還加入了三項設計:使用數據相關路徑,將測量集中在真實數據分布附近;使用 Chebyshev 正交多項式基和余弦采樣,緩解高階擬合的數值不穩定;對于高維輸出,可沿每條路徑使用 PCA,只保留主要變化方向再進行擬合。
03.
有效階:不只看“最高幾階”,還看每一階有多重要
嚴格的代數階只取決于最高階非零系數。即使某個高階項系數小到幾乎可以忽略,函數仍會被判定為“高階”,這使它對數值噪聲和真實神經網絡中的微小擾動非常敏感。
為此,論文定義了多項式表征的有效階 ED:它可以被理解為“各階成分按系數幅度加權后的平均復雜度”。低階成分占主導時,ED 較小;高階成分越多、幅度越大,ED 就越高。與只看最高非零階不同,ED 關于擬合系數是連續且穩定的。最后,對從數據分布中采樣的多條路徑取平均,即可得到整個神經網絡的復雜度估計。
![]()
【圖 1:多項式表征方法總覽。沿真實數據點之間的插值路徑觀察神經函數,以正交多項式擬合每條路徑上的輸出,并根據不同階次的系數計算函數復雜度 ED。】
ED 的定義有兩個關鍵特征。第一,它位于函數空間,不直接依賴模型如何參數化;第二,它與數據分布相關,因此衡量的實際上是模型在真實數據附近表現出的復雜度,這也符合模型實際使用場景的需要。
04.
ED 能預測泛化嗎?
團隊首先把 ED 作為訓練后的評價指標,與參數范數、sharpness 和 adaptive sharpness 等現有的常用 generalization proxy 進行比較。
在 CIFAR-10 上,他們使用 27 組不同超參數分別訓練 ResNet18 和 ViT-Tiny。對于 ResNet18,ED 與 generalization gap 的 Pearson 相關系數達到0.99,線性擬合 R2 達到0.98。相比之下,表現最好的 sharpness 指標相關系數為 0.94,R2 為 0.88。也就是說,模型在數據路徑上的高階成分越多,訓練集與測試集之間的差距往往也越大。
![]()
【圖 2:ResNet18 在 CIFAR-10 上的結果。相比 sharpness、adaptive sharpness 與參數 L2 范數,ED 與 generalization gap 呈現出最強的線性相關性。】
在 CLIP ViT 的 ImageNet 微調實驗中,ED 同樣與泛化間隙保持穩定正相關;sharpness、adaptive sharpness 和參數范數在這一設置下則表現出較弱、甚至方向相反的相關性。這也側面印證了基于參數空間而非函數空間的泛化界度量的不魯棒性。
![]()
【圖 3:CLIP ViT 在 ImageNet 上的結果。ED 與 generalization gap 保持正相關,而其他指標在這一設置下呈負相關。】
ED 還能揭示同一個模型在訓練過程中的復雜度變化。在經典的神經網絡 grokking 現象中,模型通常先記住訓練集,經過很長時間后才突然獲得泛化能力。實驗顯示,ED 在記憶階段逐漸升高,在驗證損失開始驟降的轉折點附近達到峰值,隨后隨著泛化形成而下降。參數范數在整個過程中單調增大,sharpness 也沒有清晰地標出這一相變。
![]()
【圖 4:Grokking 實驗結果。只有 ED 可以捕捉到模型在訓練過程中從記憶到泛化的相變。】
這意味著,ED 不僅可以比較不同模型在訓練完成后的復雜度和泛化界,還可能追蹤一個模型在訓練過程中如何從“記憶樣本”轉向“歸納規律”。
05.
從測量簡單性到優化簡單性
如果 ED 只能作為一個模型復雜度評估指標,它仍然只是一個分析工具。論文更進一步指出,由于多項式擬合本質上是一個最小二乘問題,擬合系數對網絡輸出具有解析梯度,因此 ED 可以自然地穿過擬合過程,反向傳播到模型參數。
研究團隊由此將 ED 作為顯式正則項加入原任務目標。它并不強迫模型沿插值路徑嚴格線性,也不要求人為給插值樣本指定“正確標簽”;它只是懲罰不必要的高階變化,讓模型在完成原任務的同時,優先選擇相對簡單的函數。
實驗覆蓋了圖像與文本監督分類、視覺-語言模型微調和強化學習等場景。在 CLIP 微調中,加入 ED 正則的模型在分布內準確率與平均分布外準確率的權衡上整體優于標準微調;在多個強化學習環境中,ED 正則也帶來了更好的訓練表現。
![]()
【圖 5:ED 正則化在強化學習任務上的表現。】
06.
“簡單”未必等于“正確”
論文也明確討論了方法的邊界:“越簡單越好”并非無條件成立。
如果數據中最簡單的特征恰好是一個不穩健的 shortcut,ED 可能與普通模型一樣優先利用它。ED 描述的是函數復雜度,并不等同于正確性、語義合理性或公平性。如何讓“簡單”與正確的歸納偏置對齊,仍需要數據、任務目標和模型架構共同參與。
此外,路徑多項式只是高維函數的一種分布相關代理;訓練時采樣額外插值點,也會帶來一定計算開銷。
07.
總結
千訣-清華團隊的研究工作給出了一個從函數空間理解神經網絡的新工具:在表征層面,用數據相關路徑上的正交多項式緊湊描述高維神經函數;在度量層面,用有效階穩定量化高階成分,并預測模型的泛化行為;在優化層面,通過可微的多項式擬合,使得模型的復雜度或簡單性可以被在線優化。
從更廣泛的視角看,多項式表征在理論與實踐之間搭起了一座橋:理論上,模型的低階偏置可以幫助研究者分析神經網絡為何可能學到世界模型;實踐中,“有效階”讓這種偏好也可以被測量和干預。
由此也產生了一系列值得繼續追問的問題:不同架構和優化器會形成怎樣的 ED 動態?ED 能否用于選擇預訓練 checkpoint、診斷微調過擬合,或設計更適合世界模型的自監督任務?除了多項式次數,是否還存在其他同時具備通用性、可計算性與可微性的函數空間表征?
參考文獻
[1] Zhang, T., Li, X., Xiao, M., Chen, G., & Chen, F. Quantifying and Optimizing Simplicity via Polynomial Representations. ICML, 2026. https://arxiv.org/abs/2605.29823
[2] Zhang, T., Chen, G., & Chen, F. When Do Neural Networks Learn World Models? ICML, 2025. https://arxiv.org/abs/2502.09297
[3] Klindt, D., LeCun, Y., & Balestriero, R. When Does LeJEPA Learn a World Model? arXiv preprint, 2026. https://arxiv.org/abs/2605.26379
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.