![]()
這項由麻省理工學院(MIT)與Mirror Physics公司聯合開展的研究,以預印本形式于2026年4月13日發布,論文編號為arXiv:2604.09130。感興趣的讀者可通過該編號在arXiv平臺查閱完整論文。
**原子世界里的"地圖測繪師"**
每當科學家想要設計一種新材料——比如更耐用的電池、更高效的催化劑,或者某種能吸收空氣中二氧化碳的化學物質——他們最想知道的一個基本問題是:這些原子聚在一起之后,能量是多少?原子之間的力又是怎樣的?
回答這個問題的傳統方法叫做"密度泛函理論計算"(DFT),可以把它理解成一張極其精確的原子世界地圖測繪工作。這份地圖非常準確,但繪制起來極其耗時——一次完整的計算往往需要花費幾小時甚至幾天的時間。對于那些需要探索成千上萬種原子排列方式的材料研究者來說,這種速度簡直是噩夢。
正因如此,近年來研究者們開始訓練神經網絡來充當"快速地圖閱讀器"——用機器學習模型來預測那些耗時的量子力學計算結果。麻省理工學院與Mirror Physics團隊正是在這條賽道上持續深耕的一支力量。他們的最新成果,叫做EquiformerV3,是同系列模型的第三代產品。
這篇文章要講的,就是這第三代"地圖閱讀器"究竟做了哪些升級,為什么這些升級很重要,以及它在真實的科學測試中表現如何。
**一、為什么普通的神經網絡不夠用**
要理解這項研究的意義,先得明白一個核心挑戰:原子世界有其特殊的"游戲規則"。
考慮這樣一個場景——你手里捧著一個水分子,由兩個氫原子和一個氧原子組成。無論你怎么旋轉這個分子,它的化學性質不會改變。把它向左轉30度,或者向右轉90度,它依然是水,它的能量依然是相同的數值。科學家把這種性質叫做"旋轉等變性"(equivariance)——物理規律在旋轉變換下保持不變。
普通的神經網絡,比如那些用來識別貓咪圖片的模型,根本不具備這種特性。給它一張正立的貓的照片和一張倒立的貓的照片,它可能會給出完全不同的判斷,除非你專門訓練它識別各種角度。對于原子模擬來說,這種"不知道旋轉"的問題會導致模型的預測毫無物理意義。
于是,研究者們專門設計了一類叫做"SE(3)等變圖神經網絡"(SE(3)-equivariant GNN)的模型。這類模型在設計之初就把旋轉和平移的對稱性"燒錄"進了自己的運算結構里,無論原子云從哪個角度被觀察,它給出的能量預測都是一致且正確的。
EquiformerV3正是這類模型中的佼佼者。它的前兩代產品EquiformerV1和EquiformerV2已經在科學界贏得了相當的聲譽。而這一次,第三代在三個維度上同時發力:更快、更強、更通用。
**二、從齒輪到火箭:計算速度的優化**
一臺好的跑車,光有強勁的引擎還不夠,傳動系統也得跟得上。對于神經網絡來說,道理是一樣的。即使模型架構設計得再精妙,如果底層的軟件實現效率低下,大量的計算時間就會白白浪費在無意義的重復操作上。
EquiformerV3的第一項改進,就是專注于清理這些"無意義的重復"。
前一代模型EquiformerV2在做核心計算時,采用了一種叫做"eSCN卷積"的技術。這種技術的工作方式,可以理解為:先把原子特征信息"旋轉"到一個特定的坐標系,然后在這個坐標系里做計算,最后再"旋轉"回來。在旋轉的過程中,原有實現需要額外乘以一個"排列矩陣"來重新整理數據的順序,而這個操作在每次計算中都要重復執行,浪費了大量資源。
研究團隊發現,這個排列步驟完全可以預先合并到旋轉矩陣里——換句話說,只需要在程序啟動時做一次"預處理",后續所有計算就再也不需要這個額外步驟了。這就像把每次做飯前都要臨時磨刀的過程,改成一開始就備好一把永遠鋒利的刀,省去了每次重復磨刀的時間。
除了融合冗余操作,團隊還修復了若干代碼層面的小問題,讓程序支持PyTorch的"編譯加速"功能(torch.compile())。這個功能可以讓程序在運行前先對計算流程進行整體優化,就像讓廚師在開始烹飪前先把所有食材都切好備齊,而不是邊做邊找食材。
這兩項看似"不起眼"的工程優化,加在一起讓模型訓練速度提升了1.75倍——在同等時間內,能處理的數據量多出了將近一倍,而預測精度完全沒有下降。
**三、三把新工具:讓模型更聰明、更穩健**
速度提上來之后,研究團隊開始著手改進模型的"大腦"本身。他們引入了三項架構層面的改進,每一項都針對前一代模型的一個具體缺陷。
**第一把工具:統一的"標準化尺"**
模型在處理原子特征時,需要對數據進行"標準化"——就像把各種單位的測量數據統一換算成同一套標準,才能進行比較和運算。前代模型采用的方式是給每個"維度"(專業術語叫"度",即degree L)單獨計算一把"尺子",然后用各自的尺子來標準化各自的數據。這種做法會產生一個問題:所有維度被拉平到同一個尺度之后,原本不同維度之間的相對重要性就消失了——就像把身高180cm的人和身高150cm的人都"標準化"為同一個數值,再也分不清誰高誰矮。
EquiformerV2為了解決這個問題,引入了"分離式層歸一化":對標量特征(L=0)用一把尺子,對其他所有維度(L>0)共用另一把尺子,從而保留了不同維度之間的相對大小關系。
EquiformerV3更進一步,提出了"等變合并層歸一化"(equivariant merged layer normalization):把所有維度的均方根值先各自算出來,然后求一個平均,得到一個統一共享的"合并均方根值",再用這個共享的值來標準化所有維度。這就相當于給所有維度找了一個共同的"參考基準",既保留了維度間的相對關系,又讓標準化過程更加一致和穩定。實驗數據表明,這個改動讓能量預測誤差和力預測誤差都有所下降。
**第二把工具:給"信息處理中樞"擴容**
在等變圖神經網絡里,計算量最大的環節是處理原子之間的"邊"信息——也就是兩個原子之間的相互作用。這部分計算代價高昂,因為它涉及復雜的張量積運算。相比之下,處理每個原子自身節點信息的"前饋網絡"(feedforward network,FFN)則要輕量得多。
這就像一家工廠里,重型機器(邊計算)每小時耗電1000度,而普通流水線(節點計算)每小時只耗電10度。在這種情況下,擴大普通流水線的產能,增加的成本極其有限,但能帶來的產出提升卻相當可觀。
研究團隊把前饋網絡的隱藏層維度擴大了4倍,模型的參數量只增加了22%,訓練時間僅多出了8.6%,但預測精度卻得到了明顯改善。這是一筆非常劃算的"買賣"。
**第三把工具:給"視線"加上平滑的邊界**
這項改進涉及一個非常直覺性的問題:當一個原子剛好處于另一個原子的"感知范圍"邊界時,會發生什么?
模型在計算時,每個原子只考慮一定距離范圍內的鄰居原子,超出這個范圍的原子就被"無視"了。這個范圍的邊界叫做"截斷半徑"(cutoff radius)。問題在于,如果邊界是硬性的——原子一旦越過這條線就突然從"存在"變為"不存在"——模型預測的勢能面(描述原子運動的能量地形圖)就會出現"斷崖",在邊界處發生不連續的跳變。
對于單純預測靜態結構的能量來說,這個斷崖問題影響不大。但當科學家需要用模型來驅動分子動力學模擬——讓原子按照計算出的力連續運動——這種不連續性就會導致能量不守恒,模擬結果失真,甚至崩潰。
前代的eSEN模型為了解決這個問題,引入了"包絡函數"(envelope function)——一個在邊界處平滑衰減到零的函數,讓原子對能量的貢獻在越過邊界時像夕陽西下一樣漸漸消失,而不是突然熄滅。EquiformerV3也采用了這個思路,但進一步發現:僅僅對"消息值"(value vector)加上包絡函數是不夠的,還需要在注意力權重的softmax計算中也引入包絡函數。原因是softmax操作本身依賴于所有鄰居原子的信息,當某個原子突然進入或離開截斷范圍時,softmax的分母會發生突變,從而導致注意力權重不連續。將包絡函數同時嵌入softmax操作中,才能從根本上保證預測結果的平滑性。
這三把工具組合起來,讓EquiformerV3在保持高效的同時,具備了用于真實物理模擬的基礎能力。
**四、最核心的創新:SwiGLU-S?激活函數**
前面三項改進都可以看作對已有設計的精細打磨,而第四項改進則帶來了一個全新的組件,也是整篇論文最具原創性的貢獻:SwiGLU-S?激活函數。
要理解這個激活函數,得先解釋兩個概念,然后再看它們是如何被巧妙地合并在一起的。
**"球面投影":把特征鋪開在地球儀上**
等變神經網絡內部處理的數據,是由一系列"不可約表示"(irreps,簡稱irreps)組成的特征向量。這些特征可以被理解為:每個原子攜帶著一套"多維度的天線",不同維度的天線感知不同的方向信息,L=0的天線感知全方向均勻的信息,L=1的天線感知方向性信息,L=2的天線感知更精細的角度信息,以此類推。
S?激活(Spherical Activation,球面激活)是一種早在2018年就被提出的技術。它的工作原理是:把這些多維度的天線信號,投影到一個虛擬的地球儀表面——也就是單位球面S?上。在這個地球儀的每個采樣點(經緯度坐標點)上,你可以把多個天線信號的疊加值讀出來,得到一個普通的數字。然后,對這些普通數字做任意你想要的數學變換(比如激活函數),最后再把處理后的信號"收回"到原來的多維天線表示。
這種方式有一個顯著優點:在球面上,對普通數字的操作不會破壞整個系統的旋轉等變性,因為投影和反投影過程本身保持了對稱性。然而,它也有一個隱患:如果在球面上做的操作(比如SiLU激活函數)引入了高頻分量,球面上的采樣點就需要足夠密集,否則會產生"混疊誤差",破壞等變性。EquiformerV2采用的正是這種S?激活,但為了保持等變性,不得不使用相當密集的采樣網格。
**張量積:讓原子"握手"**
張量積(tensor product)是等變網絡里最強大也最昂貴的操作之一。可以把它理解為:讓兩套天線信號"握手",從而產生更復雜的組合信號。通過不斷握手,網絡能夠逐漸捕捉到越來越多的"多體相互作用"——不僅僅是兩個原子之間的關系,還能感知三個、四個乃至更多原子共同構成的幾何構型。
問題是,傳統的張量積計算代價極高。好在研究者發現,利用球面投影可以大幅簡化張量積:把兩套特征都投影到地球儀表面之后,只需要對每個網格點上的兩個數值做簡單的"點乘"(elementwise multiplication),就等價于做了一次自對稱路徑的張量積。這把張量積的計算復雜度從O(L?_max)降低到了O(L?_max)。
**SwiGLU-S?:兩者合一**
SwiGLU是近年來在大型語言模型(如LLaMA、GPT系列)中廣泛使用的一種激活函數,它的核心思想是"門控乘法":用一路信號來控制另一路信號的"開關"程度。比"直接打開或關閉"更精細,比"單純線性縮放"更有表達力。
研究團隊把SwiGLU的門控思想和S?的球面投影思想融合在一起,設計出了SwiGLU-S?激活函數。具體工作方式是這樣的:把特征分成三路——一路標量信號(L=0,也就是全方向均勻的天線),以及兩路被投影到地球儀表面的網格信號。標量信號經過Sigmoid函數(一個把任意數值壓縮到0到1之間的函數,可以理解為一個"音量旋鈕")處理后,用來門控性地乘以兩路網格信號之間的逐點乘積。
這個設計有兩個關鍵妙處。第一,非線性變換(Sigmoid)只施加在標量上,而標量沒有方向信息,不存在被高頻噪聲破壞等變性的風險。球面網格上的操作只有點乘,點乘不會引入高頻分量。因此,SwiGLU-S?所需的采樣網格點數可以大幅減少——對于L_max=6的情況,注意力模塊所需的網格點從324個減少到了160個,采樣復雜度降低了50.6%,同時嚴格保持等變性。第二,兩路網格信號的逐點乘積,等價于做了一次自張量積(x?x)。這意味著,每經過一個包含SwiGLU-S?激活的前饋網絡,模型就能捕捉到更高階的多體相互作用。堆疊兩個這樣的網絡,就相當于(x?x)?(x?x),可以捕捉到5階相互作用。這種能力,是之前的門控激活和S?激活都不具備的。
研究團隊專門復現了一組經典的"幾何圖分辨實驗"來驗證這一點。實驗中有若干對幾何圖,它們的兩原子間距離完全相同,但三原子間角度不同,或者更高階的幾何關系不同。門控激活和普通S?激活的模型,無論堆疊多少層,都無法區分這些幾何圖,只能猜測,準確率停在50%。而使用SwiGLU-S?激活的模型,堆疊兩個前饋網絡就能區分所有測試中的幾何圖,實現100%準確率。這是理論表達能力上的質的提升。
**五、戰場檢驗:在三大基準測試中的表現**
光有理論突破還不夠,最終還要看在真實數據上的表現。研究團隊在三個不同規模和類型的數據集上對EquiformerV3進行了全面評估。
**第一戰場:OC20——催化劑研究的大考場**
OC20是迄今為止最大的開放催化劑數據集之一,包含超過120萬條DFT計算軌跡,覆蓋各種吸附分子和催化劑表面的組合。主要任務是給定一個原子結構,預測其能量和每個原子所受的力。
研究團隊做了一個系統的消融實驗——也就是把每項改進一個一個地"加上去",觀察每一步帶來的變化,就像給一道菜依次加入不同的調料,記錄每種調料對味道的貢獻。
從最基本的EquiformerV2出發,首先把預測目標從"吸附能"改為"總能量",這一步單獨就把能量誤差從296 meV降到了242 meV,力誤差從21.23降到19.73 meV/A。接著加入軟件優化(不改變精度,訓練時間從270 GPU小時降到154小時)。加入等變合并層歸一化后,誤差進一步下降到236 meV和19.28 meV/A。擴大前饋網絡隱藏層后,能量誤差降到209 meV,力誤差降到18.96 meV/A,而訓練時間只增加了9小時左右。加入平滑截斷注意力后,力誤差小幅下降到18.82 meV/A。最后加入SwiGLU-S?激活后,能量誤差降至201 meV,力誤差降至18.15 meV/A。
與最初的EquiformerV2基線相比,全套改進讓能量誤差減少了41 meV,力誤差減少了1.58 meV/A,同時訓練時間節省了將近37%。更值得一提的是:與EquiformerV2使用1.5倍更多Transformer塊、訓練2.5倍更多輪次的超大版本相比,EquiformerV3可以達到相當的力預測精度,但只需要后者約六分之一的訓練時間。
**第二戰場:OMat24——材料科學的寶庫**
OMat24是由Meta公司發布的開放材料數據集,包含超過1.1億個非平衡晶體結構,是目前規模最大的無機材料計算數據集之一。這個數據集不僅要預測能量和力,還要預測應力張量(描述材料在受到外力時如何形變的量)。
研究團隊訓練了L_max=4和L_max=6兩個版本的EquiformerV3,并采用了一種兩階段訓練策略:先用"直接預測"方式預訓練,再用"梯度預測"方式微調。所謂直接預測,就是模型直接輸出能量、力和應力的數值;所謂梯度預測,則是讓模型只直接預測能量,力和應力通過對能量求導自動得到,這樣能保證力和應力在物理上嚴格自洽。
在L_max=4的梯度微調版本(參數量30M)上,EquiformerV3的力預測誤差達到43.5 meV/A,與參數量154M的EquiformerV2-L相當,但模型體積只有后者的五分之一。與參數量700M的UMA-L模型相比,EquiformerV3的L_max=4版本也能達到相近的力預測精度,參數量僅為對方的二十三分之一。升級到L_max=6之后,梯度微調版本的力誤差進一步降至41.6 meV/A,超過了所有參與比較的模型。
**第三戰場:Matbench Discovery——最貼近真實科學發現的考驗**
Matbench Discovery是一個公開的材料科學評測榜單,它考察的不是單純的預測誤差,而是模型在真實材料發現工作流中的實際表現。
評測包含三項核心指標。F1分數衡量的是模型判斷一種晶體結構是否熱力學穩定的能力(這類似于把一座沙堆塑成某種形狀,判斷這個形狀在重力作用下是否會坍塌還是保持穩固)。RMSD(均方根偏差)衡量的是模型通過能量優化預測出的穩定結構與DFT計算出的真實穩定結構之間的偏差。第三項也是最特殊的一項,叫做κSRME(熱導率對稱相對平均誤差),專門考察模型對熱導率的預測精度——這需要對模型預測的勢能面求二階和三階導數,也就是說,連預測誤差本身的"斜率"和"彎曲程度"都要足夠精準才行。
前代EquiformerV2在F1分數上表現出色(0.815),但κSRME高達1.676,說明它對熱導率的預測極不準確,根本無法用于需要高階導數的模擬任務。
EquiformerV3在僅使用MPtrj數據集訓練的情況下,F1分數提升到0.863,RMSD降至0.070,κSRME大幅下降到0.275,綜合性能評分(CPS)達到0.830,超越了所有同等條件下的競爭對手,包括eSEN-30M-MP(CPS=0.797)和SevenNet-l3i5(CPS=0.714)。
當進一步使用OMat24數據集預訓練,再在MPtrj和部分Alexandria數據集上微調之后,EquiformerV3的L_max=4版本將CPS推過了0.9的門檻(達到0.902),成為首個突破這一里程碑的模型。與此同時,它的訓練時間只需要5700 GPU小時,而競爭對手UMA-M-1.1需要超過12.9萬GPU小時,節省了超過22倍的計算資源。
這個結果意味著什么?它說明平滑截斷注意力和SwiGLU-S?激活函數一起,讓EquiformerV3真正具備了學習"可以求高階導數"的勢能面的能力——這正是做真實物理模擬所必需的基礎。
**六、一個有趣的"副產品":為什么SwiGLU在語言模型里有效?**
研究團隊在論文中提出了一個頗具啟發性的觀點,作為整個工作的"副產品"送給讀者。
SwiGLU激活函數在大型語言模型(如GPT、LLaMA等)中被廣泛使用,研究者們普遍知道它有效,但具體原因一直不是特別清晰。SwiGLU的原作者Noam Shazeer甚至在論文中以調侃的口吻寫道,SwiGLU的成功可以歸因于"神圣的眷顧"。
EquiformerV3的研究團隊認為,從幾何圖神經網絡中關于"多體相互作用"的理論視角出發,也許可以給SwiGLU在語言模型中的成功提供一個新的解釋:SwiGLU的乘法結構,無論是在原子模擬領域還是在自然語言處理領域,都可能是在引入更高階的特征交互,從而提升模型對復雜模式的捕捉能力。這兩個看似毫不相關的領域,在數學結構的深處或許存在著共鳴。
**歸根結底,這項研究做了什么、意味著什么**
歸根結底,EquiformerV3是一套關于"如何讓原子模擬神經網絡同時變得更快、更強、更可靠"的完整解決方案。它不是靠單一的"銀彈"取勝,而是通過工程優化、架構改進和理論創新的三管齊下,在每個層面都擠出了性能提升。
從實用角度看,這項研究最重要的意義在于:它讓原來只能做"靜態快照預測"的高精度模型,進化成了可以做"連續動態模擬"的工具。在材料設計和催化劑研究領域,這意味著研究者可以用更小的計算資源、更短的時間,完成更接近真實應用場景的模擬任務。原本需要一個月才能完成的計算,現在或許只需要幾天甚至幾小時。
當然,研究團隊也誠實地指出了當前的局限:在Matbench Discovery上,增大模型規模并未帶來進一步的性能提升,說明數據質量和數據策劃(例如篩選掉不合理的結構、加入更多專項數據)可能比模型規模更為關鍵。這也為后續研究指明了方向。
對于關注材料科學、計算化學乃至人工智能基礎研究的讀者來說,EquiformerV3代表的這條技術路線——將物理對稱性嚴格編碼進神經網絡架構,同時在效率和表達能力之間尋找平衡——仍然充滿探索空間。模型的代碼和預訓練權重均已開源,有興趣實際動手的讀者可以通過論文編號arXiv:2604.09130找到所有相關資源的鏈接。
Q&A
Q1:EquiformerV3比普通神經網絡有什么特別之處?
A:EquiformerV3是專門為模擬原子世界設計的,它把"旋轉和平移不改變物理規律"這一性質直接編碼進了網絡結構。普通神經網絡不具備這種特性,用于原子模擬時會給出物理上毫無意義的預測。EquiformerV3則無論從哪個角度觀察同一個原子結構,都能給出完全一致且物理上正確的能量和力的預測。
Q2:SwiGLU-S?激活函數為什么能提升預測精度?
A:SwiGLU-S?通過將兩套特征在球面上做逐點乘積,等價于執行了一次"自張量積"操作,使模型能夠捕捉到三個甚至更多原子共同構成的幾何關系(多體相互作用)。普通激活函數做不到這一點。同時,非線性變換只施加在標量信號上,避免了破壞旋轉等變性,還能大幅減少采樣網格點數,在精度不損失的情況下提升了計算效率。
Q3:EquiformerV3能用于哪些實際科學應用?
A:EquiformerV3的核心能力是快速準確地預測原子結構的能量、力和應力,并且其預測的勢能面足夠平滑,可以用于分子動力學模擬。實際應用方向包括:篩選新型電池材料和催化劑、預測材料的熱導率等物理性質、加速新藥物分子的設計,以及替代耗時的量子力學計算(DFT)來驅動大規模材料搜索工作流。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.