![]()
作者 | 論文團隊
編輯丨ScienceAI
在催化反應中,催化劑和配體的立體效應與電子效應,往往共同決定反應的活性和選擇性。然而,傳統方法通常需要分別使用多種描述符刻畫這些性質:有的依賴人工指定原子索引,有的需要耗時的構象搜索和量子化學計算,還有的只能反映局部結構特征。這種碎片化的表征方式,不僅增加了建模復雜度,也制約了催化劑的大規模自動篩選。
近日,上海科學智能研究院(下稱「上智院」)聯合復旦大學在 Digital Discovery 發表研究論文,提出了一種名為 CatEmb 的催化劑嵌入模型。作為上智院自研的燧人物質科學系列模型的功能層,該模型通過對比學習對齊二維分子圖與三維結構 — 能量信息,僅以二維分子結構為輸入,即可快速生成包含立體電子效應的統一向量表示,為催化劑相似性檢索、性能預測和智能推薦提供通用工具。
作為「Golab 物質科學智能研發工廠」在干濕閉環實驗中用于催化劑推薦的重要模型之一,CatEmb 已被進一步接入該產品中,在超過 100 小時的 AI 自主科研直播中參與催化劑優化,并與自驅動實驗室協同完成兩輪「模型推薦 — 實驗驗證 — 數據回流 — 模型再優化」,助力某催化反應提至文獻方案的約 6 倍。
![]()
論文標題:Stereoelectronic-aware catalyst embeddings from 2D graphs via 2D-3D multi-view alignment
論文鏈接:https://doi.org/10.1039/D6DD00089D
上智院物質科學方向主任研究員徐麗成為論文第一作者兼通訊作者,上智院 AI 科學家及物質科學方向負責人曹風雷和復旦大學特聘教授、上智院院長漆遠為共同作者。
從「碎片化描述符」到統一的立體電子表示
傳統催化信息學通常使用不同描述符分別表征分子的空間與電子性質。這些描述符往往需要人工指定關鍵原子,或依賴耗時的構象搜索與量子化學計算,難以高效擴展至大規模催化劑庫。此外,將不同類型的特征簡單拼接,也可能引入冗余信息。
CatEmb 的核心思路,是讓二維圖神經網絡直接學習三維結構中蘊含的立體電子信息。研究團隊構建了雙流編碼器,分別處理二維分子圖和經 xTB 優化的三維構象及能量,并通過對比學習將同一分子的兩種表示對齊。
訓練完成后,用戶只需輸入分子的 SMILES,二維編碼器便可快速生成蘊含立體電子信息的 CatEmb 向量,無需額外進行構象搜索或量子化學計算,從而實現催化劑的高效、統一表征。
![]()
圖 1 CatEmb 建模策略
CatCompDB:一個覆蓋超過 6 萬種催化物種的專用數據集
為了支持 2D-3D 多視圖對齊,研究團隊構建了面向催化劑和配體的專用數據集 CatCompDB。團隊整合多個公開數據集,并補充文獻和商業庫中的相關分子,在清洗去重后進一步通過算法化配位生成配體 — 金屬配合物,最終形成覆蓋多類配體骨架和 32 種中心金屬的催化化學空間。
隨后,研究團隊為這些分子生成三維構象,并在 GFN2-xTB 級別進行結構優化和能量計算,獲得用于模型訓練的「二維分子圖 — 三維結構 — 能量」數據。這一數據集為 CatEmb 學習催化劑的立體電子信息提供了基礎,也為面向催化體系的通用分子表示學習積累了重要數據資源。
CatEmb 能否真正讀懂立體電子差異?
研究結果表明,CatEmb 學習到的隱空間具有清晰的化學結構規律。在降維可視化中,同類配體會自然聚集,而膦配體、氨基酸配體和 BOX 配體等不同類別則分布在不同區域。
CatEmb 不僅能夠區分不同配體骨架,還能識別同一骨架內部細微的取代基差異。例如,在 Salen 配體中,無取代母核、烷基供電子取代和含氮雜環取代的分子形成了不同子簇,說明模型能夠同時感知取代基帶來的空間與電子變化。
圖 2 通過 t-SNE 投影對 CatEmb 空間中的配體相似性進行分析
團隊還在 C—H 芳基化和不對稱硫醇加成兩個催化反應數據集上開展了定量構效關系(QSPR)建模。結果顯示,CatEmb 能夠提供有效的催化劑特征;將其與反應指紋或分子指紋結合后,預測性能通常可以進一步提升(圖 3)。這表明 CatEmb 所編碼的立體電子信息,能夠為傳統反應特征提供有價值的補充。
相似性即策略:從性能預測走向催化劑推薦
除了作為 QSPR 模型的輸入特征,CatEmb 還支持一種更直接的催化劑推薦策略:從少量已完成實驗的催化劑出發,在 CatEmb 空間中尋找與當前最優催化劑最相似的未測試候選物,并優先進行下一輪驗證。
這一策略背后的假設十分直觀:在關鍵立體電子特征上相似的催化劑,可能表現出相近的催化性能。相較于完全依賴監督學習模型進行性能預測,這種方法不需要大量標注數據,在數據稀缺或預測模型精度有限時仍能發揮作用。
![]()
圖 3 反應構效關系建模與催化劑推薦任務
研究團隊在不同任務中驗證了這一思路。在尋找高表現反應條件和底物普適型催化劑時,基于 CatEmb 的相似性推薦整體優于隨機篩選;即使在 QSPR 模型預測能力較弱的場景下,該策略仍能為實驗提供有效的候選優先級(圖 3C 和 3D)。
研究團隊將這一策略進一步應用到兩個更接近實際需求的場景中。第一個場景是大規模虛擬庫的優先級排序:針對洪鑫教授團隊報道的 Ni 催化 Suzuki-Miyaura 阻轉選擇性交叉偶聯反應,原始研究從 10,000 余個候選物中篩選出 3 個高 ee 配體(ee 分別為 91%、88%、93%)。團隊為其中 4,600 個高可合成性候選物計算了 CatEmb,并按與初始 21 個實測配體中最佳者的相似度排序 ——3 個實驗驗證的配體分別排在第 5、第 98 和第 100 位,說明 CatEmb 相似性在大庫篩選中具備有意義的引導能力(圖 4A)。
![]()
圖 4 基于相似性的相同骨架與跨骨架的配體推薦
第二個場景是跨骨架催化劑推薦:在銠催化不對稱烯烴氫化反應中,最優配體(ee > 99.9%)是一個不含二茂鐵的雙膦配體 L1。團隊計算了該數據集中所有含二茂鐵配體與 L1 的 CatEmb 距離,發現距離最近的 5 個含二茂鐵配體,其平均 ee 均高于 90%,而距離越遠的配體,平均選擇性呈下降趨勢(圖 4B)。這表明,CatEmb 捕捉到的「立體電子相似性」在一定程度上跨越了骨架類型的界限 —— 即便配體核心結構不同,只要在關鍵立體電子特征上相近,就可能給出相似的催化表現。
研究團隊同時指出,這一結果應當被「審慎地」解讀:測試的不對稱氫化數據集本身具有較高的整體選擇性,這使推薦任務相對容易。該策略在更具區分度的困難任務上的表現,仍有待進一步驗證。
走進超 100 小時干濕實驗閉環:模型與實驗共同迭代
CatEmb 的價值并不止于論文中的離線數據測試。作為「Golab 物質科學智能研發工廠」的重要組成部分,CatEmb 已被接入智能體驅動的催化劑推薦與反應條件優化流程。
在這個「超級科研工廠」開展的超 100 小時智能體干濕實驗閉環(7 月 7 日下午至 7 月 11 日深夜于 B 站「上海科學智能研究院」直播間)中,CatEmb 與其他反應預測模型、條件優化算法協同工作,參與候選催化劑的表征、相似性分析和推薦,并通過自驅動實驗室接受真實反應驗證。
針對 Suzuki 和 Buchwald 偶聯反應,團隊圍繞 4 個典型反應開展了兩輪迭代優化。模型首先根據已有文獻與實驗數據推薦催化體系,隨后由自驅動實驗室完成反應執行和結果分析。
7 月 10 日傍晚,第一輪實驗結果顯示,4 個反應中有 3 個的平均催化活性較文獻最優方案提升約 15%。對于尚未取得提升的第 4 個反應,智能體平臺將第一輪實驗結果回流至模型,在重新訓練后繼續開展催化劑優化。到直播結束時,第二輪實驗將第 4 個反應的催化活性提升至文獻方案的約 6 倍,約為第一輪實驗結果的 8 倍。
![]()
圖 5 超 100 小時干濕實驗直播中的催化劑配體優化任務結果
相較于一次性的虛擬篩選,這種閉環模式讓 AI 能夠根據真實實驗結果持續修正判斷、更新推薦,并將「失敗或不理想的實驗」轉化為下一輪優化所需的新數據。CatEmb 也由此從一個催化劑表征模型,進一步成為連接分子結構、智能推薦和自動化實驗的重要環節。
挑戰與展望:從通用表示走向催化發現基礎設施
CatEmb 通過對比學習將三維結構與能量信息遷移至二維圖網絡,使研究者僅憑二維分子結構,就能快速獲得具有立體電子感知能力的統一表示。這一設計兼顧了推理效率和信息表達能力,可用于大規模催化劑庫的快速嵌入、相似性檢索、優先級排序和性能預測。
目前,研究團隊已開源 CatCompDB 數據集、多個維度的預訓練模型權重以及完整代碼,方便領域研究者根據具體任務開展使用和二次開發。
數據集和權重地址:https://doi.org/10.6084/m9.figshare.31375579
代碼地址:https://github.com/licheng-xu-echo/CatEmb
與此同時,CatEmb 仍有進一步拓展空間。例如,不同下游任務對應的最優嵌入維度可能不同,需要根據具體數據進行選擇;當前模型主要面向有機配體和過渡金屬配合物,其在酶催化、多相催化和光催化等更復雜體系中的適用性,仍需進一步驗證。
未來,CatEmb 所代表的「立體電子感知嵌入」有望不再只是獨立的分子描述工具,而是成為 AI 驅動催化發現流程中的基礎能力:向前連接文獻知識、反應理解和候選生成,向后連接性能預測、催化劑推薦和自動化實驗,并在真實實驗數據的持續回流中不斷進化。
從二維結構中理解三維立體電子效應,從虛擬推薦走向真實實驗驗證,再從實驗結果返回模型開展下一輪優化 ——CatEmb 在超 100 小時干濕實驗閉環中的應用,展示了催化信息學從離線預測走向自主迭代的一種新可能。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.