![]()
作者 | 論文團隊
編輯丨ScienceAI
蛋白質藥物研發正在進入一個新的階段:研究者不再只滿足于改造天然蛋白,而是希望按需設計具備特定功能、能夠穩定折疊、并具有成藥潛力的全新蛋白分子。
在這一過程中,「功能性」和「可折疊性」始終是從頭蛋白設計的核心挑戰。一個序列即使被模型預測具有目標功能,如果無法形成穩定三維結構,也難以在實驗中表達和發揮作用;相反,一個折疊良好的蛋白,如果無法實現預期的結合、催化或調控功能,也無法真正進入藥物研發流程。
近期,清華大學智能產業研究院(AIR)與水木分子團隊聯合提出的 CodeFP(Co-generative Functional Protein design),為這一長期難題提供了新的建模思路。該工作圍繞「功能 — 序列 — 結構」的協同生成展開,通過離散擴散模型同時生成氨基酸序列與局部結構 Token,在設計早期就讓功能約束、序列規律和結構可實現性共同參與優化。
研究論文《Co-Generative De Novo Functional Protein Design》已被機器學習頂會 ICML 2026 接收。
![]()
論文地址:https://arxiv.org/abs/2605.00948
目前,研究團隊已在 OpenBioMed 正式開源 CodeFP 的模型參數,并提供了完整的推理實現。
開源地址:https://github.com/PharMolix/OpenBioMed
![]()
從單一路徑到協同生成:為什么 CodeFP 重要?
現有從頭功能蛋白設計方法大致可分為兩類。
一類是直接從功能生成序列,例如基于蛋白語言模型的生成方法。這類模型能夠繼承天然蛋白序列中的進化規律,因此生成序列通常具備較好的自然性和可折疊潛力,但對復雜功能,尤其是多功能組合的精準控制仍存在不足。
另一類方法先生成滿足功能需求的蛋白骨架,再通過反向折疊得到序列。這一策略更強調結構與功能的對應關系,但如果骨架生成階段缺少序列層面的約束,后續得到的氨基酸序列可能難以折疊回目標結構,導致結構設計與序列可實現性脫節。
CodeFP 的關鍵突破在于改變了「先序列后結構」或「先結構后序列」的單向流程。模型將蛋白質表示為兩類離散 Token:一類是氨基酸序列 Token,另一類是描述局部構象的結構 Token。在擴散去噪過程中,二者交替更新、持續交互,使結構生成受到序列規律約束,同時讓序列設計獲得結構信息支持,從而提升功能實現與結構穩定性的聯合表現。
![]()
圖 1 CodeFP 如何通過協同解碼解決問題
三個核心設計:讓功能真正落到結構上
CodeFP 的技術創新主要體現在三個方面。
首先是序列 — 結構協同生成。模型基于 DPLM-2 的離散蛋白表示,將局部蛋白結構量化為結構 Token,并與氨基酸 Token 一起建模。通過多模態離散擴散,CodeFP 在每一步生成中同時修正序列與結構,使兩種信息不再彼此割裂。
其次是功能 — 結構檢索機制(Functional-Structural Retrieval, FSR)。傳統方法往往用 one-hot 向量或文本嵌入表示功能標簽,但蛋白功能并不是抽象語義本身,而是由具體的局部結構基序承載。CodeFP 構建了功能結構錨點數據庫,將 GO 功能標簽與代表性局部結構模體關聯起來,并通過交叉注意力注入生成過程。換言之,模型在生成蛋白前,能夠獲得「實現該功能通常需要怎樣的局部結構」的先驗信息。
第三是局部結構 — 功能輔助監督(Local Structure-Function Supervision, LSFS)。結構離散化會帶來一對多映射問題:相似功能可能對應多種結構 Token 表達,訓練中容易產生模糊信號。CodeFP 在連續隱藏狀態上加入功能預測監督,使模型在生成局部結構時能夠更直接地對齊目標功能,從而提升功能條件學習的穩定性。
![]()
圖 2 CodeFP 模型全貌
實驗結果:功能一致性與可折疊性同步提升
在 GO 條件蛋白生成任務中,CodeFP 在功能一致性、結構可折疊性和生成分布自然性方面均取得了領先表現。
論文結果顯示,與最強基線相比,CodeFP 在功能一致性上平均提升 6.1%,在可折疊性上提升 3.2%。在更具體的指標上,CodeFP 的 F1-Macro 達到 0.446,高于 CFP-Gen 的 0.370;pLDDT > 70 的結構成功率達到 80.65%,高于 Pinal 的 74.22%。這些結果表明,CodeFP 不僅更能滿足目標功能約束,也更有可能生成可穩定折疊的蛋白序列。
更值得關注的是模型在分布外功能組合上的表現。對于訓練集中未出現、但自然界中存在的功能組合,CodeFP 的 F1-Macro 相比基線提升 9.1%,顯示出更強的零樣本組合泛化能力。在一個多功能蛋白案例中,CodeFP 生成序列的 pLDDT 達到 94.9、pTM 達到 0.96,同時與同功能天然蛋白的最高序列一致性僅為 32%,說明模型并非簡單復現訓練樣本,而是在探索新的序列空間。
![]()
![]()
面向藥物研發的意義
對于大分子藥物研發而言,CodeFP 的價值不只在于生成「看起來合理」的蛋白序列,更在于把功能設計與結構可實現性放進同一個生成框架中。
在近期應用上,它有望用于蛋白藥物的穩定性優化、功能增強和多功能模塊設計,幫助研究人員在計算階段提前篩除難以折疊或難以表達的候選分子,提高后續實驗驗證效率。
在更長遠的應用中,類似 CodeFP 的方法有望推動可編程蛋白藥物、人工酶、生物制造催化劑、細胞器靶向蛋白以及多特異性治療分子的設計。特別是在復雜功能組合場景中,模型對 OOD 功能組合的泛化能力,為設計自然界中少見甚至未見過的功能蛋白提供了新的技術基礎。
當然,從計算設計到真實藥物仍需要濕實驗驗證。論文也指出,未來仍需擴展功能數據集、提升復雜功能組合生成的魯棒性,并進一步通過實驗驗證模型的實際可用性。對于 AI 制藥而言,這恰恰是算法平臺走向產業閉環的關鍵一步。
CodeFP 展示了水木分子在 AI 蛋白設計方向的持續探索:通過將蛋白語言模型、離散擴散、結構先驗和功能監督結合起來,從源頭提升功能蛋白設計的可控性與可實現性。隨著計算模型與實驗平臺進一步閉環,從頭設計有望從「生成候選序列」走向「系統化創造可驗證、可優化、可成藥的新型蛋白分子」。
參考文獻
Chen, X., Luo, Y., Fan, S., & Nie, Z. Co-Generative De Novo Functional Protein Design. Preprint, 2026.
Kortemme, T. De novo protein design—from new structures to programmable functions. Cell, 2024.
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.