![]()
編輯丨&
地球上的生命到底編碼了多少種蛋白質(zhì)?隨著測(cè)序技術(shù)的飛速發(fā)展,我們正以前所未有的速度積累著答案:目前已知的蛋白質(zhì)序列已超過(guò) 190 億條,而地球生物基因組計(jì)劃(Earth BioGenome Project)的目標(biāo)——對(duì)180萬(wàn)個(gè)真核物種進(jìn)行測(cè)序——將把這個(gè)數(shù)字推至 270 億。
聚類(lèi)——將相似的序列歸為一組——是建設(shè)有效組織的核心步驟。通過(guò)將相似序列歸入同一簇,可以構(gòu)建蛋白家族、提取進(jìn)化信息,并為結(jié)構(gòu)預(yù)測(cè)等任務(wù)提供關(guān)鍵輸入。但現(xiàn)有方法,如 CD-HIT 或 MMseqs2 ,在面對(duì)跨物種、低相似度的大規(guī)模數(shù)據(jù)時(shí),要么速度無(wú)法承受,要么敏感性顯著下降,成為整個(gè)流程的計(jì)算瓶頸。
來(lái)自德國(guó)馬克思·普朗克研究所等的團(tuán)隊(duì)帶來(lái)了一個(gè)突破性的解決方案:DIAMOND DeepClust。它通過(guò)級(jí)聯(lián)聚類(lèi)架構(gòu)、多節(jié)點(diǎn)并行和創(chuàng)新的線(xiàn)性模式,首次實(shí)現(xiàn)了在合理時(shí)間內(nèi)對(duì) 190 億條蛋白質(zhì)序列進(jìn)行敏感聚類(lèi),將數(shù)據(jù)壓縮至原來(lái)的 1/56,并在此過(guò)程中發(fā)現(xiàn)了超過(guò) 1 億個(gè)未被現(xiàn)有數(shù)據(jù)庫(kù)覆蓋的新蛋白質(zhì)家族。
相關(guān)研究以「Clustering the protein universe of life using DIAMOND DeepClust」為題,于 2026 年 3 月 24 日發(fā)布在《Nature Methods》。
![]()
論文鏈接:https://www.nature.com/articles/s41592-026-03030-z
如何重新定義「聚類(lèi)」
論文提出的方法名為DIAMOND DeepClust,其本質(zhì)是一種級(jí)聯(lián)式(cascaded)的深度聚類(lèi)算法,建立在高敏感蛋白比對(duì)工具 DIAMOND v2 之上。與傳統(tǒng)方法不同,它并不是簡(jiǎn)單地做全局聚類(lèi),而是通過(guò)一個(gè)明確的計(jì)算流程來(lái)壓縮蛋白空間。
![]()
圖1:DIAMOND DeepClust、MMseqs2 和 FLSHclust 聚類(lèi)性能的基準(zhǔn)測(cè)試。
算法首先基于序列比對(duì)構(gòu)建一個(gè)圖結(jié)構(gòu),其中每個(gè)節(jié)點(diǎn)代表一個(gè)蛋白序列,邊表示滿(mǎn)足閾值的相似性關(guān)系。隨后,通過(guò)一種「代表序列機(jī)制」,將聚類(lèi)問(wèn)題轉(zhuǎn)化為尋找一組最小覆蓋節(jié)點(diǎn)集合,使每個(gè)序列都能被某個(gè)代表序列覆蓋。
團(tuán)隊(duì)利用雙向覆蓋標(biāo)準(zhǔn)對(duì)國(guó)家生物技術(shù)中心(NCBI)非冗余(NR)數(shù)據(jù)庫(kù)(含約 5.46 億條序列)進(jìn)行了聚類(lèi)。DIAMOND DeepClust 在單臺(tái) 64 核心服務(wù)器上,在 19.0 小時(shí)內(nèi)解決了深度聚類(lèi)問(wèn)題,相較于 MMseqs2 快了 36 倍。
為了進(jìn)一步提升規(guī)模能力,DeepClust 引入了多項(xiàng)關(guān)鍵優(yōu)化,包括在種子搜索階段采用multiple spaced seeds 并通過(guò)真實(shí)比對(duì)數(shù)據(jù)學(xué)習(xí)其模式,在保證特異性的同時(shí)提升敏感性,并通過(guò)序列長(zhǎng)度排序與覆蓋約束提前剪枝,大幅減少無(wú)效比對(duì)計(jì)算 。此外,算法被設(shè)計(jì)為可在多節(jié)點(diǎn)環(huán)境下并行運(yùn)行,從而突破單機(jī)內(nèi)存與計(jì)算限制。
百萬(wàn)到百億級(jí)的跨越
在實(shí)驗(yàn)中,研究團(tuán)隊(duì)對(duì)約19億(去冗余后約19.4 billion)蛋白序列進(jìn)行了聚類(lèi)分析,并在27個(gè)計(jì)算節(jié)點(diǎn)上完成整個(gè)計(jì)算流程,總計(jì)約25萬(wàn)CPU小時(shí)。
![]()
圖 2:DIAMOND DeepClust 在現(xiàn)有數(shù)據(jù)庫(kù)中對(duì)蛋白質(zhì)群集的特征分析。
結(jié)果顯示,這些序列被組織為約17億個(gè)聚類(lèi),其中僅544百萬(wàn)個(gè)非單元素簇就覆蓋了約94%的序列空間,表明蛋白宇宙可以被大幅壓縮為更小的代表集合 。進(jìn)一步分析表明,僅約3.35億代表序列即可覆蓋92%的蛋白序列
團(tuán)隊(duì)利用雙向覆蓋標(biāo)準(zhǔn)對(duì)國(guó)家生物技術(shù)中心(NCBI)非冗余(NR)數(shù)據(jù)庫(kù)(含約 5.46 億條序列)進(jìn)行了聚類(lèi)。DIAMOND DeepClust 在單臺(tái) 64 核心服務(wù)器上,在 19.0 小時(shí)內(nèi)解決了深度聚類(lèi)問(wèn)題,相較于 MMseqs2 快了 36 倍。
在線(xiàn)性模式下,DIAMOND DeepClust 的線(xiàn)性模式運(yùn)行時(shí)間為 3.9 小時(shí),計(jì)算速度可進(jìn)一步提升至百倍量級(jí),同時(shí)仍維持可用的敏感性水平。
更重要的發(fā)現(xiàn)來(lái)自聚類(lèi)結(jié)果本身。研究顯示,大規(guī)模聚類(lèi)后可以識(shí)別出大量此前未被數(shù)據(jù)庫(kù)覆蓋的蛋白家族。例如,在與現(xiàn)有數(shù)據(jù)庫(kù)對(duì)比中,約有1.18 億個(gè)蛋白簇?zé)o法映射到已有資源,提示存在大量「未知蛋白空間」。
與此同時(shí),這一聚類(lèi)數(shù)據(jù)庫(kù)還可以直接提升結(jié)構(gòu)預(yù)測(cè)性能。當(dāng)將DeepClust生成的數(shù)據(jù)用于 AlphaFold2 的輸入時(shí),可以為低覆蓋序列提供更豐富的進(jìn)化信息,從而改善預(yù)測(cè)質(zhì)量 。這說(shuō)明聚類(lèi)不僅是壓縮工具,更是下游 AI 模型性能的關(guān)鍵基礎(chǔ)。
蛋白組學(xué)的「底層重建」
DeepClust 為未來(lái)打開(kāi)了諸多可能。它能支持地球生物基因組計(jì)劃,促進(jìn) AI 驅(qū)動(dòng)的結(jié)構(gòu)生物學(xué),還可以催化比較基因組學(xué)。該算法通過(guò)對(duì)算法架構(gòu)、并行策略和計(jì)算資源進(jìn)行極致優(yōu)化,將已有技術(shù)的邊界推向了前所未有的遠(yuǎn)方。
DeepClust 提供的更大、更敏感的聚類(lèi)數(shù)據(jù)庫(kù),有望成為下一代結(jié)構(gòu)預(yù)測(cè)模型的「燃料」。當(dāng)數(shù)萬(wàn)億條序列即將涌入科學(xué)家的硬盤(pán)時(shí),這樣的工具正是當(dāng)下迫切需要的基礎(chǔ)設(shè)施。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.