![]()
編輯丨&
在臨床遺傳學的實際工作流中,變異分類并不只是數(shù)據(jù)庫匹配問題,而是一個高度依賴文獻證據(jù)解釋的過程。變異致病性分類需人工檢索、解讀海量文獻,單例全基因組測序的人工解讀平均耗時約 4 小時,是基因診斷流程的主要瓶頸。
在此背景下,由香港基因組研究院團隊開發(fā)了AI-CURA——一套基于大語言模型(LLM)的遺傳變異自動化分類工作流,以「AI-CURA, an automated LLM workflow for high-accuracy genetic variant classification」為題,于 2026 年 6 月 24 日發(fā)布在《Science Translational Medicine》。
![]()
論文鏈接:https://www.science.org/doi/10.1126/scitranslmed.adz4172
AI-CURA
隨著全基因組測序在臨床罕見病中的普及,如何高效解讀數(shù)以萬計的基因變異成為難點。美國遺傳與基因組學院(ACMG)/分子病理學會(AMP)發(fā)布的指南將變異分類細分為20條證據(jù)規(guī)則,但其中許多(約 35%)依賴于文獻證據(jù)解釋。
AI-CURA 立足于這一背景,旨在建立一套自動化系統(tǒng),以 LLM 輔助完成這些復雜規(guī)則的判定,將基因組數(shù)據(jù)與不斷更新的知識庫綁定,實現(xiàn)「測序一次、動態(tài)解讀」的診斷流程。這種思路類似將臨床專家的文獻查閱和判讀步驟轉化為計算流程,提高效率和一致性。
![]()
圖 1: AI-CURA 中自動化 ACMG 框架整體設計示意圖。
AI-CURA 整體分為兩部分:規(guī)則引擎層和LLM 推理層。
- 規(guī)則引擎層:自動執(zhí)行 13 條無需文獻的 ACMG 規(guī)則(占65%),包括等位基因頻率證據(jù)、預測打分等。
- LLM推理層:處理 7 條需文獻支持的規(guī)則:PVS1(RNA)、PS2/PM6、PS3、PS4、PM3、PP1、PP4。使用兩種大型語言模型(DeepSeek-R1 和 o3-mini-high)進行文獻摘要和證據(jù)提取。并針對每條規(guī)則設計專門 prompt 和輔助知識庫,將 ClinGen 推薦、已知基因/表型關聯(lián)信息整合進數(shù)據(jù)庫。
在 7 條文獻依賴規(guī)則的測試中,兩款模型均達到 100% 特異性(無支持證據(jù)時不誤判),DeepSeek-R1 靈敏度全面優(yōu)于 o3-mini-high。經過精心優(yōu)化的 DeepSeek-R1 幾乎不遺漏文獻支持證據(jù),并且未引入錯誤判定。
最終,模型確認了 DeepSeek 作為核心 —— 其具備透明的分步推理過程、開源可本地部署(滿足醫(yī)療數(shù)據(jù)安全要求),綜合表現(xiàn)更優(yōu)。對于那些需要深入理解的圖像,團隊額外開發(fā)了原型模塊,通過 Claude-4.0-Sonnet 將文獻中的家系圖、復雜表格轉換為文本,再接入主流程處理,彌補純文本 LLM 無法解讀圖形證據(jù)的短板。
ClinGen 驗證與實際應用
研究團隊在ClinGen 專家注釋的 150 個變異集合上測試了 AI-CURA 的分類效果。該集包括多個 ACMG 分類標簽的變異,均已由專業(yè)團隊給出最終診斷。在這個測試中,AI-CURA 需要為每個變異應用所有 ACMG 規(guī)則并輸出綜合分類。
DeepSeek-R1 的 ACMG 規(guī)則應用完全一致率為 84.0%,最終分類一致率達 96.0%;若按臨床等效標準(致病 / 可能致病視為同一臨床等級),診斷一致率高達 99.3%,遠優(yōu)于不同實驗室人工解讀的平均差異水平。
![]()
圖 2:AI-CURA 在 ClinGen 變異體分類及 ClinVar 沖突變異體重分析中的表現(xiàn)。
這些結果顯示:DeepSeek-R1 在整個分類流程中高度再現(xiàn)了專家判斷,幾乎涵蓋了所有致病證據(jù)。即便在少數(shù)出現(xiàn)規(guī)則級差異的案例,大多數(shù)也沒有改變最終的判定,可見該系統(tǒng)臨床可接受性很高。
表 1: AI-CURA 對 150 個 ClinVar 變異體重新分析的性能。
![]()
最后,研究模擬了 AI-CURA 對已有沖突解釋的 ClinVar 變異的復診情境。選取了 150 個 ClinVar 中包含多種分類沖突的變異,將 AI 結果與原始解釋對比。
DeepSeek-R1 成功為 70% 的變異明確分類,最終分類與人工解讀的一致率達98.7%,可有效提升未確診病例的重分析診斷率。
加速罕見病診斷
僅從當下來看,AI-CURA 還有許多不足。它目前僅支持孟德爾病的單核苷酸變異、短插入缺失,對文獻中的圖形、復雜表格信息提取能力不足,家系共分離等依賴圖形的規(guī)則準確率偏低。
但它在透明性、安全性等方面做的極好,框架的擴展也相當靈活。總體而言,AI-CURA 代表了基因組診斷流程的一個新范式:基因組數(shù)據(jù)不僅是一次性結果,而應視作能隨著知識增長而持續(xù)釋放價值的「活數(shù)據(jù)」。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.