![]()
編輯丨&
人類似乎已經(jīng)習(xí)慣于 AI 帶來(lái)的突破:預(yù)測(cè)蛋白結(jié)構(gòu)、設(shè)計(jì)抗體、發(fā)現(xiàn)藥物分子、分析基因組數(shù)據(jù)。似乎只要模型再?gòu)?qiáng)一點(diǎn),實(shí)驗(yàn)室里的許多工作都能被自動(dòng)化。
那么新的問(wèn)題由此誕生。
如果未來(lái)的 AI 不再只是回答問(wèn)題,而是像研究員一樣自己查數(shù)據(jù)庫(kù)、整理數(shù)據(jù)、運(yùn)行分析流程、提出假設(shè)并驗(yàn)證結(jié)果,那么生物學(xué)是否已經(jīng)準(zhǔn)備好了迎接這樣的「scientific agents 」?
2026 年 6 月 8 日,Anthropic 的「Paving the way for agents in biology」文章中對(duì)此問(wèn)題進(jìn)行了深入思考。他們認(rèn)為,很多時(shí)候,真正的瓶頸藏在更底層的地方——數(shù)據(jù)庫(kù)、檢索系統(tǒng),以及那些幾十年來(lái)為人類研究者設(shè)計(jì)、卻從未為 AI 設(shè)計(jì)過(guò)的生物信息學(xué)基礎(chǔ)設(shè)施。
為了驗(yàn)證這一點(diǎn),研究團(tuán)隊(duì)讓多個(gè)當(dāng)前最先進(jìn)的 AI 系統(tǒng)完成真實(shí)病毒學(xué)研究中的數(shù)據(jù)檢索任務(wù)。結(jié)果顯示,即使面對(duì)完全相同的問(wèn)題,不同運(yùn)行之間得到的數(shù)據(jù)集也可能相差數(shù)十倍;而這種差異最終足以改變疾病傳播分析、進(jìn)化樹(shù)重建甚至藥物評(píng)估的結(jié)論。
![]()
https://www.anthropic.com/research/agents-in-biology
案例研究:病毒學(xué)
軟件世界像是為汽車(chē)修過(guò)的道路,版本控制、標(biāo)準(zhǔn)化 API、包管理器這些東西,天然就是給機(jī)器和自動(dòng)化流程準(zhǔn)備的;而生物數(shù)據(jù)庫(kù)則過(guò)于難用。畢竟人類不能期望機(jī)器理解生物。
為了把這件事說(shuō)得更實(shí),團(tuán)隊(duì)做了一個(gè)名叫VirBench的基準(zhǔn),里面有120 個(gè)人工核對(duì)的病毒序列查詢,覆蓋40 種病原體,任務(wù)來(lái)自真實(shí) virology 工作流,包括監(jiān)測(cè)、診斷試劑設(shè)計(jì)和訓(xùn)練數(shù)據(jù)構(gòu)建。
![]()
圖 1:VirBench 各分類體系中代理的性能和故障模式。
每道題最多帶16 個(gè)過(guò)濾條件,既有宿主、地理位置、日期范圍、序列長(zhǎng)度、完整性,也有分段病毒、疫苗株?duì)顟B(tài)這些更細(xì)的約束;為了讓結(jié)果可復(fù)現(xiàn),大多數(shù)題還加了最大發(fā)布日期限制。
這些題目反映了病毒監(jiān)測(cè)、診斷檢測(cè)設(shè)計(jì)和蛋白質(zhì)模型訓(xùn)練數(shù)據(jù)構(gòu)建中出現(xiàn)的任務(wù),以測(cè)試最先進(jìn)的科學(xué)研究學(xué)員(如 ClaudeSonnet 4、Claude Opus 4.7、Biomni OSS、Edison Analysis、GPT)在利用現(xiàn)有基礎(chǔ)設(shè)施從病毒中檢索病毒序列時(shí)的能力。
Anthropic 選了一個(gè)「細(xì)節(jié)決定生死」的例子:2014 年 West African Ebolavirus(埃博拉病毒) outbreak 的序列檢索。對(duì)同一個(gè)查詢,盡管每次的提示都相同,但 Claude Sonnet 4 三次運(yùn)行卻分別返回了106、15 和 5條序列,而期望值是266。
這種波動(dòng)足以把下游分析徹底帶偏:人工整理的數(shù)據(jù)能恢復(fù)出2014 年 1 月的 TMRCA,和既有報(bào)告一致;但模型生成的數(shù)據(jù)集卻能把推斷時(shí)間推到1922 年,或者因?yàn)槁┑?Guinea 的樣本,把時(shí)間改寫(xiě)成2014 年 4 月。
![]()
圖 2:利用 Delphy 推斷出 2014 年西非疫情中的埃博拉病毒系統(tǒng)發(fā)育樹(shù)。第 1 至 3 次由 Sonnet 4 生成。
同樣的脆弱性也會(huì)打到治療分析上。文章拿埃博拉病毒糖蛋白的變異分析做了另一個(gè)例子:如果序列檢索不穩(wěn),突變分布就會(huì)在不同運(yùn)行里給出三種不同印象。對(duì)公共衛(wèi)生和治療決策來(lái)說(shuō),這不是「結(jié)果有點(diǎn)不一樣」,而是會(huì)直接影響「病毒從哪兒來(lái)」「診斷還能不能用」「現(xiàn)有治療還能不能頂住」這三個(gè)問(wèn)題。
![]()
圖 3:現(xiàn)有埃博拉病毒糖蛋白上的突變(紅色)。第 1 至 3 次由 Sonnet 4 生成。
gget 病毒
于是研究團(tuán)隊(duì)和 NCBI 合作做了gget 病毒。它把 NCBI Virus 網(wǎng)頁(yè)里那些原本只存在于界面邏輯中的過(guò)濾規(guī)則,正式化成一個(gè)可腳本化、可復(fù)現(xiàn)的命令行和 Python 工具。
它會(huì)協(xié)調(diào) REST、Datasets 和 E-utilities,決定哪些過(guò)濾能直接在遠(yuǎn)端做,哪些必須本地補(bǔ)做;它會(huì)處理分頁(yè)和批量下載,避免像 SARS-CoV-2 或 Influenza A 這種大結(jié)果集被半路截?cái)啵划?dāng)某些篩選依賴 GenBank 中的額外信息時(shí),它還會(huì)把這些記錄拉回來(lái)一起判斷。最后,輸出的不只是結(jié)果,還有能讓人和機(jī)器都復(fù)查的日志。
![]()
圖 4:VirBench 基準(zhǔn)測(cè)試中的 AI 智能體性能,無(wú)論是否攜帶 gget 病毒。
當(dāng)賦予智能體訪問(wèn) gget 病毒的權(quán)限時(shí),所有智能體的準(zhǔn)確率都超過(guò)了 90%,GPT-5.5 的準(zhǔn)確率峰值達(dá)到 99.7%。運(yùn)行間的變異性基本消除,模型間的性能差距大幅縮小。
換句話說(shuō),添加確定性檢索層使模型選擇的重要性大大降低。
所以一旦把檢索層做成確定性的,模型之間的差別就沒(méi)那么重要了;真正決定結(jié)果的是底下那層基礎(chǔ)設(shè)施。
讓數(shù)據(jù)對(duì)智能體開(kāi)放
團(tuán)隊(duì)表示,仍然希望模型在提出假設(shè)、設(shè)計(jì)實(shí)驗(yàn)、推理機(jī)制時(shí)保持創(chuàng)造性,但在基因標(biāo)識(shí)符、模式、檢索邏輯、坐標(biāo)系統(tǒng)、元數(shù)據(jù)約定和數(shù)據(jù)訪問(wèn)路徑這些底層層面,系統(tǒng)必須「無(wú)聊到可信」。
作者也承認(rèn),未來(lái)某一天智能體也許能自己穿過(guò)這些雜亂門(mén)戶,但即便如此,重復(fù)造輪子也未必劃算;對(duì)生物數(shù)據(jù)庫(kù)來(lái)說(shuō),更重要的是從現(xiàn)在開(kāi)始就按智能體的使用方式來(lái)設(shè)計(jì)。
https://arxiv.org/pdf/2606.06749
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.