![]()
編輯丨&
在傳統(tǒng)的 AI 評測中,大模型只要依靠強(qiáng)大的檢索和長文本記憶,就能輕松在各種生物學(xué)考試中拿到高分。但真實的生命科學(xué)研究充滿著物理世界的噪聲、復(fù)雜的代碼流水線以及連續(xù)的因果鏈條。
圍繞這個問題,OpenAI 設(shè)計了 GeneBench-Pro,不再只關(guān)注模型在單一子任務(wù)上的表現(xiàn),它進(jìn)一步擴(kuò)展了基因?qū)嶒炇遥w基因組學(xué)、定量生物學(xué)和轉(zhuǎn)化醫(yī)學(xué)等更難、更現(xiàn)實的任務(wù),捕捉計算生物學(xué)科學(xué)研究的復(fù)雜性、迭代性和模糊性。
![]()
圖示:生物學(xué)領(lǐng)域的基準(zhǔn)差距。
它旨在精確測量如處理歧義、修正假設(shè)、選擇正確的分析路徑并下達(dá)決策等高級能力。每個 GeneBench-Pro 問題都為模型提供了真實且混亂的數(shù)據(jù)集、簡短的實驗背景,以及與下游決策相關(guān)聯(lián)的目標(biāo)估計數(shù)。要正確回答,模型必須探索數(shù)據(jù),選擇合適的分析方法,進(jìn)行迭代實驗,并給出最終答案。
數(shù)據(jù)集構(gòu)建
生物學(xué)領(lǐng)域,數(shù)據(jù)生成成本大幅降低,這也導(dǎo)致部分研究者認(rèn)為限制因素已經(jīng)變?yōu)橄掠蔚挠嬎闩c分析。GeneBench-Pro 旨在評估解決這一瓶頸的進(jìn)展,共有129個問題,涵蓋了廣泛的計算生物學(xué)環(huán)境和方法。
![]()
圖示:領(lǐng)域圖集:10 個領(lǐng)域和 21 個子領(lǐng)域中的 129 個問題。
為了保證評估的絕對客觀與嚴(yán)謹(jǐn),GeneBench-Pro 特意避開了傳統(tǒng)長期生物學(xué)基準(zhǔn)常犯的兩大失敗模式:
避免任意的選擇偏好:許多舊的基準(zhǔn)直接圍繞混亂的歷史數(shù)據(jù)集構(gòu)建多步驟問題。在這種情況下,分析過程中往往沒有單一正確的路徑。AI 1 可能選擇了一個完全可辯護(hù)的過濾截止點,而 AI 2 則可能選擇另一個同樣合理的選項。最終的評分差異往往只能反映基準(zhǔn)創(chuàng)建者主觀的任意選擇,而無法體現(xiàn)模型在生物學(xué)性能上的根本差異。
避免數(shù)值敏感性過低:反之,有些基準(zhǔn)問題設(shè)計得過于粗糙,即便 AI 在數(shù)據(jù)處理或中間分析中犯下了不可饒恕的根本性生物學(xué)錯誤,最終竟然誤打誤撞依然能得到及格的數(shù)值結(jié)果。
為了徹底杜絕這些失效模式,GeneBench-Pro 中的每一個問題全部采用合成構(gòu)建的方式。
OpenAI 的研究人員完全掌握了數(shù)據(jù)底層的因果結(jié)構(gòu),并直接通過數(shù)學(xué)和物理模型模擬了整個數(shù)據(jù)的生成過程。這使得基準(zhǔn)能夠自由調(diào)整每個難題的復(fù)雜性,既能確保主觀分析選擇的合理差異仍能產(chǎn)生被接受的正確數(shù)值結(jié)果,又能通過消融研究嚴(yán)格驗證那些聽起來合理但實際上錯誤的分析路徑。
![]()
圖示:GeneBench-Pro 問題的構(gòu)建與驗證。
評估與評分
OpenAI 將 129 個 GeneBench-Pro 問題中的 82 個直接發(fā)送給了頂尖的外部領(lǐng)域?qū)<疫M(jìn)行深度評審,評審團(tuán)由知名高校的研究生、博士后研究員、工業(yè)界科學(xué)家以及終身教授組成。
兩位來自加州大學(xué)的評估者表示,那些在 GeneBench-Pro 問題上表現(xiàn)良好的模型顯然能幫助研究人員確定正確的工作流程并探索數(shù)據(jù),并識別出了潛在的陷阱問題。
每個 GeneBench-Pro 問題都是自成一體的科學(xué)分析。在問題解析中,AI 獲得一個隔離的工作空間,包含簡短提示、數(shù)據(jù)文件和標(biāo)準(zhǔn)生物信息學(xué)堆棧。
這些問題囊括了結(jié)構(gòu)變異導(dǎo)向腫瘤治療的益處-風(fēng)險決策、CRISPR 靶點驗證、關(guān)聯(lián)遺傳位點中的蛋白質(zhì)藥物靶點、DRX1 載體篩選殘余風(fēng)險與父母特定祖源及近期混血時間。每個問題還附帶豐富的元數(shù)據(jù),包括預(yù)期的分析結(jié)構(gòu)、附加數(shù)據(jù)文件、詳細(xì)的多頁案例研究以及專家評審結(jié)果。
測試結(jié)果
目前 OpenAI 家族中最強(qiáng)悍的推理模型GPT-5.6 Sol,在啟用了最高推理層級時,拿到了31.5%的通過率。而在常規(guī)最高推理層級下,其通過率為28.7%。雖然不到三分之一,但這相比于早期構(gòu)建該基準(zhǔn)時的初代 GPT-5(得分低于 5%)已經(jīng)實現(xiàn)了跨越式的巨幅增長。
以目前模型的高速改進(jìn)速度來看,這一極具挑戰(zhàn)性的基準(zhǔn)可能在年底前就會達(dá)到飽和狀態(tài)。
![]()
圖示:GeneBench-Pro:在 GPT 模型上測試計算性能的提升情況。
GPT 模型在面對存在定量不確定性的高級科學(xué)推理任務(wù)時,表現(xiàn)出了極強(qiáng)的統(tǒng)治力。GPT-5.6、GPT-5.5 與 GLM 5.2 等主流開源模型之間的性能鴻溝,遠(yuǎn)比人們在常規(guī)編碼基準(zhǔn)測試中推斷出的差距要大得多。
![]()
圖示:GeneBench-Pro:模型通過率最高推理。
考慮到 GeneBench-Pro 題目的變態(tài)難度,GPT-5.6 Sol 斬獲的 31.5% 成績已經(jīng)足夠令人側(cè)目。在一項針對外部評審專家的內(nèi)部調(diào)查中,評審們估計,人類專家平均需要耗費大約 20 到 40 個小時才能完整、獨立地解決單個 GeneBench-Pro 問題。
能力轉(zhuǎn)化方案
不過,前沿模型仍能解決不到三分之一的問題,這表明仍有很大改進(jìn)空間。模型可以在具有挑戰(zhàn)性的問題上取得部分進(jìn)展,但它們難以閉合推理循環(huán)。這種失敗模式反映了人類專家與新手之間的對比。專家們利用經(jīng)驗來構(gòu)建問題框架并調(diào)整方法,而新手則會做出觀察,但難以將其融入更廣泛的問題背景中。
要實現(xiàn)近乎完美的性能,需要評估既能可靠衡量進(jìn)展,又能識別模型仍然存在的缺陷。像 GeneBench-Pro 這樣的基準(zhǔn)測試就會起到很大作用。
與此同時,測序成本大幅下降,生物樣本庫規(guī)模的數(shù)據(jù)集現(xiàn)在以前所未有的廣度連接分子、表型和健康記錄信息。限制因素在于從數(shù)據(jù)生成轉(zhuǎn)向?qū)⑿畔⑥D(zhuǎn)化為可操作的洞察。能夠持續(xù)執(zhí)行由人類專家團(tuán)隊處理的分析的模型,可以通過加快假設(shè)篩選、目標(biāo)跟進(jìn)以及數(shù)據(jù)生成與決策之間的循環(huán)來改變工業(yè)研究。
GeneBench-Pro 代表了初步的嘗試。OpenAI 預(yù)估,隨著模型能力的進(jìn)步,探測這些更高抽象層次模型能力的基準(zhǔn)將變得越來越有用,超越僅僅測試書籍知識或執(zhí)行常規(guī)分析的能力。
https://openai.com/index/introducing-genebench-pro/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.