![]()
作者 | 論文團隊
編輯丨ScienceAI
隨著有機合成、材料開發、藥物篩選等領域邁向高度自動化,我們與「無人實驗室」之間的距離,已不再是機械臂的精度,而是一道語言與邏輯的鴻溝。
學術文獻中,化學合成實驗流程常以自然語言方式撰寫,實驗步驟間暗含了無數約定俗成的操作慣例和嚴格的依賴關系。一個試劑加入順序的錯誤,或是一個后處理步驟的遺漏,都可能導致整個合成失敗。當前的大語言模型雖已掌握海量化學知識,但會答題的模型,真的會「做實驗」嗎?
近日,上海交通大學計算機學院、人工智能研究院 AI for Science 團隊在許巖巖副教授等人的指導下,發布了 ChemReason-Bench—— 首個大規模、人工驗證的實驗程序推理基準,專門用于診斷大語言模型在理解與生成可執行實驗流程時的邏輯短板。該工作已被自然語言處理頂級會議 ACL 2026 錄用。項目代碼、數據與更多細節已全面開源。
![]()
論文地址:https://openreview.net/forum?id=aVXpKdGUFx
GitHub 項目地址:https://github.com/Khadaz/ChemReason-Bench
痛點:化學知識 ≠ 程序推理
現有的化學大模型評測大多聚焦于知識問答,模型只需在一組選項中挑出正確答案。然而,真實的實驗設計要求模型具備跨步驟的約束滿足能力:前一步的反應狀態會限制后一步的操作,一個看似合理的化學建議可能與整個流程的操作約束相沖突。
這種「程序一致性」的缺失,會帶來嚴重的評估盲區 —— 一個在多選題中表現優異的模型,可能在生成完整實驗流程時犯下致命錯誤。缺乏對這一能力的診斷工具,就無法定位模型失敗的具體環節。
ChemReason-Bench:
給模型的「實驗邏輯」做一次全面體檢
ChemReason-Bench 摒棄了單一的總分評估,而是將實驗程序推理拆解為六種互補的能力維度,進行全方位診斷。它基于一個統一的、帶有明確占位符的結構化框架,使得大量操作約束可以自動驗證。
基于 500 個有機合成反應,研究團隊構建了 7,306 個人工驗證的高質量任務實例,涵蓋以下六類任務:
- 步驟排序:給定幾個候選操作,判斷它們的正確先后順序。
- 步驟驗證:判斷一個候選動作在當前實驗語境下是否可行。
- 條件驗證:判斷給定的溫度、時長等反應條件是否合理。
- 步驟補全:在實驗流程的「空缺」處,生成一個符合前后約束的正確操作。
- 對比選擇:從具有迷惑性的選項中,準確識別出物質角色。
- 原理解釋:為某個實驗操作或條件選擇提供背后的因果邏輯。
通過這一多任務設計,研究者可以繪制出模型的能力雷達圖,清晰揭示其強項與短板。
![]()
核心發現:結構化生成是最大瓶頸,專業化學模型不敵通用模型
研究團隊對包括 GPT-5.2、DeepSeek-v3.2、Llama-3.1 以及 ChemLLM 等在內的 18 個開源、閉源及領域專用模型進行了統一評測,主要發現如下:
(1) 頂尖通才模型初步具備程序推理能力:表現最強的 GPT-5.2 取得 70.30 的綜合得分,DeepSeek-v3.2 緊隨其后(65.21),顯示出在程序一致性方面的初步進展。
(2)「步驟補全」是公認的超級難題:在所有任務中,步驟補全的得分相對低。即便最強的 GPT-5.2 也僅獲得 51.65 分。這揭示出,在嚴格的約束下生成一個完全正確的結構化操作步驟,仍是當前模型面臨的重大挑戰。
(3) 化學專用模型表現不佳:ChemLLM、ChemDFM、LlaSMol 等經過領域數據訓練的模型,在該基準上全面落后于通用大模型。這說明,實驗程序的邏輯推理能力,遠非簡單的領域語料擴充所能賦予,它更需要基礎的規劃與約束遵循能力。
(4) 生成與決策的不一致現象:部分模型在自由文本生成時表現尚可,但在要求直接輸出「是 / 否」等離散決策時卻暴露出明顯的概率偏差。這種「表里不一」揭示了模型決策過程內在的不穩定性。
![]()
從評測到進化:用可驗證反饋訓練「會思考」的 AI 助手
ChemReason-Bench 不僅是一把「尺子」,更是一套「訓練器械」。團隊同步發布了一個包含超過 12 萬個任務實例的大規模訓練集 ChemReason-TUNE。
實驗表明,通過在 ChemReason-TUNE 上進行監督微調,Gemma-2-9B 等小模型可以在該基準上取得與頂尖閉源模型相當的性能,為未來在實驗室內本地化部署輕量級、高可靠性的化學實驗 AI 助手提供了清晰路徑。
![]()
結語:邁向「語言驅動」的化學研究新范式
ChemReason-Bench 的推出,標志著化學大模型的評估正從淺層的知識問答,邁向深層、多維度的程序邏輯驗證。它揭示了一個清晰的現狀:即便最強大的 AI,在「動手實操」的邏輯一致性上,距離可靠的化學家仍有不小的距離。
這只是一個新的起點。我們相信,隨著可驗證評測體系的完善與模型訓練范式的革新,大語言模型有望真正跨越化學實驗的「最后一道語言壁壘」,從「能說會道」走向「能做會做」,成為未來智能合成平臺真正可靠的邏輯引擎。
團隊介紹
上海交通大學人工智能研究院 AI for Science 團隊在楊小康教授、金耀輝教授、許巖巖副教授帶領下,包括十余位博士后與碩博研究生,重點研究生成式人工智能,特別是科學大模型賦能化學研究,針對有機化學合成、自動化實驗等重大問題提出了一系列創新解決方案。
團隊發布了首個化學合成大語言模型 —— 白玉蘭科學大模型 Chemma,是首個具備反應生成與「人在環路」反饋優化能力、能夠指導實驗探索的化學大模型,并建設了白玉蘭合成科學自主智能實驗室(BSAIL),實現了以科學大模型為大腦、擁有具身操作能力的「干濕閉環」自主無人實驗系統。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.