當前,醫療行業常用的大模型評測集多來源于教科書或各類醫學考試題庫。此類評測集涉及的輕癥和標準化病例題目多,危重癥、復雜共病以及模糊疑難病例題目較少,同時還存在對醫療安全底線重視不夠和真實臨床診療場景覆蓋不全等問題。
![]()
評測基準發布儀式現場 論壇會務組供圖
據介紹,此次發布的MedXIAOHE評測基準為1.0版本,致力于從醫生專業視角,構建醫療大模型評測標準。該評測基準立足真實的醫療病例與臨床場景,從醫療安全性、疑難病例鑒別診斷能力、治療先進性、專科多模態融合性、智能診療流程和真實病歷魯棒性等六大維度,對大模型進行專業考察,包含1000道專家共建題目,涵蓋30個臨床專科。中國工程院院士董家鴻、王寧利等院士團隊,22名中華醫學會和中國醫師協會各學科分會主任委員和副主任委員專家,以及5家權威機構參與了評測基準研制工作。
MedXIAOHE評測基準顧問專家、中華醫學會外科學分會主任委員張忠濤教授指出,在真實診療場景中,醫療安全尤為重要。MedXIAOHE評測基準將大模型醫療安全底線作為單獨維度予以重點關注,考察大模型在禁忌證識別、用藥安全、危重情況處置和誤診漏診防控等方面的風險把控力,同時,增加了對治療先進性的評測,考察大模型對新療法、聯合用藥、序貫治療和細分人群治療策略的掌握程度。
中華醫學會兒科學分會主任委員孫錕教授表示,MedXIAOHE評測基準尤其關注大模型的臨床價值,關注真實臨床病歷中的信息零散、表述不規范、時間線復雜和冗余干擾等問題,著重考察大模型的信息提取、噪聲過濾及不確定場景推理能力。同時,針對臨床場景的連續性特點,MedXIAOHE評測基準還注重考察大模型在病史補全、診療路徑規劃、循證依據調用、多學科診療協同、隨訪安排和風險處置中的閉環構建能力。此外,評測基準還聚焦疑難復雜疾病,注重考察大模型在多病種混淆、隱匿病情和并發癥干擾等場景里的臨床推理能力。
會上,王寧利院士、小荷健康總裁吳海鋒及來自中國康復研究中心、山東大學齊魯第二醫院、同濟大學等機構的臨床專家,共同啟動MedXIAOHE評測基準發布暨行業共建計劃。臨床醫生可通過項目官網(https://benchmark.xiaohe.cn)報名參與。
“我們希望吸引更多的醫學專家參與醫療大模型評測基準的建立工作。未來,小荷健康將把共建成果對外開放,讓MedXIAOHE評測基準成為惠及全行業的基礎性平臺,為建立更可信、更普惠的智慧醫療體系貢獻力量。”吳海鋒說。
![]()
文:夏海波
審核:李天舒 譚嘉
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.