![]()
新民晚報記者近日獲悉,中文醫療大模型評測基準MedBench已升級至5.0版本。上海人工智能實驗室聯合廣州實驗室、廣州醫科大學附屬第一醫院鐘南山院士團隊,復旦大學附屬中山醫院葛均波院士團隊,上海交通大學醫學院附屬第九人民醫院范先群院士團隊等頂尖力量,共同推出專科化評測賽道,首創醫療原子技能評測范式,并實現AI模型幻覺全維度校正,持續筑牢醫療AI安全防線。
![]()
上海AI實驗室供圖(下同)
MedBench是國內首個原生醫療垂直評測體系,也是上海市委網信辦、上海市衛生健康委指定的前置醫療AI應用技術評測載體。自2024年首次發布以來,平臺已累計服務近12萬用戶,完成超31萬次醫療大模型評測,支撐6項國家級與省級AI賽事。依托MedBench,上海AI實驗室于2025年牽頭成立醫學人工智能評測聯盟,目前已有500余家頂尖醫療機構、行業組織和科技企業參與,成為醫療AI測評與驗證領域的重要力量。
此次升級后,MedBench 5.0構建起覆蓋醫療AI全生命周期的評測閉環——在事前準入環節,平臺實施資質核對與基模甄別,從源頭把控模型基礎能力與合規底線;事中評測環節依托評測基準,開展全維度安全攻防測試和臨床場景性能校驗,全面探測模型能力邊界與潛在風險;事后落地環節持續跟蹤應用表現并開展迭代復測,保障醫療AI上線后持續安全可靠。該閉環以上海市醫療大模型應用檢測驗證中心為核心載體,形成“備案協同、評測準入、倫理審查、落地追蹤、整改復測、標準輸出”一體化的治理范式,并建立起“8+1”醫療人工智能評測架構,在垂直定位、評測維度、數據規模、技術范式、安全基石、專科場景、產業賦能和生態影響八個維度實現全面布局。
![]()
在評測技術上,MedBench 5.0突破傳統靜態問答模式的局限,創新構建動態化、過程化、幻覺感知的評測新范式。平臺搭建了“臨床認知應答”與“醫療原子技能”雙維度評測框架:認知應答評測覆蓋13個子方向,全面評估大語言模型、全模態大模型和醫療智能體的臨床認知能力,并與京東健康共建多模態真實線上問診測評MedRealMM及醫學3D影像問答測評Med3DVQA等基準;醫療原子技能評測則圍繞數據智能體、檢索增強生成智能體、深度研究和安全紅隊測試四大核心任務,配套自主研發的評測沙箱與工具鏈,對模型執行能力進行系統性評估。全體系共覆蓋63項細分臨床評測任務,依托近100萬條高精度專業評測試題構成評測標尺。
深耕專科應用是此次升級的重點。針對通用評測難以匹配專科精細化需求的痛點,MedBench 5.0設立專科專精評測賽道,已落地8大細分專科標桿挑戰賽,覆蓋多專科、全場景與全流程能力。其中,臨床決策與全病程管理方向包括:呼吸專科RESClinBench,由鐘南山院士團隊聯合打造,聚焦呼吸典型場景下的臨床決策與全病程管理;心內科MyoCardBench,由葛均波院士團隊聯合打造,聚焦心血管全診療場景的一體化決策能力;兒科PEDIASBench,聯合上海市兒童醫院,立足門診實景的綜合處置與動態病情研判思維。多模態診斷與綜合評估方向涵蓋:眼健康專科OPHBench,由范先群院士團隊聯合打造,融合眼科多模態數據,評測眼病綜合診斷與分級評估能力;中醫專科TCM-5CMEval,聯合中國中醫科學院和上海中醫藥大學,評測中醫臨床科研綜合素養。循證與問診能力評估方向則推出隨機對照試驗循證證據質量評估RCTBench、基于改良評分系統的多輪問診自動化測評Mini-CEX,以及聯合京東健康打造的醫療循證問答能力測評MedEviBench等特色賽道。這些評測深度貼合真實診療流程,全面覆蓋急重癥識別、慢病管理、多模態診斷與臨床決策等復雜場景。
![]()
在生態建設與行業標準化方面,MedBench已累計開源超7萬條評測數據集,覆蓋醫療倫理、醫療安全和醫療文本推理等核心領域,完成超31萬次評測服務。團隊深度參與10余項醫療AI評測標準制定,發布相關學術論文近30篇,申請專利和軟著20余項,并常態化支撐行業服務登記前置審查與備案大模型合規核驗。依托醫學人工智能評測聯盟的500余家成員,平臺正持續推進醫療AI評測的開源化、標準化與規模化發展。
原標題:《中文醫療大模型評測基準上新,鐘南山、葛均波、范先群等院士團隊共建專科評測》
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.