![]()
![]()
為人類造醫生、為生命建模型。
作者|田思奇
編輯|栗子
7月17日,WAIC 2026開幕。上海世博展覽館聚集1100多家企業、3000多件展品,規模創下九屆以來新高。人形機器人、四足機器人、載人機甲等具身智能產品集中亮相,AI以更具體、更接近現實世界的方式進入公眾視野。
但在展館里走一圈,真正值得關注的變化不只在“AI能不能動起來”。模型能不能進入一個行業,接住真實用戶,沿著復雜流程持續工作,也是這場競爭中的重要命題。
今年WAIC的一個清晰信號是:AI正從“能聊”走向“能干”。對大模型公司來說,榜單成績給出的是起點,真正拉開差距的,是模型能不能離開發布會,進入一個行業最難的部分。
更直接一點,當模型已經能拿下榜單第一,下一場考試究竟在哪里?
百川給出的答案是:M4 已經不只在榜單上,它還被放進了AI家庭醫生產品,并繼續進入腫瘤和兒科專科現場。
為人類造AI醫生,百川正在把這件事變成現實。
1.AI醫療的價值,不在對話框里
讓AI幫你做PPT、總結會議、寫代碼,核心工作仍由人完成。這樣的AI進入的是工作外圍,解決的是一個個被明確提出的任務。
但醫療不一樣。患者不會按標準格式描述癥狀,醫生也不可能只回答一句話就結束服務。AI要處理遺漏、追問、檢索、判斷和后續跟進,真正進入的是一段連續流程。
探訪今年WAIC百川智能展位,『甲子光年』看到的是三組不同層次的現場證據:面向家庭的百小醫、與國家癌癥中心共建的腫瘤專科能力,以及與北京兒童醫院聯合驗證的兒科能力。
![]()
時至今日,市面上能回答健康問題的 AI 產品很多,豆包、千問、元寶等都能完成問答。但“答對一道題”和“接住一段醫療服務”之間,隔著的不只是一個聊天窗口,還有對真實信息的補齊、對醫學證據的調用,以及對后續節點的持續跟進。
王小川對「甲子光年」說:“百川的目的是讓大模型真正進入診前、診中、診后的醫療服務流程,進入家庭、醫院和更廣泛的健康服務場景。”
但這個目標實現起來并不容易。
牛津大學發表于《Nature Medicine》的研究給過一個數字:AI 讀取標準化病歷時準確率為 94.9%,真實患者自助使用時降至 34.5%。
差距不只來自知識量。因為真實患者的表達往往遺漏、混亂、斷續,標準化病歷里沒有這些噪聲。醫療服務需要 AI 主動補齊信息,而不是等用戶把問題問完整。
AI面對的不是一次性問答。癥狀出現、就醫準備、報告解讀、醫囑執行和后續隨訪,通常分散在不同時間、不同入口里。它離用戶最近,需求也最高頻,最能檢驗 AI 能不能接住一段連續服務。
而M4 的處理方式是主動追問癥狀、病史和相關檢查情況,形成下一步判斷所需的信息框架,再用超長記憶承接多次交流。它把“用戶問一句、模型答一句”的關系,往前推進了一步。
這也是AI家庭醫生產品和普通聊天機器人的分界線:前者要接住問題后面會發生什么。
2.M4三項第一之后,真正難的是把能力用起來
據「甲子光年」了解,Baichuan-M4在HealthBench、HealthBench Hard、HealthBench Professional三項醫療評測中均位列第一。綜合得分68.6,領先第二名GPT-5.5超過10分;事實性幻覺率3.3%,在該組對比模型中最低。同口徑下,GPT-5.5為3.8%、Claude Opus 4.7為6.9%、DeepSeek-V4-Pro為9.8%。
![]()
這個分數證明,M4的基礎模型能力已經站在前列。但高分不會自動變成AI家庭醫生,也不會自動變成專科能力。中間還隔著產品組織、醫學證據和真實場景。
事實上,要想讓AI真正進入醫療場景,需要多方能力配合。低幻覺解決的是“少錯”,循證解決的是“有據可查”,主動追問和長程記憶解決的是“能不能把服務接下去”。
百川把這些能力都放進了 M4。
具體來說,針對醫療場景中的事實性錯誤,百川通過事實性感知強化學習算法,最大限度減少幻覺。
循證能力直接對應醫療服務的專業門檻:權威指南被拆解為1000余條原子化臨床路徑,每條由臨床專家定義和校驗,讓模型回答有路徑可循、有證據可查。
而連續服務還需要主動追問和長程記憶。M4根據當前信息追問癥狀、病史和檢查情況,并承接從首診到多次復診的交流;Harness組織追問、檢索和專科能力調用。
這些能力如果只停留在技術描述里,仍然只是模型材料。百小醫和后面的專科項目,讓它們接受了真實場景的檢驗。
M4的模型分數是硬證據,證明百川站在AI醫療前列;AI家庭醫生產品和專科驗證,則開始回答一個更難的問題:這套能力能不能被真正用起來。
Tether進軍AI醫療時,在OpenAI、Ubiquant AI和百川的方案中選定M3作為教師模型,并評價為“代際差異”。M4是M3之后的新一代旗艦。
3.AI家庭醫生和專科臨床,百川都在逐步進入
百小醫是 M4 面向家庭健康的產品化落地。
它的定位就是AI家庭醫生,通過APP和微信BOT,把模型放進癥狀梳理、就醫準備、報告解讀、醫囑執行和家庭日常健康管理。
APP覆蓋癥狀梳理、就醫準備、報告解讀和醫囑執行等就醫環節;微信BOT面向家庭日常,支持進入家庭群,提供用藥提醒、復查節點和隨訪咨詢。
現場演示從一個具體場景開始:深夜腳趾劇痛驚醒,打開百小醫,經過10輪追問排除運動損傷,鎖定急性痛風方向,并建議掛風濕免疫科。問診卡同時生成給患者和醫生的兩份材料;到院確診后,系統再逐條拆解處方,結合生活習慣給出執行建議。百小醫把一次突發癥狀接進后續就醫服務,AI家庭醫生不再只是回答當下的問題。
王小川說:“AI家庭醫生應該在你最常打開的地方等著你。微信是中國人的數字生活底座,AI就該在那里。”
AI家庭醫生解決的是日常健康服務,專科現場面對的則是更復雜的病例、更嚴格的證據要求和更高的臨床門檻。
M4在腫瘤和兒科的驗證,回答的是模型能力能不能進入真實專科。
腫瘤場景首先考驗循證和推理。
百川與國家癌癥中心、中國醫學科學院腫瘤醫院聯合共建,將M4用于病歷解構、多源循證檢索和按證據等級排序的方案對比。院內驗證顯示,與MDT專家意見一致率在指南內方案中為100%,在指南外復雜病例中為94%。
![]()
兒科面對的是另一類難題。
中國兒童專用藥占比不足2%,53%的門診處方涉及超說明書用藥,模型既要理解知識,也要處理復雜的用藥安全邊界。
融合北京兒童醫院知識庫后,M4綜合安全合規率為92%,對照其他AI工具為63%。在60個真實病例的內部對照中,M4 的診斷結果與標準答案符合率為91.7%,同場12位主治醫師和住院醫師平均值為77.12%,與北兒專家診斷符合率為95%。
北京兒童醫院院長倪鑫提出,希望和百川一起打造100萬個AI兒科醫生。
單個病例的準確不是終點。真實機構里的持續驗證,才會把一次展示變成可復用的專科能力。
4.讓通用模型長出專科能力,百川的下一張牌
王小川將醫療稱為“通用大模型皇冠上的明珠”。因為醫療不僅要求事實可靠、證據可追溯、能夠主動補齊信息,還要承接長期服務。
對通用底座而言,這里既是高門檻,也是檢驗能力成色的地方。
醫療面對的不是一組標準題,而是專業知識、復雜語境、證據來源和真實責任交織在一起的服務現場。
百川的領先,不只體現在M4的排名上,也在于它比多數公司更早把模型、AI家庭醫生產品和專科驗證接到了同一條發展路徑上。
M4站在模型評測前列,百小醫進入家庭,腫瘤和兒科項目進入臨床機構,這三件事放在一起,才看得出百川已經走到哪里,因為AI家庭醫生產品和專科驗證,讓模型評測名列前茅的成績,開始有了真實場景的支撐。
如果這套方法繼續沿專科展開,腫瘤和兒科之后,心血管、內分泌、藥物咨詢、康復管理等場景都可能成為下一步方向。一年前百川只有家庭健康產品作為應用載體,目前已經在兩個國家級臨床機構形成了階段性驗證。
從現有產品和合作項目看,百川希望逐步形成覆蓋家庭與醫院、連接診前、診中和診后環節的 AI 醫療服務體系。
在機器人用行動讓人看見AI下一步時,百川展示的是另一種更難被看見的進展:M4的能力,已經開始進入AI家庭醫生和專科現場。
(封面圖及文中圖片來源:百川智能)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.