![]()
美國科技媒體officechai.報道,一個被美國列入實體清單、買不到英偉達芯片的中國AI實驗室,剛剛在衡量真實職場工作能力的權威基準測試中,把GPT-5.5和谷歌所有模型都甩在了身后。
這不是某個偏門榜單的意外闖入。北京智譜AI旗下的GLM-5.2,在人工智能分析公司(Artificial Analysis)發布的GDPval-AA v2基準測試中獲得1524分的Elo評分,全球排名第三,僅次于Anthropic的Claude Fable 5(1783分)和Claude Opus 4.8(1615分)。OpenAI的GPT-5.5在最高推理設置下得分1509分,谷歌最好的Gemini 3.5 Flash得分1357分,均落在GLM-5.2之后。
這個結果的沖擊力,在于GDPval-AA測量的究竟是什么。
不是解謎題,是做真實的工作
![]()
傳統AI基準測試往往考的是孤立的推理題或編程挑戰,本質上更像考試。GDPval-AA的設計邏輯完全不同,它模擬的是有實際經濟價值的知識工作:多輪交互、長時跨度、真實的專業任務場景。在這套測試中,GLM-5.2平均每項任務完成約31輪對話,這不是"回答一個問題",而是"持續推進一件事"。
人工智能分析團隊用同一份真實任務清單同時測試了GLM-5.2和三個前沿模型,包括零售主管的日常業務清單、IEC緊急停止電路原理圖分析以及管弦樂情緒板設計。三項任務中,GLM-5.2的表現均與Claude Fable 5、GPT-5.5和Gemini 3.5 Flash處于同一梯隊。
這一模式在另一個名為AA-Briefcase的專項基準測試中同樣成立。該測試專門針對研究、分析和結構化交付成果類工作,將評分通過率、分析質量和表達能力合并為一個綜合Elo分數。GLM-5.2在此拿下1266分,超越GPT-5.5的1159分,再次占據開源模型榜首。
橫向來看,GLM-5.2的表現并非偶發。在人工智能分析智能指數(AIAI)中它排名第四,得分51分,整體僅落后于三個專有閉源模型。在代理指數(Agentic Index)的開放權重分類中,它同樣排名第一。智譜AI對這批數據的總結是:所有測試結果高度一致,沒有明顯的短板。
被"卡脖子"的反面教材
![]()
這里有一個細節,值得單獨拎出來說。
智譜AI自2025年1月起被列入美國實體清單,無法采購英偉達GPU。GLM-5.2運行在華為昇騰芯片之上。這件事本身就構成對"芯片出口管制能有效遏制中國AI發展"這一論點的直接反駁。
不僅如此,GLM-5.2還是開放權重模型,定價極為激進:每百萬輸入代幣1.40美元,每百萬輸出代幣4.40美元。對比之下,Claude Opus 4.8的定價是輸入15美元、輸出75美元,貴出將近一個數量級。一個價格如此低廉、硬件資源受限的開放模型,在智能體真實工作基準測試上與頂級專有模型并駕齊驅,這件事從經濟邏輯到地緣政治含義,都遠超一張榜單本身的意義。
智譜AI的迭代節奏同樣值得關注。GLM-5于2月發布,GLM-5.1于3月下旬跟進,GLM-5.2于6月推出,平均每六周就有一個重要版本落地。GLM-5.1已在SWE-Bench Pro軟件工程測試中超越GPT-5.4和Claude Opus 4.6,成為首個在該測試中登頂的中國模型。GLM-5.2則在另一條更貼近真實應用的賽道上繼續延伸這一勢頭。
過去十二個月,"中國AI落后美國半年到一年"是行業的普遍共識。這個共識正在被一份又一份基準數據逐漸瓦解。GLM-5.2不是終點,它更像是一個信號:這場競爭的格局,比大多數人想象的要復雜得多。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.