最近,智譜AI開發的AI模型GLM-5.2在全球引發關注,熱度極高。這款開源大語言模型擅長處理代碼任務,對智能體工作流特別友好。
智譜方面表示,GLM-5.2的上下文窗口支持100萬Token,與Anthropic的Claude Opus 4.8和OpenAI的GPT 5.5處于同一水平。
許多行業人士都對GLM-5.2的速度與能力感到驚嘆。Vercel的CEO吉列爾莫·勞赫(Guillermo Rauch)在社交平臺X上寫道:“GLM-5.2的編程能力之強讓我印象深刻,甚至感到震驚,它將改變游戲規則。”
曾擔任谷歌DeepMind和微軟的副總裁的馬特·維洛索(Matt Velloso)說:“這是第一個能作為日常主力工具使用的開源模型。情況將不再一樣了。”
![]()
因口碑走紅的模型
GLM-5.2的熱度升高似乎是一次意外,業界對它的熱議是漸漸走高的。在Design Arena平臺上,GLM-5.2甚至擊敗了Claude Fable。
無數AI同仁測試了這款開源模型,基本都是贊不絕口。之前讓美國同行驚嘆的是DeepSeek R1,而GLM-5.2的表現已遠遠超越了那個里程碑。Kimi K2之所以令人印象深刻,是因為中國各公司似乎都能在開源模型性能上取得重大突破。而GLM-5.2所邁出的這一步,堪稱人工智能進步的一扇單向大門。
Anthropic憑借Claude Code獲得巨額收入,GLM-5.2成為可信的替代選擇。在通用智能體的編碼環境中,它的表現超出預期。
一位行業人士認為,在過去一年里,美國各大實驗室的算力增長迅猛,原本以為中美模型的性能差距會隨著時間推移而進一步拉大,但目前中美模型的差距可能正在縮短,僅剩6-9個月。
在當前環境下,美國認為“神話級”模型的能力尚不安全,無法對外發布;而中國模型開發者卻大步向前,致力于將這些能力推向全民。
Anthropic旗下Claude Fable 5于6月9日發布,美國認為該模型容易遭受“越獄破解”,于是下令限制國外用戶訪問,導致模型在全球處于不可用狀態。這一事件促使全球開發者重新評估對美國技術的依賴是否可以持續,而中國模型能力的提升,也讓市場迎來了新的機會。
亞洲協會政策研究所中國經濟研究員Lizzi Lee表示:“我認為,智譜AI的股價上漲表明,市場立刻意識到了Anthropic剛剛創造出的機會。”
智譜AI創始人唐杰稱美國的限制“令人深感遺憾”,同時強調了自家模型的完全開源屬性。智譜AI官方承諾,GLM-5.2的性能將達到頂級水平,并超越其原本已非常先進的GLM 5.1。
Anthropic警告稱,美國及其盟友仍有機會鎖定12-24個月的前沿能力領先優勢,但鎖定這一領先優勢的窗口期未必會持續太久。6月18日,在X平臺上,許多人討論“中國模型何時達到Fable級別”,馬斯克認為2027年第一季度可能就會達到,而智譜AI聯合創始人唐杰卻回復稱“用不了那么久”。
基準測試證明其實力
在FrontierSWE基準測試中,GLM-5.2得分74.4,緊追Claude Opus 4.8的75.1,并超越了GPT-5.5的72.6。在SWE-bench Pro測試中,GLM-5.2得分62.1,高于GPT-5.5的58.6,并以大幅優勢超越前代GLM-5.1的58.4。
正因如此,它成為Artificial Analysis Intelligence Index平臺上最好的開源模型,OpenRouter將其歸類為與Claude Fable 5處于同一級別。
需要注意的是,GLM-5.2是在華為Ascend(昇騰)芯片上訓練的,整個流程中沒有英偉達的身影。
Stability AI創始人Emad Mostaque估計,GLM-5.2總訓練成本約為2500萬美元,其中80%用于訓練后階段。與同類模型相比,這一成本極低。
正如Decrypt今年早些時候報道的那樣,智譜AI已經在華為Ascend Atlas服務器上訓練圖像模型,未使用任何美國芯片。
Snowflake第一時間對GLM-5.2和Opus 4.7進行了測試,結果發現,GLM-5.2經受住了考驗。
測試涵蓋103項任務,每項任務運行三次,要求模型編寫的代碼能在DuckDB和Snowflake雙平臺上運行。當每個模型在每項任務上擁有三次嘗試機會時,兩者難分伯仲:任務解決率分別為66%和67%。
但在首次嘗試的準確率上,兩者出現了分化:Opus達到53.7%,而GLM僅為47.6%,這表明GLM的輸出穩定性稍遜一籌。
此外,中國模型每項任務平均運行99次,而Opus為80次;GLM消耗了8.6億個token,幾乎是Opus(4.39億個)的兩倍。
AI研究員Nathan Lambert表示:“幾乎所有我尊重的AI評論界和研究界人士都親自使用了GLM-5.2,用后都稱贊了這款模型。開源模型在社區中引發如此集中討論,此前只出現過一次——DeepSeek R1。這不是一個我輕易做出的比較,當我將Kimi K2的發布比作一個‘DeepSeek時刻’,GLM-5.2已經遠遠超越了那個時刻。”
目前看來,GLM-5.2至少與谷歌提供的產品一樣好,甚至可能更好——這在幾個月前聽起來還是個很奇怪的結論。
隨著AI能力的每一次躍升,價格實惠、靈活且開源的模型都緊隨其后,曾經部署成本高昂的東西變得相當便宜。美國鼓吹“國家安全”,可能只是自身優勢在縮小,而不是擴大,這本質上是一種被追趕者的憂慮。(小刀)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.