7月19日,月之暗面發(fā)布新一代模型Kimi K3,產(chǎn)品和API已上線,完整權(quán)重預(yù)計最遲7月27日公開。
K3總參數(shù)2.8萬億,原生支持視覺輸入,上下文窗口100萬詞元。這次發(fā)布真正引發(fā)討論的是它在前端開發(fā)任務(wù)上的表現(xiàn);Arena榜單暫列第一。
Arena前端開發(fā)榜暫列第一
Arena 7月16日更新的前端開發(fā)榜單中,K3以1679分暫列第一,高于Claude Fable 5的1631分和GPT-5.6 Sol的1618分。Arena將這一成績標(biāo)為"初步"(即投票數(shù)未達(dá)到穩(wěn)定閾值),并明確榜單衡量的是前端網(wǎng)頁開發(fā)任務(wù),包括需要多步推理和工具調(diào)用的智能體編程流程,而不是模型整體能力。
截至榜單更新時,K3仍被標(biāo)為專有模型,因?yàn)橥暾麢?quán)重尚未公開。
月之暗面自己的口徑也更為克制。公司在發(fā)布博客中稱,按其自有基準(zhǔn)測試集,K3的綜合表現(xiàn)僅落后于Claude Fable 5和GPT-5.6 Sol;公司同時承認(rèn),K3的整體用戶體驗(yàn)與這兩款模型仍有明顯差距。官方列出的限制還包括:思考?xì)v史傳遞不完整時,生成質(zhì)量可能變得不穩(wěn)定;面對模糊需求時,模型可能替用戶作出過多決定。
"落后幾個月"取決于比較什么
K3之外,其他中國模型的測試也在縮小差距。
據(jù)彭博社報道,K3發(fā)布前,一名Anthropic高管仍認(rèn)為其技術(shù)大約領(lǐng)先中國競爭對手6至12個月。K3發(fā)布后,加州大學(xué)伯克利分校教授、Arena聯(lián)合創(chuàng)始人Ion Stoica判斷,中國開放模型與前沿閉源模型的差距可能已縮短到2至3個月。
英國人工智能安全研究所7月17日發(fā)布的結(jié)果顯示,GLM-5.2和DeepSeek V4-Pro在網(wǎng)絡(luò)安全能力上,與早4至7個月發(fā)布的前沿閉源模型表現(xiàn)相近,短于2025年大部分時間測得的6至10個月差距。該機(jī)構(gòu)明確提醒,這一結(jié)果只適用于網(wǎng)絡(luò)安全測試,不能外推到其他能力;它也尚未測試K3。
K3不是"更便宜的DeepSeek"
月之暗面給出的K3 API價格為:緩存未命中的輸入每百萬詞元3美元,輸出15美元,已經(jīng)接近Anthropic的中檔模型。開發(fā)者Simon Willison稱,這是當(dāng)時中國AI實(shí)驗(yàn)室發(fā)布的單價最貴模型。
但單價不等于完成一項(xiàng)任務(wù)的實(shí)際花費(fèi)。開發(fā)工具Cline公開測試了K3和Claude Fable 5,讓兩款模型修復(fù)同一個真實(shí)缺陷,兩款模型都完成了任務(wù)。K3花費(fèi)0.92美元,低于Fable的2.13美元,但用了約120萬詞元和34次工具調(diào)用,耗時12分鐘;Fable使用約73萬詞元和18次工具調(diào)用,3.5分鐘完成。這一單任務(wù)實(shí)測顯示,K3的任務(wù)總成本可能更低,因?yàn)樗酶噍喆蔚枯喐阋恕鷥r是完成速度更慢,使用的詞元和工具調(diào)用也更多。(易句)
(本文由AI翻譯,網(wǎng)易編輯負(fù)責(zé)校對)
