7月19日,月之暗面發布新一代模型Kimi K3,產品和API已上線,完整權重預計最遲7月27日公開。
K3總參數2.8萬億,原生支持視覺輸入,上下文窗口100萬詞元。這次發布真正引發討論的是它在前端開發任務上的表現;Arena榜單暫列第一。
Arena前端開發榜暫列第一
Arena 7月16日更新的前端開發榜單中,K3以1679分暫列第一,高于Claude Fable 5的1631分和GPT-5.6 Sol的1618分。Arena將這一成績標為"初步"(即投票數未達到穩定閾值),并明確榜單衡量的是前端網頁開發任務,包括需要多步推理和工具調用的智能體編程流程,而不是模型整體能力。
截至榜單更新時,K3仍被標為專有模型,因為完整權重尚未公開。
月之暗面自己的口徑也更為克制。公司在發布博客中稱,按其自有基準測試集,K3的綜合表現僅落后于Claude Fable 5和GPT-5.6 Sol;公司同時承認,K3的整體用戶體驗與這兩款模型仍有明顯差距。官方列出的限制還包括:思考歷史傳遞不完整時,生成質量可能變得不穩定;面對模糊需求時,模型可能替用戶作出過多決定。
"落后幾個月"取決于比較什么
K3之外,其他中國模型的測試也在縮小差距。
據彭博社報道,K3發布前,一名Anthropic高管仍認為其技術大約領先中國競爭對手6至12個月。K3發布后,加州大學伯克利分校教授、Arena聯合創始人Ion Stoica判斷,中國開放模型與前沿閉源模型的差距可能已縮短到2至3個月。
英國人工智能安全研究所7月17日發布的結果顯示,GLM-5.2和DeepSeek V4-Pro在網絡安全能力上,與早4至7個月發布的前沿閉源模型表現相近,短于2025年大部分時間測得的6至10個月差距。該機構明確提醒,這一結果只適用于網絡安全測試,不能外推到其他能力;它也尚未測試K3。
K3不是"更便宜的DeepSeek"
月之暗面給出的K3 API價格為:緩存未命中的輸入每百萬詞元3美元,輸出15美元,已經接近Anthropic的中檔模型。開發者Simon Willison稱,這是當時中國AI實驗室發布的單價最貴模型。
但單價不等于完成一項任務的實際花費。開發工具Cline公開測試了K3和Claude Fable 5,讓兩款模型修復同一個真實缺陷,兩款模型都完成了任務。K3花費0.92美元,低于Fable的2.13美元,但用了約120萬詞元和34次工具調用,耗時12分鐘;Fable使用約73萬詞元和18次工具調用,3.5分鐘完成。這一單任務實測顯示,K3的任務總成本可能更低,因為它用更多輪次但每輪更便宜——代價是完成速度更慢,使用的詞元和工具調用也更多。(易句)
(本文由AI翻譯,網易編輯負責校對)
