![]()
智東西
編譯 茄子
編輯 程茜
智東西7月17日報道,今日,Kimi正式發布其迄今能力最強、全球首個開源的3萬億參數級別模型Kimi K3。該模型參數量達到2.8萬億,原生支持視覺理解,并擁有100萬token上下文窗口。
![]()
Kimi K3一上線便成為大模型頂流,不少網友將其發布稱作“中國的Fable 5時刻”。就連Kimi創始人兼CEO楊植麟的博士生導師、CMU機器學習泰斗Russ Salakhutdinov也發貼盛贊新版Kimi為開源社區帶來重大突破。
![]()
云平臺Vercel創始人、Next.js作者Guillermo Rauch公布專業網頁工程AI評測結果,Kimi K3綜合表現位列第一。他發帖稱,首次有開源模型在該權威榜單超越全部海外閉源模型;其代碼任務成功率達92%,開發效率優于同梯隊Claude Fable 5。
![]()
測評博主aditya實測后,認為Kimi K3就像中國開源了Claude Fable 5類型的模型。他用Kimi K3生成了一款槍戰游戲,并稱,從未見過AI僅憑一個提示就能生成如此驚喜的界面。
![]()
AI頭部測評博主Taelin也對Kimi K3進行了體驗。他認為Kimi K3在有些題目上表現超過Claude Fable 5,但有一些題目表現卻很差,并且,花費的時間是Claude Fable 5的10倍。不過,他稱,用Claude Sonnet 5的價格就能買到接近Claude Fable 5的開源模型,確實改變了自己的看法。
![]()
從技術博客看,Kimi K3長程Agent式執行能力大幅提升,該模型可以把編程、視覺理解、工具調用和知識工作串成完整流程。以官方展示的ASIC行業42年研究網站為例,Kimi K3通過120多輪迭代,完成2800多次網頁搜索與抓取、1100多次終端數據提取,處理87份季度報告和99份原始PDF,最終生成包含定制圖表、動畫示意圖和交互式可視化敘事的研究報告。
![]()
在基準測試方面,Kimi K3在大模型評測競技Arena.AI的前端代碼測試中,超越Claude Fable 5;在第三方獨立測評機構Vals AI中,Kimi K3的綜合測試得分為74.7,位列第2,超越GPT-5.6,僅次于Claude Fable 5。
![]()
Kimi K3上線前在海外曾以Kivine為代號被眾多網友注意到。開源生態基金會Super Gemma創始人Jun Song評價稱,從生成的結果來看,“Kimi明顯比Opus強”,并認為Kimi K3已經達到了Opus 5的水平。
在架構和基礎設施上,Kimi K3通過KDA、AttnRes等架構升級和更高稀疏性的MoE設計,提高長序列信息處理和模型擴展效率,相比Kimi K2整體擴展效率提升約2.5倍。
價格方面,Kimi維持分級計費模式,但相比Kimi K2.6價格有明顯上漲。具體來看,Kimi K3每百萬token的輸入價格為20元(緩存未命中),較Kimi K2.6的6.5元上漲了約207.69%;緩存命中情況下的輸入價格為2元,較之前的1.1元也有所提升;而輸出價格則從27元上調至100元,漲幅約270.37%。![]()
相比頂級閉源模型,Kimi K3仍保持較低價格。以Claude Fable 5為例,其API輸入和輸出價格分別為每百萬token10美元(約合人民幣67.78元)和50美元(約合人民幣338.88元),明顯高于Kimi K3。
Kimi K3現已上線kimi.com、最新版Kimi應用、Kimi API和Kimi Code編程助手,所有用戶可在免費額度內體驗,額度用完后需付費使用。Kimi稱,Kimi K3的完整模型權重將于7月27日前發布。智東西也在Kimi K3 Max模式下進行了多模態創意的實測。由于Kimi K3受到廣泛關注,使用人數不斷增多,智東西在進行第2個實測時被告知暫時無法使用。
![]()
一、實測對標Claude Fable 5,Kimi K3展示多模態創意理
智東西在Kimi K3 Max模式下測試了該模型的多模態與代碼生成能力,我們對Kimi K3下達的任務是要求其制作一個3D橫版的格斗游戲。
提示詞:制作一個單文件HTML的3D橫版格斗游戲,場景為被霸天虎入侵的破敗城市地圖,敵人為類人型賽博坦機器人,包含武器后坐力效果,采用低多邊形風格并帶有卡通美學。游戲開始時,玩家位于街道上,周圍有建筑廢墟;游戲中應包含可被擊倒的細節物品,如汽車、樹木、石塊/瓦礫和自動售貨機。玩家可以選擇5種擎天柱陣營角色進行游戲,并與5種霸天虎變種敵人戰斗,這些敵人會不斷生成,游戲為無限時間的沙盒模式。
![]()
從實測結果來看,Kimi K3僅用一次就完成了該游戲的創建,并且沒有出現錯誤。在游戲邏輯與元素還原上Kimi K3相較于之前的Kimi K2.6(下圖)都有較強的提升,主要表現在對提示詞的理解沒有像Kimi K2.6那樣出現讓玩家上下移動的情況,其次,在畫面的精細程度上,生成的人物更加接近提示詞要求,廢墟等環境都有出現。此外,在沒有提示的情況下,該游戲還為玩家提供了射擊和擊打2種攻擊模式。
![]()
AI領域記者Chetaslua對Kimi K3和GPT-5.6 Sol在3D內容生成方面進行了對比。他稱,兩款模型的差異不僅體現在輸出效果上,也體現在任務完成方式上。即便最終產出較為接近,二者采用的實現路徑仍存在明顯差異,他認為Kimi K3在創意生成方面表現更突出。
![]()
海外網友之前用Kimi K3生成了一個達芬奇工坊”(Officina di Leonardo)模擬器,主題是達芬奇設計的撲翼機(Ornithopter)。
Kimi K3不僅復現了文藝復興工坊的視覺風格,還理解了達芬奇撲翼機的歷史背景和工程細節,將材料、結構與空氣動力學知識融入生成結果,這說明該模型具備跨領域知識整合能力。
![]()
測評博主aditya在3D游戲生成任務中,將Kimi K3與GPT-5.6、Claude Fable 5、Grok 4.5同臺比拼,發現它們的性能不相上下,但Kimi K3單次調用成本僅0.71美元(約合人民幣4.81元),遠低于GPT、Claude;更突出的是它能解決其他模型察覺不到的隱性問題。他認為,開源大模型趕超頂尖閉源產品的速度遠超行業預期。
開發者LASCHUK也實測對比了Kimi K3與Claude Fable 5,提示詞都是復刻蘋果官網、無額外輔助,兩款模型都能完成頁面開發,但Kimi K3單次花費僅0.44美元(約合人民幣2.98元),成本只有Claude Fable 5 0.94美元(約合人民幣6.37元)的一半;按百萬token計價,Claude Fable 5定價遠高于市面絕大多數模型,Kimi K3定價僅其三分之一,LASCHUK由此質疑高價閉源模型的溢價價值。
![]()
二、從代碼開發到知識創作,Kimi K3展現復雜任務執行能力
在編程領域,Kimi K3不僅能夠理解大型代碼庫、調用終端工具,持續完成長時間的軟件開發任務,還能參與GPU內核優化、編譯器開發、芯片設計等高復雜度工程工作,并結合視覺理解能力完成游戲開發、前端設計等多模態編程任務。
首先,Kimi K3具備構建完整工程系統的能力。Kimi展示了該模型從零開始構建GPU編程系統的案例。它開發了類似Triton的編譯器MiniTriton,該編譯器可以將開發者編寫的程序轉換為GPU能夠執行的代碼,并完成優化和運行,在部分場景下性能達到甚至超過現有工具。
![]()
其次,Kimi K3還融合了3D推理、編程與視覺能力。它能將概念、圖像和視頻轉化為完全可玩的交互體驗。比如,Kimi K3生成的3D動畫游戲場景,里面是下雨天的森林,還包含湖泊,雨滴和馬匹以及人物等元素。
![]()
Kimi K3還能設計芯片。Kimi稱,在連續48小時的自主Agent運行中,Kimi K3基于開源EDA工具和Nangate 45nm工藝庫,獨立完成了芯片的構建、優化與驗證。
![]()
此外,Kimi K3還能將科學文獻中的方法轉化為可執行代碼,完成從論文理解、代碼實現到實驗分析的完整科研計算流程。
![]()
在知識生成領域,Kimi K3能夠自主搜集和分析大量資料,整合文獻、數據與工具,完成產業研究、科研分析、報告生成和可視化創作等任務。
下圖是Kimi K3生成的一份咨詢風格的行業報告,這份報告包含交互式可視化圖表。圖表中包括時間線、漏斗、甘特圖等。
![]()
這是Kimi K3對GWTC-5引力波的分析報告,它使用20多個并發subagents分析了391個引力波事件,生成了7張科學可視化圖、2張表格,并綜合了10多篇論文的文獻內容。
![]()
此外,Kimi K3還可以將技術概念轉化為動畫圖示和轉場。在這個案例中,Kimi K3制作了一支介紹自己架構的「3Blue1Brown」風格動態圖形講解視頻。
![]()
Kimi K3還能自己剪輯視頻。Kimi官方展示了該模型依托56段原始素材自主生成品牌宣傳視頻,獨立完成素材篩選、畫面動作匹配剪輯、卡點、音頻以及多輪迭代修改工作,較人工快上數天。
![]()
值得注意的是,Kimi K3還進一步增強了模型交互的可視化和持續管理能力。基于Kimi K3,Kimi Work推出了“小組件”和“看板”功能。其中,小組件支持在對話中生成可交互內容,并連接本地數據或外部插件實現動態更新;看板則能夠集中管理多個小組件,形成圍繞項目、主題或目標的長期工作空間。
![]()
三、多維評測驗證,編程、Agent與視覺能力全面提升
在官方公布的評測結果中,Kimi K3在編程、Agent任務和視覺理解等多個方向展現出較強能力。
在編程能力方面,Kimi K3在超長時序持續開發SWE Marathon、軟件逆向Program Bench、終端運維Terminal Bench 2.1等測試中表現突出。其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1達到88.3分,與GPT-5.6 Sol接近;在高難度軟件工程任務FrontierSWE中,Kimi K3以81.2分位列第二,僅次于Claude Fable 5。
![]()
在Agent和知識工作場景中,Kimi K3同樣展現出較強的任務執行能力。在網頁深度調研BrowseComp、辦公自動化Automation Bench、Excel財務建模SpreadsheetBench 2等測試中取得領先,其中BrowseComp達到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。不過,在綜合白領任務GDPval-AA v2、APEX-Agents等更貼近真實辦公流程的評測中,Kimi K3仍弱于Claude Fable 5等頂級閉源模型。
![]()
在視覺能力方面,Kimi K3在圖表理解CharXiv、文檔分析OmniDocBench等任務中表現較強,其中OmniDocBench達到91.1分,超過參與對比的多款模型;但在部分視覺推理任務中,Kimi K3仍存在差距,例如零樣本視覺工具任務Zerobench低于Claude Fable 5。
![]()
Kimi內部也測試了Kimi K3的工程能力。在GPU內核優化測試中,Kimi K3需自主完成代碼分析、內核重寫和性能驗證,覆蓋AttnRes、KDA、MLA等GPU計算任務。結果顯示,在最高推理強度下,Kimi K3表現接近Claude Fable 5(含回退機制),并超過Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。
![]()
在知識工作方面,Kimi內部Internal Knowledge Work Bench測試顯示,在統一開啟最高深度思考模式后,Kimi K3在通用推理、深度文檔分析和金融專項三類任務中的表現均超過GPT-5.5和Claude Opus 4.8。
![]()
四、兩大架構升級支撐3T級模型,推理成本仍可控
據官方博客介紹,從去年7月到現在,中間有9個月,Kimi模型始終保持著開源模型的規模上限,參數量一直在1萬億以上,而今天推出的Kimi K3是首個參數量達到2.8萬億的開源模型。![]()
Kimi K3的構建主要基于這2項架構更新:Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)。更新之后的架構可讓信息在更長序列和更深模型中流動得更順暢。同時,Kimi K3進一步擴大了Mixture of Experts(MoE)的稀疏度:結合Stable LatentMoE框架后,該模型可以在896個專家中高效激活16個。
![]()
Kimi稱,再加上訓練方法和數據配方的優化,這些結構性改進讓Kimi K3相比Kimi K2的整體擴展效率提升約2.5倍,能更有效地把算力轉化為能力。
在訓練與部署上,該模型從SFT階段開始采用量化感知訓練,使用MXFP4權重和MXFP8激活,并通過平衡專家并行訓練提升吞吐。針對長上下文推理,Kimi團隊還向vLLM社區貢獻了KDA相關實現,使Kimi K3在2.8萬億參數和百萬token上下文條件下仍能控制推理成本。
在安全性和可靠性方面,Kimi稱目前Kimi K3仍存在一些使用限制。
一是由于Kimi K3是在保留思維歷史的模式下訓練的,如果Agent框架沒有正確返回完整歷史內容,或用戶在會話中從其他模型切換到K3,生成質量可能變得不穩定。
二是Kimi K3針對長期復雜任務進行了強化訓練,在用戶意圖不明確時可能表現得過于主動,因此官方建議在系統提示詞或AGENTS.md中設置更明確的行為邊界。
Kimi也承認,Kimi K3雖然具備較強競爭力,但用戶體驗相比Claude Fable 5、GPT 5.6 Sol等頂級閉源模型仍存在差距。
結語:Kimi K3拉開超大開源模型序幕,搞定復雜工作完整交付
Kimi K3的發布,進一步推動開源模型向超大規模邁進。但相比參數規模的提升,Kimi K3更值得關注的是其在長程任務執行上的探索。
從長時間代碼開發、GPU工程優化,到產業研究、科研分析和多模態創作,Kimi K3展示了大模型從內容生成向復雜任務執行和完整工作流交付的延伸。
不過,隨著模型規模持續擴大,如何進一步提升推理效率、降低使用成本,并縮小與頂級閉源模型在實際體驗上的差距,仍是開源模型后續發展需要解決的問題。
來源:Kimi、X
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.