![]()
作者丨林夕
編輯丨小龍
2026年7月17日凌晨,中國AI史冊上一個無法忽視的分水嶺時刻。
月之暗面正式發布了新一代旗艦模型——Kimi K3。這是總參數量達2.8萬億、上下文窗口達100萬token的混合專家(MoE)大模型,更是全球首個面向開源社區開放的3萬億參數級別超級大模型。
![]()
在官方公布的測試結果中,Kimi K3以強悍的綜合智能水平直逼國際兩座大山,位列全球第三,僅排在Claude Fable 5和GPT-5.6 Sol之后。但在編程、Agent和視覺理解等多個核心細分賽道上,Kimi K3已與這兩款頂級閉源模型互有勝負,甚至在部分前沿基準中實現了強力反超。
![]()
國產大模型第一次在代表AI最高水平的“萬億俱樂部”中,擁有了能與世界頂峰正面拼刺刀的選手。
![]()
896個專家只激活16個
2.8萬億參數如何落地
Kimi K3延續了月之暗面一貫的大參數路線。從K2的1萬億參數到K3的2.8萬億,月之暗面在不到一年時間里將模型規模推高了近兩倍。但參數規模的擴張并非簡單地堆砌數字。
K3在架構層面引入了兩項關鍵更新:Kimi Delta Attention(KDA)和Attention Residuals(AttnRes),分別解決長序列計算成本和深層網絡信息衰減的問題。
KDA的核心邏輯是改變傳統注意力機制的處理方式。
在100萬token的上下文窗口下,傳統Attention的計算量呈平方級增長,每個token都要與其他所有token進行交互,這在數學上意味著極高的顯存占用和推理延遲。
![]()
KDA的做法是將長上下文拆解為“已總結的歷史”和“新來的變化”(Delta),對歷史部分用線性方式維護一個緊湊的記憶狀態,新token只重點關注變化部分。
官方數據顯示,在百萬token上下文場景下,KDA將解碼速度最高提升了6.3倍。
Attention Residuals則針對模型深度問題。
當模型層數增加到一定程度,信息從底層傳遞到頂層的過程中會逐漸衰減,導致訓練效率下降。
AttnRes在注意力機制上增加了專門的殘差連接,讓每一層的注意力輸出可以更直接地“跳過”中間層,保留更原始的信息。
![]()
月之暗面稱這一改進將訓練效率提升了約25%,而額外成本不到2%。
在MoE架構上,K3設置了896個專家,每個token實際只激活其中16個,保持了極高的稀疏度。
![]()
配合Stable LatentMoE框架、Quantile Balancing和Per-Head Muon等訓練方法的優化,K3的整體擴展效率相比K2提升了約2.5倍。
模型從監督微調階段就進行量化感知訓練,采用MXFP4權重和MXFP8激活,以提高在不同硬件平臺上的部署兼容性。
不過,2.8萬億參數對本地部署提出了極高要求。月之暗面建議至少采用包含64個加速器的超級節點來部署K3。
雖然官方承諾在7月27日前開放完整模型權重,但普通開發者很難在消費級設備或常規單機服務器上完整運行未經大幅量化的版本。
從某種意義上說,這更像是一個面向云端的“可訪問開源”,而非真正的本地可運行開源。
![]()
編程能力全線逼近Claude
視覺閉環開辟新戰場
編程是Kimi K3最核心的能力方向。
月之暗面明確表示,K3是公司迄今為止編程能力最強的模型,可以在長時間軟件工程任務中持續推進工作,理解大型代碼庫,操作終端,協調工具調用,檢查運行時行為,并在嘗試失敗后以較少的人類干預自主恢復。
從官方公布的測試數據來看,K3在多個編程基準上的表現已經進入全球第一梯隊:
- 在Program Bench上,K3獲得77.8分,略高于Claude Fable 5的76.8分和GPT-5.6 Sol的77.6分;
- 在考察長期軟件工程能力的SWE Marathon中,K3拿下42.0分,超過Fable 5的35.0分和GPT-5.6 Sol的39.0分;
- 在Terminal Bench 2.1測試中,K3得分88.3,與GPT-5.6 Sol的88.8分幾乎持平。
值得注意的是,不同類型的編程測試反映的是模型不同的能力維度。
像DeepSWE和Terminal Bench這類“精準執行型”測試,考察的是模型能否精確完成明確任務、定位問題、精準修改且不引入新bug。
而FrontierSWE這類“方案規劃型”測試,則側重創造性思考和深度理解復雜系統的能力。
K3在FrontierSWE上獲得81.2分,雖然低于Fable 5的86.6分,但已超過GPT-5.6 Sol的71.3分,說明它在需要創新性解決的難題上找到了自己的位置。
![]()
在實際案例中,月之暗面展示了K3從零開發一個名為MiniTriton的GPU編程系統,包含自己的領域特定語言、基于MLIR的中間表示、優化流程和PTX代碼生成管線。
![]()
在部分測試負載上,MiniTriton的運行性能達到或超過官方Triton與torch.compile,并能完成nanoGPT的端到端訓練。
更值得注意的是,在K3開發后期,一個早期版本的模型已經承擔了團隊大部分GPU內核優化工作,這標志著模型能力已經開始反哺自身的研發流程。
多模態視覺能力是K3的另一大亮點。與以往將視覺能力作為獨立模塊附加到語言模型上的做法不同,K3原生支持文本、圖像和視頻。
在游戲與前端開發場景中,模型可以讀取運行截圖,根據畫面繼續修改代碼,形成“視覺進入編程循環”的工作方式。
官方展示的一個案例中,K3在結合軟件工程、視覺理解和空間推理的任務上表現尤為突出——它可以在源代碼和渲染結果之間來回切換,結合截圖、日志、測試結果和運行狀態判斷下一步修改方向。
這種能力讓K3尤其適合游戲開發、前端工程、CAD工作流和基礎設施優化等場景。在實際測試中,K3完成了從零開發一個包含完整光影和交互機制的3D小游戲的任務,整個過程包含視覺反饋驅動的多輪迭代。
- 在視覺基準測試中,K3的OmniDocBench得分91.1,高于Claude Fable 5和GPT-5.6 Sol;
- MMMU-Pro得分81.6,接近Fable 5的81.2;
- 加入Python工具后,MathVision得分達到97.8,與GPT-5.6 Sol持平。
K3的發布預告視頻也由模型自己從56段源素材中完成剪輯,包括鏡頭切換、節奏匹配和音頻處理,展示了多模態能力從靜態理解向動態創作延伸的可能性。
API定價對標Sonnet
月之暗面借K3沖擊高端商業化
Kimi K3的發布伴隨著明確的商業化信號。
API定價方面,緩存命中的輸入價格為每百萬token 0.30美元,未命中緩存的輸入價格為每百萬token 3美元,輸出價格為每百萬token 15美元。按人民幣計算,輸入約20元、輸出約100元每百萬token,遠高于GLM-5.2的輸入8元、輸出28元的定價水平。
![]()
這一價格定位說明K3不再走低價換市場的路線,而是以更高推理強度、更長任務執行時間和更完整交付物為賣點,直接切入高端模型市場。
![]()
月之暗面稱,依靠Mooncake分離式推理架構,Kimi官方API在編程任務中的緩存命中率超過90%。按此口徑,長代碼倉庫和重復上下文任務的實際輸入成本可能明顯低于標價,但輸出價格較此前模型的大幅提高也反映出推理成本的現實壓力。
商業化數據支撐了這一高端化策略:
截至2026年6月中旬,月之暗面ARR(年度經常性收入)突破3億美元,繼3月突破1億美元、5月突破2億美元后,保持了快速增長的勢頭。API收入已占整體七成以上并持續提升。Kimi海外付費用戶增長400%,產品進入200多個國家和地區,互聯網、金融、制造、教育、醫療等行業正成為重要企業客戶來源。年內公司已完成多輪融資,最新投前估值已漲至315億美元。
![]()
大模型信仰
狂風驟雨中的終極火種
在更廣泛的市場格局中,K3的發布標志著中國大模型的競爭目標已經從“以較低成本接近閉源模型”轉向“在部分復雜任務上直接爭奪全球第一梯隊”。2025年DeepSeek R1的開源引發了行業震動,2026年GLM-5.2在海外口碑逆轉,如今K3又在參數規模和能力維度上拉近了與國際頂級模型的差距。
卡內基梅隆大學教授Ruslan Salakhutdinov在X上發文祝賀楊植麟和Kimi團隊,稱這是開源社區的一次重大勝利。
當然,挑戰也同樣清晰。
GPT-5.6 Sol是基于強化學習持續優化的老模型架構,而Fable 5和K3都是全新預訓練的新一代模型。GPT-6一旦發布,技術代差可能再次拉開。
很多人懷疑大模型的Scaling-law是否已到盡頭,但楊植麟和他的 Kimi 團隊,對此有著近乎神圣的執念與信仰。
在楊植麟的底層邏輯里,大模型從來不是可以隨意雕花、短期套現的商業工具,而是一座“綿延而未知的雪山”,是一場關于AGI(通用人工智能)的終極豪賭。
月之暗面選擇將噪音屏蔽,用一個又一個直插云霄的參數規模、一次又一次刷新上限的技術突破,給出了最硬核、最純粹的回應。
本文為創業邦原創,未經授權不得轉載,否則創業邦將保留向其追究法律責任的權利。如需轉載或有任何疑問,請聯系editor@cyzone.cn。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.