記者丨雷晨
編輯丨包芳鳴
7月19日,Kimi K3發布48小時后,月之暗面暫停了C端新用戶訂閱。服務器負載接近上限,推理排隊時間拉長,現有GPU集群無法支撐調用量的指數級增長。一款國產大模型因需求過載而主動限流,這在國內AI行業中實屬罕見。
月之暗面于7月17日凌晨正式發布Kimi K3。公司有關負責人對21世紀經濟報道記者表示:“參數越大,能力上限越高,可以提供更智能的模型表現。參數就像人腦里的神經連接,近3萬億參數意味著這個模型能把更多的知識和規律裝進‘腦子’,懂得更多、想得更深、答得更準。”
2.8萬億參數,全球評測排名靠前,輸出定價為100元/百萬tokens。Kimi K3在性能、定價兩個維度同時向海外頭部模型看齊。Artificial Analysis智能指數57分,僅次于Claude Fable 5和GPT-5.6 Sol。在Code Arena前端開發測試中以76%勝率登頂。在DeepSWE長程開發測試中任務完成率67.5%,排名第三。
中信建投將此定義為“另一個DeepSeek時刻”,稱中國大模型第一次以競爭威脅身份進入全球敘事。
而從芯片適配到編譯器開發,從EDA工具驗證到開源社區貢獻,K3的運行有望打通國產軟硬件生態的全鏈路。
在資本端,據市場消息,月之暗面已啟動港股IPO籌備,目標估值300億美元。其ARR(年度經常性收入?)從4月的2億美元增長至6月的3億美元,為這一估值提供了商業化支撐。
高定價與支撐邏輯
Kimi K3的API定價自發布起便引發行業熱議。
依據月之暗面開放平臺官方公示標準,K3輸入定價為20元/百萬tokens(緩存未命中)、2元/百萬tokens(緩存命中),輸出定價為100元/百萬tokens。橫向對比來看,K3的輸出價格遠超DeepSeekV4-Pro、小米MiMoV2、智譜GLM-5.2以及Qwen3.7-Max。
市場最初擔憂高價會導致用戶流失,但摩根士丹利研報并未將高定價視作競爭短板,反而將其定性為國內大模型行業“定價回歸”的標志性正面信號,分析師Gary Yu、Lydia Lin給出三個維度的完整產業判斷:
第一,全球競爭維度,K3證明中國大模型在模型規模、綜合性能、API定價三個維度實現對美國頭部廠商的全面追趕。海外市場長期將國產模型等同于低端平價替代品,而K3性能躋身全球Tier1、定價對標海外旗艦,打破固有市場偏見,標志著全球AI產業從單一美國主導進入中美雙線競爭階段。
第二,產業格局維度,K3高端定價能夠終結國內行業長期無序低價內卷。過去兩年多數國產模型依靠低價換取流量,企業長期虧損、持續研發投入受限;K3率先錨定海外閉源模型價格帶,將打開全行業盈利空間,推動賽道從燒錢換量轉向“性能變現、反哺研發”的正向循環。
第三,技術周期維度,K3是當前全球規模最大的開源權重大模型,印證AI規模縮放定律(Scaling Law)依然成立。市場愿意為2.8萬億超大參數稀疏模型支付高端定價,代表行業認可超大MoE架構在長文本、智能體、復雜代碼場景下的能力溢價;同時高定價帶來穩定正向現金流,支撐企業持續投入芯片、編譯器、推理框架等底層基礎設施研發。
與此同時,月之暗面這套高定價體系背后有三層支撐邏輯。
第一層支撐源于自研推理架構帶來的真實成本攤薄。月之暗面官方披露,依托Mooncake分離式推理架構,K3在編程高頻場景下緩存命中率超90%,企業用戶實際輸入成本僅為未緩存標準標價的四分之一,高頻商用場景綜合付費成本將顯著低于紙面定價。Artificial Analysis測算數據顯示,K3單任務平均調用成本約0.94美元,與GPT-5.6 Sol(1.04美元)基本持平,僅為Claude Opus 4.8(1.80美元)的一半。
第二層支撐來自專項測評中的性能溢價驗證。在第三方Super CLUE中文智能體編程專項測評中,Kimi-K3(max)取得75.79分,領先第二名GLM-5.2(max)(64.13分)11.66分,是全場唯一突破70分的參評模型。盡管單token標價更高,但完成同等編程任務,K3總token消耗僅82萬,不足GLM-5.2的172萬的一半,折算后單題實測平均調用成本3.64元,低于GLM-5.2的4.35元;測評同時標注,K3單題推理耗時1222.89秒,受上線初期服務器高負載、任務排隊限流影響,不代表模型原生推理速度。
第三層支撐來自全行業定價中樞持續上移的長期趨勢。2026年國內頭部大模型API報價普遍上調,國產大模型行業已經告別早期低價獲客階段,轉向以模型綜合能力為核心錨點的理性定價周期;一個賽道從單純價格內卷到高端定價獲得市場認可,本身就是商業化邏輯跑通的核心信號。
打通國產AI價值鏈條
Kimi K3發布僅兩天,7月19日,月之暗面對外宣布暫停C端新用戶付費訂閱,現有算力資源全部優先保障存量會員服務體驗,同時啟動服務器擴容工作。
公告發布的核心背景是K3上線48小時內用戶調用請求量指數級增長,整體負載逼近現有GPU集群承載上限,推理排隊、響應延遲問題凸顯。
第三方Super CLUE測評標注,K3單題平均推理耗時偏長,受服務器高負載、任務排隊限流影響,無法完全代表模型原生推理速度。
算力緊張不難理解。K3整套架構對底層基礎設施存在特殊硬性部署門檻:模型基于自研KDA(Kimi Delta Attention)混合線性注意力、注意力殘差(Attention Residuals)技術搭建,采用Stable LatentMoE稀疏框架,單輪推理從896個獨立專家模塊中僅激活16個。稀疏架構大幅提升參數利用效率,但專家路由、多卡并行調度的工程復雜度同步提升。
月之暗面明確,穩定跑通完整K3模型、支撐百萬tokens長文本與多智能體并行任務,至少需要64顆加速卡組成supernode集群,依托高速互聯網絡發揮集群算力優勢。
更深層的算力矛盾集中在訓練、推理、生態三重需求的疊加之上。模型從SFT監督微調階段即落地量化感知訓練方案,搭配MXFP4權重、MXFP8激活量化,適配國產、海外多元硬件平臺;為解決大規模專家并行負載失衡問題,團隊自研全均衡專家并行訓練方案。上述全部底層技術優化落地,需要AI加速芯片、高速互聯網絡、集群調度系統三方深度協同。
有頭部券商分析師告訴記者,算力供給承壓的另一面,是國產AI產業鏈底層軟硬件環節取得實質性自主突破。此番激增的推理、長文本與多智能體并行處理新需求,意味著必須依托整條國產軟硬件生態協同分擔負載、優化運行效率。
在多位業內人士看來,一款參數量足夠大、使用量足夠多的開源模型,足以讓從編譯器、框架、云廠商到安全合規服務商的一整條國產工具鏈同步獲得一個商業化的窗口期。
月之暗面發布K3的同時,也披露多項運行成果:在GPU Kernel優化競賽中,團隊獨立完成國產GPU平臺下KDA算子全流程適配優化;芯片設計驗證環節,依托開源EDA工具、Nangate 45nm工藝庫,自主完成一款專用推理芯片的架構設計、時序優化與功能驗證。該芯片面積4mm2,集成146萬個標準單元,搭載融合反量化INT4 MAC陣列,在100MHz頻率下完成時序收斂,仿真解碼吞吐穩定超過每秒8700個tokens。
上述細節的核心產業價值在于,K3不僅是單純消耗算力資源的大模型,同時具備反向迭代算力基礎設施的自舉能力:技術團隊基于MLIR開發輕量化類Triton編譯器Mini Triton,向vLLM全球開源社區完整貢獻KDA算子實現方案,同時自主設計適配輕量化Kimi Nano版本的專用推理芯片。
“模型反向優化自身運行效率”的技術循環,標志著國產AI產業鏈正在擺脫過去單向依附海外芯片、工具鏈的局面,進入模型、芯片、編譯器雙向技術賦能的新階段。
港股IPO臨門一腳
拋開K3技術與商業化敘事,月之暗面資本化節奏顯著提速。
據媒體報道,公司已向全體投資者同步通報上市規劃,籌備最快六個月內在香港交易所完成IPO掛牌;多名知情人士確認,企業已向全部股東下發上市決議草案,征集港股上市投票支持,同步與高盛、中金公司推進保薦前期洽談,并行開展境外VIE紅籌架構拆除工作。
本輪上市對應的目標投后估值為300億美元,成立僅三年的月之暗面在半年內實現了估值的跨越式抬升。
據公開信息,月之暗面于2025年12月完成C輪融資,投后估值43億美元;2026年5月落地美團龍珠領投的20億美元D輪融資,投后估值升至200億美元;2026年6月啟動新一輪20億美元私募募資,目標完成后投后估值觸及300億美元。
其投資方覆蓋多元主體,包含紅杉、真格等早期財務VC/PE,阿里、騰訊、美團等互聯網產業巨頭,以及中國移動、國智投、順禧基金等具備國家隊背景的戰略資本。
支撐估值大幅抬升的核心商業化指標為ARR(年度經常性收入)。內部經營數據顯示,月之暗面2026年4月ARR突破2億美元,6月增長至3億美元,僅兩個月收入增幅達50%。
當2.8萬億參數稀疏大模型向全球開源,100萬tokens超長上下文支撐深度編程與復雜知識工程,國產GPU、開源EDA工具納入模型全鏈路驗證體系時,國產AI產業鏈“全鏈路打通”便成為可量化、可落地的工程事實。
SFC
出品丨21財經客戶端21世紀經濟報道
編輯丨劉雪瑩
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.