![]()
北美感受下“外賣大戰”的恐懼,顫抖吧。
Kimi+DeepSeek+Qwen,一周之內連發三箭,這才是堪比去年的DeepSeek時刻。
前兩天的Kimi K3將大模型能力發揮到極致,打破了A/O的稀缺性。
2.8萬億參數,100萬token上下文,幾個基準局部超過頂級閉源。讓Grok總結過去幾天的用戶評論,Kimi最大的問題是慢和貴,前者說明算力供應不夠,后者說明大參數的模型還是昂貴。Artificial Analysis最新的測評圖畫得很清楚,橫軸成本、縱軸能力,Kimi確實強、也確實不便宜。
![]()
性價比的問題,還是要靠DeepSeek來解決。
于是,DeepSeek V4正式版來了。一些測評顯示,DeepSeek綜合水平接近Opus4.8級別,編碼能力直追GPT-5.6 Sol,性價比感人,“價格屠夫”再次揮動大砍刀,價格只有Fable 5 等競品的零頭。大模型最嚴厲的空頭,是把同行賣成白菜價的同行。當 DeepSeek 把前沿能力壓到一個零頭的價格,所有靠"我有最強模型"講故事的公司,估值邏輯都得重算一遍。
![]()
QWEN 3.8緊追其后,今天下午推出了開源版,參數2.4T。雖然還沒看到測評,但這時候還敢發布新模型的,必然不能太拉跨。官方說:“是當今最強大的模型之一,可與領先的前沿AI模型媲美,僅次于Fable 5”。
如果Scaling Law依然成立,中國團隊最不怕大力出奇跡。
![]()
三箭穿云箭,千軍萬馬來相見。
為明天的智譜、MiniMax股價默哀一分鐘,這也是要干翻北美大模型的節奏了。中國把大模型競爭干到了新的高度,讓北美感受下“外賣大戰”的恐懼,顫抖吧。
算力需求加速增長。
一個模型訓練成本大致取決于三個變量:參數規模、訓練Token數量、訓練輪數。Kimi 2.8T、DeepSeek V4 1.6T、Qwen 2.4T將大參數推到臺前,雖然MoE改變了參數增長和算力消耗之間的關系,但理論上,訓練計算量會顯著增加。這對于產業的信號是,進入了“更大模型、更高效率、更大規模應用”的新階段,下一代基礎模型訓練需要更大的GPU集群、更長訓練周期、更高的數據中心投入。
算力資源緊缺。
Kimi K3目前最嚴重的問題就是爆火之后,算力資源不夠,下午測試正常的回答都進行不了。Kimi算力資源主要來自阿里云,據說千問自己的算力也開始緊張,Kimi不得不轉向海外廠商采購算力。按這情況,阿里云三季度的收入增速干到50%,我都不奇怪。利好國產算力鏈。
Capex必然加速。
海外CSP的4家capex 今年7000億美元,明年超過1萬億,capex投入都奔著清空經營現金流的方向去了,國內幾家大廠的capex差遠了。如果按這個標準去算,騰訊的capex明年可以干到3000億——確實有激進的人這么預期了,畢竟大模型要卷大參數,混元3的參數只有KIMI K3的1/10,而且騰訊之前沒怎么投入,現在要補功課。阿里capex怎么也得加到2000億,字節內部已經在討論明年Capex提升到1000億美元。
這一周,Kimi、DeepSeek、Qwen三家連發,打破了北美最強模型的稀缺性,也打開了國產算力鏈的增長上限。
巨浪來襲,影響才剛剛開始。
【歡迎關注,點贊和分享:一年后你仍然會翻出來看的文章】
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.