![]()
能力上限高,但體驗(yàn)還沒完全跟上。
AIX財(cái)經(jīng)(AIXcaijing)原創(chuàng)
作者 | 雷晶
編輯 | 金玙璠
月之暗面最近動(dòng)作不斷。7月16日晚上,先悄悄上線了新模型Kimi K3,幾小時(shí)后才在公眾號(hào)正式發(fā)布公告。
但是吧,它藏得也不夠嚴(yán)實(shí)。最近,代號(hào)為“Kivine”的匿名模型出現(xiàn)在了大模型競(jìng)技場(chǎng)榜單Arena上,被開發(fā)者們猜測(cè)為Kimi K3。它在前端生成和3D任務(wù)上的表現(xiàn)引發(fā)了密集討論,甚至頻頻被用來與Anthropic的Fable 5、OpenAI的GPT-5.6 Sol對(duì)比。此外,Kimi開放平臺(tái)上一個(gè)關(guān)于Kimi K3上線限時(shí)充值活動(dòng)的頁面被短暫泄露,雖然幾小時(shí)后被撤下,但截圖已被廣泛傳播,Kimi K3的熱度在發(fā)布前就已經(jīng)拉滿。
我們照例先來看一下參數(shù)。Kimi K3擁有2.8萬億參數(shù)、原生視覺理解能力、100萬Token上下文窗口。不過,實(shí)際可用的上下文長度受會(huì)員等級(jí)限制,最低檔位會(huì)員Andante (49元/月)不支持調(diào)用,第二檔位的會(huì)員Moderato(99元/月)僅支持256K,第三檔位的會(huì)員Allegretto(199元/月)及以上等級(jí)才支持完整的1M上下文。
官方稱其是全球首個(gè)開源的3萬億級(jí)別模型,面向長程編程、知識(shí)工作和推理等前沿智能場(chǎng)景而設(shè)計(jì)。這次的官方發(fā)布中甚至連官方品牌宣傳視頻都是Kimi K3自己剪輯的,它在56段原始素材里完成選片、卡點(diǎn)、動(dòng)作匹配和音頻處理。月之暗面用這種方式傳遞了一個(gè)信號(hào),它能做出完整的、讓人滿意的復(fù)雜作品。
![]()
![]()
![]()
圖源 / Kimi官方推文
官方給出的成績單涵蓋編碼、通用Agent和視覺Agent三大板塊,整體看下來,Kimi K3排名穩(wěn)定在第三,個(gè)別維度甚至登頂。
除了官方給出的數(shù)據(jù),在Arena凌晨更新的Code Arena榜單上,Kimi K3以1679的分?jǐn)?shù)排在全球第一,超過了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。Arena的榜單結(jié)果是來自用戶的公開盲測(cè),投票結(jié)束才會(huì)看到模型身份。Code Arena考察的主要是前端編程能力,這樣來看,在這一場(chǎng)景里,Kimi K3的能力得到了驗(yàn)證。
目前Kimi K3已上線Kimi網(wǎng)頁端、App、Kimi Work桌面端、Kimi Code和 API,默認(rèn)思考強(qiáng)度拉到了max,low和high兩種模式在后續(xù)更新中增加。API價(jià)格也值得關(guān)注,輸入每百萬Token20元,輸出100元。換算下來,GPT-5.6 Sol的價(jià)格是輸入5美元、輸出30美元,F(xiàn)able 5更貴,輸入10美元、輸出50美元,而Kimi K3的輸出單價(jià)折合不到14美元,價(jià)格還便宜。不過,“便宜”是相對(duì)海外旗艦而言,對(duì)比自家上一代K2.6,K3的API輸入價(jià)格實(shí)際漲了3倍多,輸出價(jià)格漲了近4倍。
月之暗面在官方博文里坦誠地寫了三個(gè)局限:Kimi K3對(duì)歷史思考內(nèi)容敏感,中途切換模型可能導(dǎo)致輸出質(zhì)量明顯下降;訓(xùn)練偏向長程高難任務(wù),面對(duì)簡單的日常問題時(shí)容易替代用戶做決定;與Fable 5和GPT-5.6 Sol相比,在用戶體驗(yàn)上仍有差距。
那么,被用來和海外最強(qiáng)旗艦?zāi)P蛯?duì)比的Kimi K3,實(shí)際表現(xiàn)到底怎么樣?
01.Kimi K3實(shí)測(cè):3D驚艷,速度拖后腿
Kimi K3正式上線不到24小時(shí),X上的實(shí)測(cè)已經(jīng)密集到可以按場(chǎng)景分類了。翻一圈下來,出現(xiàn)頻率最高的測(cè)試方向有三個(gè):3D交互生成、前端編程能力和視覺設(shè)計(jì)。綜合各方測(cè)試來看,開發(fā)者們對(duì)Kimi K3的評(píng)價(jià)大多集中在這幾個(gè)方面:3D和視覺生成能力最突出、前端UI的設(shè)計(jì)水準(zhǔn)接近Fable 5、編碼能力強(qiáng)但還沒有超過最強(qiáng)閉源模型、速度是最大的短板。
還有網(wǎng)友指出Kimi K3在基準(zhǔn)測(cè)試上全面超過了Opus 4.8,而Opus 4.8發(fā)布于5月28日,距今不到兩個(gè)月。即便還不能說追平了最頭部的閉源模型,國產(chǎn)開源與海外旗艦的差距,至少已經(jīng)大幅壓縮了。
具體看幾個(gè)熱度較高的測(cè)試。
科技博主Chris在模型正式發(fā)布前就拿到了Kimi K3的匿名測(cè)試版本,讓Kimi K3和GPT?5.6 Sol(extra high)分別做一個(gè)體素死星壕溝飛行進(jìn)行對(duì)比,他表示GPT-5.6在光照和特效方面更好,但Kimi K3的畫面更流暢。模型正式發(fā)布后,他又用Kimi K3構(gòu)建了一個(gè)CS:GO×Portal克隆游戲,三輪對(duì)話、花費(fèi)約60萬Token,按API定價(jià)算下來只花了3.24美元,并配文“免費(fèi)獨(dú)立游戲開發(fā)的時(shí)代比你想象的還要近”。
![]()
有網(wǎng)友用櫻花盆景測(cè)試Kimi K3的SVG視覺生成能力,發(fā)現(xiàn)Kimi K3在樹干扭曲、分層樹冠等細(xì)節(jié)上甚至比Fable 5更貼合要求。也有人測(cè)試了水流效果的生成,稱Kimi K3能模擬出逼真的水波紋,保持物理上的連貫性。
![]()
當(dāng)然,推特上的測(cè)試終歸是千人千面。模型好不好用,還是得自己上手。
我們先從最常規(guī)的場(chǎng)景開始。讓Kimi K3制作一份咨詢報(bào)告風(fēng)格的端側(cè)AI行業(yè)研究,要求包含時(shí)間線、樹狀圖、瀑布圖等呈現(xiàn)形式。對(duì)AI來說,算是比較基礎(chǔ)的測(cè)試。
整體色彩搭配協(xié)調(diào),視覺完成度較高。從實(shí)際結(jié)果來看,這份報(bào)告的完成度較高,脈絡(luò)、產(chǎn)業(yè)鏈、市場(chǎng)規(guī)模等章節(jié)層層推進(jìn),沒有出現(xiàn)前后章節(jié)自說自話的割裂感,信息密度也比較到位。不過,數(shù)據(jù)引用比較單一,基本只用了智次方研究院和集微半導(dǎo)體大會(huì)報(bào)告,缺乏多來源數(shù)據(jù)的交叉驗(yàn)證。
這只是前菜,接下來看看幾個(gè)最受關(guān)注的功能。
先看3D交互生成。我們先讓它用Three.js生成一個(gè)可探索的微型城市,要有高低錯(cuò)落的建筑、街道、樹木、一條穿城而過的小河,同時(shí)需要一個(gè)晝夜循環(huán)系統(tǒng)。
![]()
Kimi K3生成的微型世界
提示詞里要求的元素都沒有落下,畫面、配色和諧,能看出在設(shè)計(jì)上花了心思。但細(xì)節(jié)不夠到位,會(huì)出現(xiàn)樹和路燈擋在路中間的情況。
再來看看前端編程能力。我們給了它一個(gè)GitHub上開源的考察前端編程能力的復(fù)雜題目。這道題目要實(shí)現(xiàn)化學(xué)實(shí)驗(yàn)的交互演示,主要考察數(shù)學(xué)計(jì)算、計(jì)算幾何能力和物理空間建模等能力。
![]()
Kimi K3生成的化學(xué)實(shí)驗(yàn)交互演示
Kimi K3交出來的成品有亮點(diǎn)也有瑕疵。先說做得好的部分,泡沫從瓶口涌出的過程很自然,噴射、擴(kuò)散的節(jié)奏符合化學(xué)反應(yīng)的表現(xiàn),且噴射出來的粒子能看出泡沫的質(zhì)感。但有一個(gè)遺漏,瓶身不透明,看不到瓶內(nèi)的液體,說明它在處理容器液面渲染時(shí)做了簡化處理。
接著,看視覺設(shè)計(jì)。我們讓它構(gòu)建一個(gè)莫奈《睡蓮》風(fēng)格的沉浸式全景世界。
![]()
Kimi K3生成的《睡蓮》風(fēng)格全景世界
Kimi K3的成品在視覺表現(xiàn)上確實(shí)有亮點(diǎn)。整體的設(shè)計(jì)符合莫奈《睡蓮》的風(fēng)格,可以選擇場(chǎng)景、船速、天色等,不過在船經(jīng)過睡蓮時(shí)會(huì)出現(xiàn)蓮花穿過船的錯(cuò)位現(xiàn)象,物理渲染有瑕疵。
最后,看看官方提到的視頻剪輯功能。
我們給了它2026世界人工智能大會(huì)的官方宣傳視頻、官方海報(bào)和大會(huì)的議程推文,讓它基于此做一個(gè)30秒的宣傳視頻。它處理得比較仔細(xì),合成視頻后并沒有直接交付,還會(huì)自己進(jìn)行質(zhì)檢,發(fā)現(xiàn)問題后再修正,最終花了近兩個(gè)小時(shí)才完成。
成片整體達(dá)到了宣傳片應(yīng)有的樣子,它還配了背景音樂和口播旁白,不過口播聲音較小,不太能聽清。考慮到它生成視頻的速度確實(shí)很慢,如果是比較簡單的視頻,自己動(dòng)手可能速度更快,如果手頭有大量素材、需要一個(gè)能自主完成選片和粗剪的助手,可以讓它來試試。
幾輪測(cè)下來,Kimi K3在視覺審美和3D生成方面確實(shí)有優(yōu)勢(shì),但速度始終是繞不過去的問題。同一場(chǎng)景生成時(shí)間約為GPT-5.6 Sol的兩到三倍,瀑布場(chǎng)景近半小時(shí),視頻剪輯近兩小時(shí)。綜合來看,Kimi K3在“審美直覺”上有明顯優(yōu)勢(shì),但在“工程可靠性”和“速度”上仍有明顯短板。
關(guān)于Kimi K3生成速度慢的原因,官方未作說明。可能的因素包括:2.8萬億參數(shù)的推理計(jì)算量大、max檔位默認(rèn)開啟深度思考、推理基礎(chǔ)設(shè)施尚未充分?jǐn)U容等。隨著后續(xù)開放low和high檔位,速度問題可能會(huì)有所改善。整體而言,K3給人的感覺是一個(gè)能力上限高,但體驗(yàn)還沒完全跟上的選手。
02.Kimi K3 vs GPT-5.6 Sol:Sol贏在可靠,K3贏在審美
單獨(dú)體驗(yàn)完Kimi K3之后,自然會(huì)想,它到底能不能打得過對(duì)標(biāo)的海外頭部選手呢?我們就拿上周剛?cè)堪l(fā)布的GPT-5.6 Sol來對(duì)比,選了三個(gè)場(chǎng)景,用同一套提示詞分別喂給兩個(gè)模型,看看誰更經(jīng)得起實(shí)戰(zhàn)。
場(chǎng)景一:3D迷宮游戲
我們讓它們生成一個(gè)第一人稱的3D迷宮游戲,讓玩家用WASD和鼠標(biāo)控制,角落需要配置小地圖顯示已探索區(qū)域,用閃爍火炬照明,60秒倒計(jì)時(shí),到達(dá)出口顯示勝利畫面。
這套提示詞里包含了好幾個(gè)獨(dú)立的功能需求,考驗(yàn)的是模型把算法、3D渲染、交互邏輯和視覺效果一次性協(xié)調(diào)到位的綜合能力。
GPT-5.6 Sol干活非常快。Kimi還在加載的時(shí)候,Sol這邊已經(jīng)能開始玩了;我們?cè)赟ol上跑了好幾輪,Kimi K3才把游戲交出來。
回到游戲本身,Sol生成的畫面風(fēng)格偏寫實(shí)常規(guī),火炬和墻面中規(guī)中矩,更像一個(gè)不會(huì)出錯(cuò)的合格成品。
![]()
GPT-5.6 Sol生成的迷宮游戲
再看Kimi K3,速度是最明顯的短板,生成時(shí)間接近Sol的兩到三倍。不過Kimi K3交付的成果整體視覺帶有像素風(fēng),火炬、墻面紋理都更有設(shè)計(jì)感,光線更暗,可玩性更高。
![]()
Kimi K3生成的迷宮游戲
這個(gè)場(chǎng)景的差異主要在于速度和審美。GPT-5.6 Sol快、穩(wěn),是需要快速得到一個(gè)可用成品時(shí)的首選;Kimi K3雖慢,但出來的東西更有辨識(shí)度。愿意多等一會(huì)、對(duì)視覺有要求,Kimi K3值得一試。
場(chǎng)景二:杯子倒水物理仿真模型
接下來這道題來自GitHub上開源的復(fù)合型工程化編程測(cè)試,要求實(shí)現(xiàn)杯子裝水和倒水的物理仿真,綜合考察數(shù)學(xué)建模、物理直覺、圖形學(xué)處理和邊緣情況處理。
GPT-5.6 Sol交了一份合格的答案。裝水時(shí)水粒子老老實(shí)實(shí)待在杯子里,沒有穿模泄漏;倒水時(shí)水從杯口流出,符合物理規(guī)律。
![]()
GPT-5.6 Sol生成的杯子倒水仿真模型
Kimi K3在這道題上“翻車”了。第一次生成存在兩個(gè)硬傷:一是裝水時(shí),水粒子穿透杯壁漏出去了;二是倒水時(shí),水從杯底流出。經(jīng)提醒之后Kimi K3做出了改正,但改得也很慢,最終結(jié)果符合要求。
![]()
Kimi K3生成的杯子倒水仿真模型
這個(gè)場(chǎng)景GPT-5.6 Sol獲勝。值得注意的是,官方在K3的介紹中特別強(qiáng)調(diào)了視覺理解與空間推理的結(jié)合提升,但至少在這道題上,它的物理仿真還沒做到一次到位。
場(chǎng)景三:3D交互視覺設(shè)計(jì)
最后看視覺設(shè)計(jì),這道題同樣來自GitHub上的開源題目。我們讓它用Three.js創(chuàng)建一個(gè)尼亞加拉大瀑布全景。這道題主要檢驗(yàn)視覺審美能力和工程能力。
GPT-5.6 Sol在功能完整性上一如既往地穩(wěn),連按鈕命名都忠實(shí)還原了提示詞的措辭。但問題在于,它有點(diǎn)“敷衍”。在這個(gè)考題中,水應(yīng)該是最出彩的主角,提示詞要的是玻璃質(zhì)感的綠水、帶透光的白色水幕,拿到手的是一大片白色粒子糊在懸崖面上,不夠有美感。此外,彩虹這一提示詞里提到的元素,也沒有出現(xiàn)。
![]()
GPT-5.6 Sol生成的瀑布全景
Kimi K3這邊更用心。畫面整體更精美,GPT-5.6 Sol缺失的彩虹它沒有落下。在水的渲染上,Kimi K3處理得更自然,更接近真實(shí)瀑布水汽氤氳的視覺體驗(yàn)。當(dāng)然,Kimi K3生成的速度依舊很慢,花了近半小時(shí)才做好。
![]()
Kimi K3生成的瀑布全景
三輪測(cè)試的結(jié)論可以總結(jié)為:要又快又穩(wěn)的成品選Sol,但弱項(xiàng)在于審美,更傾向于“完成需求”;要視覺上有辨識(shí)度的成品選K3,但速度和一次性準(zhǔn)確率是硬傷,K3需要你付出兩到三倍的時(shí)間成本。
03.結(jié)語
看完實(shí)測(cè),我們把視角轉(zhuǎn)向Kimi K3背后的公司月之暗面。
2025年12月,月之暗面完成C輪融資5億美元,由IDG領(lǐng)投,阿里、騰訊等老股東超額認(rèn)購,投后估值43億美元。今年5月,完成約20億美元融資,投后估值突破200億美元;6月底,又啟動(dòng)新一輪融資,投前估值已升至315億美元。
支撐估值增長的除了模型能力,還有收入增速。3月,Kimi的ARR(年度經(jīng)常性收入)突破1億美元,6月中旬達(dá)到3億美元,三個(gè)月增至3倍。這輪增長還是在API持續(xù)調(diào)價(jià)的情況下實(shí)現(xiàn)的。此前K2到K2.7 Code漲價(jià)約60%,ARR仍保持增長;但K3相比K2.6漲幅更為激進(jìn),這一價(jià)格水平下的市場(chǎng)接受度尚待觀察。
![]()
圖源 / Kimi官方推文
目前,API貢獻(xiàn)了Kimi總收入的七成以上,海外API收入也已超過國內(nèi)。API是Kimi收入的基本盤,訂閱數(shù)據(jù)則補(bǔ)充證明了其海外個(gè)人用戶的付費(fèi)意愿。根據(jù)Stripe的數(shù)據(jù),Kimi個(gè)人訂閱用戶1月支付訂單數(shù)環(huán)比增長8280%,2月環(huán)比再漲123.8%,進(jìn)入Stripe全球榜單前十,成為首個(gè)闖入前十的中國AGI產(chǎn)品。
月之暗面試圖構(gòu)建這樣一套路徑:用開源模型吸引全球開發(fā)者,通過開發(fā)者工具進(jìn)入真實(shí)工作流,再將對(duì)穩(wěn)定性、速度和服務(wù)要求更高的用戶轉(zhuǎn)化為API客戶。理論上,這條路徑可以形成飛輪效應(yīng):模型能力帶來開源影響力,開源帶來開發(fā)者,開發(fā)者轉(zhuǎn)化為API收入,收入再支持訓(xùn)練和推理投入。但能否真正跑通,還需要開發(fā)者留存率、API客戶轉(zhuǎn)化率等數(shù)據(jù)來驗(yàn)證。
當(dāng)越來越多的收入來自API調(diào)用和訂閱,傳統(tǒng)軟件工具的統(tǒng)計(jì)口徑也開始失真。這也解釋了IDC市場(chǎng)份額與大模型公司ARR之間出現(xiàn)錯(cuò)位。7月16日,IDC發(fā)布了2025年中國AI編程市場(chǎng)份額報(bào)告,總規(guī)模3.99億元人民幣,阿里Qoder以47.6%的份額位居第一,超過第二到第五名總和;智譜CodeGeeX排名第二,份額11.5%。7月17日,多家媒體披露智譜的ARR已達(dá)10億美元,半年增長15倍。
這種反差說明AI編程行業(yè)的價(jià)值正在從傳統(tǒng)軟件銷售,逐漸轉(zhuǎn)向API調(diào)用和訂閱等新模式。隨著市場(chǎng)衡量標(biāo)準(zhǔn)發(fā)生變化,行業(yè)競(jìng)爭也開始進(jìn)入新的階段。
在這一背景下,月之暗面與智譜的競(jìng)爭,不再只是比市場(chǎng)份額,還要看誰能更快把高速增長轉(zhuǎn)化為可持續(xù)收入。
月之暗面目前仍處于講增長故事、兌現(xiàn)長期空間的階段,主要展示增長速度和遠(yuǎn)期空間,而已經(jīng)上市的智譜則必須持續(xù)接受收入兌現(xiàn)、成本控制和盈利路徑的檢驗(yàn)。兩家公司都證明了AI編程付費(fèi)需求遠(yuǎn)超預(yù)期,只是所處的發(fā)展階段不同,因此市場(chǎng)關(guān)注點(diǎn)也已經(jīng)發(fā)生變化。
從時(shí)間節(jié)點(diǎn)看,Kimi K3發(fā)布的節(jié)點(diǎn)很微妙。月之暗面正在籌備港股IPO,Kimi K3不只是一輪產(chǎn)品更新,也像一次上市前的能力宣示。但I(xiàn)PO最終檢驗(yàn)的不會(huì)是榜單成績,還有3億美元ARR能否持續(xù)、客戶是否留存、推理成本能否控制,以及技術(shù)優(yōu)勢(shì)能保持多久。
把時(shí)間軸拉到18個(gè)月前,當(dāng)時(shí)國產(chǎn)大模型的話題還是能不能追上GPT-4,而現(xiàn)在的對(duì)標(biāo)對(duì)象已經(jīng)變成了Claude Fable 5和GPT-5.6 Sol。Kimi K3不一定是最終追上的那個(gè)模型,但它證明了國產(chǎn)大模型已經(jīng)具備和海外巨頭掰手腕的能力。
*題圖來源于月之暗面Kimi微信服務(wù)號(hào)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.