一個普通用戶打開AI,問了一句:“幫我把這份合同里的風(fēng)險找出來。”
屏幕上幾秒鐘后出現(xiàn)答案。
用戶看到的只是一個對話框,背后卻可能是一座機房:GPU讀取模型、處理長文檔、保存上下文,再一個token一個token地生成回復(fù)。
7月16日,Kimi官方幫助中心宣布K3發(fā)布,稱其總參數(shù)達(dá)到2.8萬億,支持原生視覺和100萬token上下文,并計劃于7月27日開放完整權(quán)重。
2.8萬億是一個很容易制造震撼的數(shù)字。
但對普通人真正重要的,不是模型倉庫里一共有多少參數(shù),而是每次回答會調(diào)用多少計算、速度如何、錯誤率有沒有下降,以及這筆成本最后由誰支付。
參數(shù)可以越做越大,用戶的錢包卻不會自動變厚。
因此,K3帶來的核心問題不是“2.8萬億究竟有多大”,而是:大模型繼續(xù)擴張以后,更強能力與更高成本之間,平臺準(zhǔn)備如何分賬?
8萬億參數(shù),不等于每問一句都運行2.8萬億參數(shù)
先把三個經(jīng)常混在一起的概念拆開。
總參數(shù),可以理解為一個大型專家組織擁有的全部知識和能力模塊。
數(shù)字越大,代表模型可以容納的結(jié)構(gòu)越龐大,但不代表這些模塊每次都同時工作。
激活參數(shù),是模型處理一個token時實際參與計算的那部分參數(shù)。
如果模型采用混合專家架構(gòu),系統(tǒng)會先判斷問題屬于哪一類,再把任務(wù)送給少數(shù)合適的“專家”,而不是讓所有專家一起開會。
推理成本,則是模型真正提供一次服務(wù)需要付出的資源,包括模型計算、上下文讀取、輸出長度、緩存、并行調(diào)度、聯(lián)網(wǎng)搜索以及工具調(diào)用。
這三者有關(guān),卻不能畫等號。
一座醫(yī)院可以有幾千名醫(yī)生,這是“總規(guī)模”;一位患者看病時只會接觸其中幾位,這是“激活規(guī)模”;掛號、檢查、會診和住院產(chǎn)生的費用,才接近“服務(wù)成本”。
醫(yī)院更大可能意味著科室更全,但你看一次感冒,不會把全院醫(yī)生都叫來。
![]()
巨大的專家網(wǎng)絡(luò)中,單次請求只點亮其中一小部分路徑
Kimi官方目前披露了K3的2.8萬億總參數(shù),但其幫助頁面并未給出每個token具體激活多少參數(shù)。
因此,不能拿上一代K2公開的激活規(guī)模直接套在K3身上,也不能僅憑總參數(shù)推斷單次推理成本。
更不能把“參數(shù)變大”直接寫成“智能提高了多少倍”。
模型體驗還取決于訓(xùn)練數(shù)據(jù)、架構(gòu)、后訓(xùn)練、工具能力、推理策略和工程優(yōu)化。
一支人數(shù)龐大的團隊,如果組織混亂,未必比一支小而精的團隊完成得更好。
百萬上下文很強,但“能裝下”不等于“值得裝滿”
100萬token上下文,意味著模型可以在一次任務(wù)中接收非常長的材料。
對法律合同、代碼倉庫、研究報告和企業(yè)知識庫來說,這很有吸引力。
但上下文窗口像一張巨大的辦公桌:桌面越大,確實能鋪開更多文件;問題是把文件搬上桌、逐頁讀取、尋找關(guān)聯(lián),本身都需要時間和資源。
長上下文會帶來至少三筆賬。
第一筆是輸入token。
API通常分別計算輸入和輸出token,材料越長,輸入賬單越高。
第二筆是等待時間。
系統(tǒng)需要處理更多信息,首字出現(xiàn)可能更慢。
即使模型支持百萬上下文,服務(wù)商也要在速度、并發(fā)與成本之間取舍。
第三筆是有效信息密度。
把一百份文檔全部塞進(jìn)去,不代表模型一定能抓住最重要的那句話。
材料越多,檢索、排序、去重和提示設(shè)計反而越重要。
![]()
長上下文任務(wù)背后需要服務(wù)器、供電、冷卻與運維共同支撐
所以,百萬上下文真正適合的是“確實需要跨大量材料建立聯(lián)系”的任務(wù),而不是每次聊天都把所有歷史記錄重新發(fā)送。
對于企業(yè),合理做法往往是先檢索相關(guān)片段,再交給模型回答;對于開發(fā)者,則可以使用上下文緩存,避免重復(fù)內(nèi)容每次重新計費。
Kimi官方的API計費說明也明確提出,緩存命中的上下文可以按折扣價格計費。
大窗口提供的是能力上限,不是鼓勵所有人把窗口塞滿。
普通用戶、開發(fā)者和自建模型,付的是三種不同賬單
普通用戶面對的是訂閱賬單。
平臺不會要求每個人理解GPU、token和緩存,而是把復(fù)雜成本包裝成免費額度、月度會員、任務(wù)積分、速度優(yōu)先級與并發(fā)數(shù)量。
用戶買的不是參數(shù)所有權(quán),而是在一定規(guī)則下使用平臺算力的權(quán)利。
Kimi官方會員頁面目前列出免費檔和多個付費檔位,Agent、深度研究、文檔、表格等能力共享額度池;任務(wù)越復(fù)雜、消耗token越多,扣除的額度通常越高。
不同地區(qū)、賬戶和活動的實際價格可能不同,應(yīng)以用戶支付頁面為準(zhǔn)。
開發(fā)者面對的是API賬單。
每次請求的輸入和輸出分別計費,聯(lián)網(wǎng)搜索等工具還可能單獨收費。
開發(fā)者不僅要問“哪個模型最強”,還要算每千次調(diào)用的成本、響應(yīng)速度、失敗重試和峰值并發(fā)。
一個簡單分類任務(wù)如果也調(diào)用最高規(guī)格模型,就像每天買菜都派一輛重型卡車。
模型很強,生意卻可能不成立。
自建開源模型面對的是基礎(chǔ)設(shè)施賬單。
開放權(quán)重不等于免費運行。
即使模型文件可以下載,企業(yè)仍要準(zhǔn)備GPU、顯存、存儲、網(wǎng)絡(luò)、電力、冷卻和工程人員。
模型越大,部署門檻通常越高;如果單次請求量不夠大,自建硬件的利用率可能很低,平均成本反而高于購買API。
![]()
個人訂閱、開發(fā)者API和企業(yè)自建模型對應(yīng)三種不同的成本結(jié)構(gòu)
因此,“開源”主要降低的是許可、研究和供應(yīng)商鎖定門檻,不會消滅計算成本。
誰會為更大的模型買單?
第一種可能,是平臺先補貼。
新模型發(fā)布初期,平臺可能用免費體驗和低價額度擴大用戶規(guī)模。
用戶獲得更強能力,實際算力成本由融資、其他業(yè)務(wù)收入或未來訂閱預(yù)期承擔(dān)。
第二種可能,是高頻和專業(yè)用戶付更多。
普通聊天繼續(xù)免費或低價,深度研究、Agent、多任務(wù)并發(fā)、代碼執(zhí)行和超長上下文進(jìn)入更高會員檔。
平臺不是簡單地“每個人一起漲價”,而是把高成本任務(wù)單獨計量。
第三種可能,是開發(fā)者把成本傳給自己的客戶。
接入K3的辦公軟件、電商客服或內(nèi)容工具,可能通過提高訂閱價、限制使用次數(shù)、降低免費額度,或者把高級模型設(shè)置為付費選項回收成本。
第四種可能,是效率提升抵消成本。
如果模型能用更少重試完成任務(wù),或者一次處理過去需要人工數(shù)小時的材料,即使單次調(diào)用更貴,單位成果的總成本仍可能下降。
這才是判斷AI值不值錢的正確方式:不要只看一次調(diào)用花了多少,而要看完成一個可靠結(jié)果總共需要多少次調(diào)用、多少人工復(fù)核和多少等待時間。
更聰明與更貴,并不是一道單選題
大模型行業(yè)真正競爭的目標(biāo),不是把模型做得無限大,而是提高“每一元錢可以買到的有效智能”。
如果K3能在復(fù)雜任務(wù)中減少錯誤、提升工具執(zhí)行成功率,讓一份過去需要反復(fù)修改五次的報告一次完成,那么它可能更大,卻未必更貴。
相反,如果參數(shù)規(guī)模主要帶來排行榜和傳播效果,用戶仍要不斷糾錯、重試和核查,那么再低的token單價也可能是一筆昂貴賬單。
普通用戶可以用三個問題判斷是否值得升級。
第一,你做的是普通問答,還是長文檔、代碼、數(shù)據(jù)分析等復(fù)雜任務(wù)?簡單任務(wù)沒有必要永遠(yuǎn)調(diào)用最強模型。
第二,付費后減少的是等待時間,還是確實減少了錯誤和返工?速度更快不等于結(jié)果更可靠。
第三,你是否真正用到了長上下文、Agent和多任務(wù)并發(fā)?如果每月只問幾十個短問題,免費額度可能已經(jīng)足夠。
對開發(fā)者,則要多算兩項:把輸入材料先檢索和壓縮,能否降低token;不同難度的任務(wù)能否路由到不同模型,而不是所有請求都走最高規(guī)格。
參數(shù)競賽的下一站,是成本透明
2.8萬億參數(shù)會吸引注意力,但普通用戶最終不會為一個抽象數(shù)字長期付費。
他們會為更少的錯誤、更快的交付、更穩(wěn)定的工具調(diào)用,以及真正節(jié)省下來的工作時間付費。
模型公司也必須回答更實際的問題:一次復(fù)雜任務(wù)消耗多少額度?超長上下文如何計費?緩存能省多少?失敗任務(wù)是否退還額度?不同模型之間如何選擇?
Kimi的官方說明已經(jīng)把API輸入、輸出、搜索和緩存分開,也把會員中的任務(wù)額度與復(fù)雜程度掛鉤。
這意味著大模型商業(yè)化正在從“賣一個聊天會員”,走向更細(xì)的算力分層。
未來,最有競爭力的模型未必是參數(shù)最大的那個,而可能是最會調(diào)度參數(shù)、最能壓低單位結(jié)果成本、也最愿意把賬單解釋清楚的那個。
所以,K3會給普通用戶帶來更聰明的AI,還是更貴的算力賬單?
更準(zhǔn)確的答案是:兩者都有可能。
決定結(jié)果的不是2.8萬億這個數(shù)字,而是模型每次實際調(diào)用多少資源、平臺如何定價,以及它究竟替用戶省下了多少真實勞動。
資料說明:K3的總參數(shù)、原生視覺、百萬上下文、發(fā)布時間及完整權(quán)重開放計劃來自Kimi官方幫助中心;會員和API計費規(guī)則來自Kimi官方會員與API幫助頁面。
當(dāng)前官方概覽頁未披露K3具體激活參數(shù),本文不對此作數(shù)值推定;價格、額度和開放計劃可能隨地區(qū)及平臺政策變化,請以官方最新頁面為準(zhǔn)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.