SpaceXAI正式發(fā)布了Grok 4.5,這是他們收購cursor之后首次發(fā)布模型。
SpaceXAI是這樣描述的:這是他們第一個專門為coding和agents訓練的模型,和Cursor一起訓練,已經(jīng)進入Grok Build、Cursor全部計劃和 SpaceXAI console。價格也擺在同一張桌面上:每百萬input token 2美元,每百萬output token 6美元。
Grok 4.5面向普通用戶更全面開放。馬斯克在X上煽風,說它是Opus-class model,但更快、更省token、成本更低。
![]()
這就有點意思了。硅谷模型發(fā)布過去最愛講的,是前沿能力、智能涌現(xiàn)、推理突破、安全邊界。Grok 4.5這一輪最像的反而不是傳統(tǒng)硅谷發(fā)布會,而是過去一年國內(nèi)模型廠最熟的那套打法:別先問誰是世界第一,看價格說話。
![]()
所謂核心機密,不是低價。
真正要緊的是性價比:一次調(diào)用多少錢,緩存命中多少錢,接進工作流以后誰來買單。
壞,GLM和MiniMax們的致富密碼,讓老馬學去了。
便宜不是低端,是入口
中國模型廠過去一年最常被討論的一件事,就是賣便宜token。
DeepSeek、阿里、百度、字節(jié)、騰訊們一輪輪把價格打下來,外界很容易把它理解成低端競爭:你沒有最強模型,所以只能靠便宜搶調(diào)用量。AI的低頻用戶的人確實愛這樣描述,畢竟他們自己不用花錢。
如果模型只是chatbot,便宜確實不夠性感。用戶一個月付20美元,如果只是聊聊天當陪玩,確實也沒啥用。
但coding agent不是這么賣的。
它進IDE,進terminal。每一次調(diào)用背后可能是一個bug、一次review、一次失敗重跑,再加上loop,再便宜的單價都會讓人肉疼。所以說,沒有最便宜,只有更便宜。
既然這個前提確定了,token價格就不是“便宜”兩個字,而是入口,是真的讓普通人能用起來的可能性。
SpaceXAI官方頁很會刺激開發(fā)者神經(jīng)。它在SWE-Bench Pro任務上給了一個token efficiency對比:Grok 4.5平均輸出15,954 tokens,對照的Opus 4.8 max是67,020 tokens,少4.2倍。這個數(shù)當然來自 SpaceXAI自己發(fā)布,不能當?shù)谌浇K審;但它很準確地暴露了這次發(fā)布想讓市場記住什么。
![]()
圖 2:Grok 4.5官方頁把token efficiency放到前臺。
是agent這個商業(yè)形態(tài),把中美模型廠都趕到了同一張價格表前。中國廠只是被價格戰(zhàn)提前訓練過,老馬這次把這套語言講成了一個硅谷故事。
OpenAI也掀桌了
同一天,OpenAI做了一件看上去很技術(shù)、其實很商業(yè)的事:它公開審計 SWE-Bench Pro。
先解釋下:SWE-Bench Pro是coding agent的考試題庫,包含的主要考題更接近真實工程場景的活:給模型一個代碼倉庫、一個issue或bug描述,讓它像工程師一樣改代碼,再用測試驗證到底有沒有修好。模型廠說自己的agent會寫代碼、會修bug、能替工程師干活,很多時候就需要這類榜單來證明。
不過這次有點打臉,OpenAI以前說過,老考卷SWE-Bench Verified已經(jīng)不好用了,大家應該改用新考卷SWE-Bench Pro。結(jié)果現(xiàn)在,它發(fā)現(xiàn)新考卷里也有大約三成題目有問題。
OpenAI給出一組數(shù)據(jù):在731道公開題里,frontier models的通過率8個月里從23.3%漲到80.3%;自動審查確認200個broken tasks,占 27.4%;人工標注認為249個任務有問題,占34.1%。
這些技術(shù)細節(jié)不用記太多。所謂“撤回建議”,意思很簡單:OpenAI 不再建議大家把SWE-Bench Pro當成可靠標準答案了。
其實核心指向點就一個,OpenAI開始質(zhì)疑標準,他們認為現(xiàn)在得測評不能代表真實得產(chǎn)出,延伸一步來看,就是現(xiàn)有得測評不能真實反映模型是否經(jīng)濟。
OpenAI有Codex,Anthropic有Claude Code,SpaceXAI有Grok Build和Cursor入口。現(xiàn)在已經(jīng)不完全是toke單價的競爭時代了,模型大廠們開始考慮以解決項目的能力作為賣點,直接影響企業(yè)采購、開發(fā)者心智和模型廠定價。
![]()
這是更深一層的戰(zhàn)場:當benchmark不再可靠,企業(yè)會把信任從“榜單分數(shù)”搬到“真實工作流驗證”。
誰能在真實repo里改bug,誰能接入權(quán)限系統(tǒng),誰能解釋失敗重跑,誰能把一次agent任務拆成可審計的成本,誰就更有資格說自己的模型能干活。
這里剛好接上“賣token”的主線。
舊benchmark信不過了,企業(yè)不會因此停止采購agent。它們會換一種問法:別告訴我你榜單第幾,先讓我看一個真實任務,跑完到底化了多少錢。
這正是中國模型廠最熟的場景。因為賣token從來不只是賣一串數(shù)字,它賣的是可比較、可計費、可復現(xiàn)的工作單位。OpenAI審計SWE-Bench Pro,看起來是在清理評測噪音;放在Grok 4.5發(fā)布當天,它也客觀上把“真實工作流+價格驗證”推到了前臺。
但OpenAI自己承認約30% 任務有問題,已經(jīng)把彈藥遞到了他手里。
老馬最擅長的,不是把復雜機構(gòu)語言講完整,而是把它壓成X上一句能傳播的話。他不需要成為評測裁判,他只要不斷提醒開發(fā)者:裁判也會出錯,真實任務才算數(shù)。
![]()
圖 4:OpenAI官網(wǎng)審計頁。它清理的是評測噪音,牽動的是coding a
IDE變成新的收銀臺
最總一切都關(guān)乎于計費,所以agent時代真正的計費模式不在命中緩存,也不在每百萬token價格,而是在IDE里。
開發(fā)者每天睜眼打開Cursor,切terminal,刷GitHub,看CI面板到底是綠燈還是紅燈。過去模型廠爭的是網(wǎng)頁入口,后來爭手機App,再后來爭 API。coding agent出現(xiàn)以后,入口往前挪了一步,挪到了代碼被寫出來的地方。
Cursor的定價頁很直白:個人版每月20美元,Teams每用戶每月 40 美元,功能寫著Agent requests、frontier models、MCPs、skills、hooks、cloud agents、Bugbot usage-based billing、usage analytics。他正在把模型調(diào)用、agent能力、團隊權(quán)限和使用統(tǒng)計打包成一個開發(fā)組織的賬單中心。
Claude Code也在做同一件事,只是語氣更像企業(yè)軟件。Anthropic的成本文檔不講“革命”,它告訴你怎么追蹤token使用、怎么設spend limits,還給出企業(yè)用戶平均約13美元/developer/active day、150-250 美元/developer/month的參考區(qū)間,90%用戶低于30美元/active day。
OpenAI的Codex論文則給了使用形態(tài)的另一面:2026年上半年Codex 活躍用戶增長超過5倍,超過10%用戶每周會管理3個以上并發(fā)agents,skills使用率到6月升到26.6%。
綜合起來看,計費模式就很明確了。
Cursor證明入口在哪里;Claude Code證明賬單怎么管;Codex證明agent正在從單次問答,變成并發(fā)任務隊列。
Grok 4.5要搶的是Cursor里的默認模型、Grok Build里的agent工作流、開發(fā)團隊的token預算,以及X時間線上“什么才算真的能干活”的解釋權(quán)。
這也是為什么“成本”突然變鋒利。
如果模型還停在聊天框里,成本只是廠商毛利問題。用戶不太關(guān)心你推理一次燒多少錢,只關(guān)心回答是不是像人。可一旦模型進入IDE,成本就變成產(chǎn)品體驗的一部分。上下文長不長、吞吐快不快、失敗重跑貴不貴、團隊用量能不能管,都會變成開發(fā)者每天能摸到的阻力。
便宜當然不是免死金牌。
agent改壞一次生產(chǎn)庫,省下的token錢不夠賠一次事故復盤。X上轉(zhuǎn)得再歡,企業(yè)也不敢只靠這個買單。真正能讓開發(fā)團隊留下來的,是穩(wěn)定性、權(quán)限、安全、上下文管理和可控失敗。
所以Grok 4.5這張牌也有風險。
首先,SpaceXAI官方token efficiency數(shù)據(jù)還需要更多第三方復現(xiàn)。其次,Cursor 入口不等于長期默認,開發(fā)者會在真實任務里用腳投票。OpenAI、Anthropic、Google不會把IDE賬單中心拱手讓人,它們只會更快把cost-per-task、workspace integration和eval governance 寫進產(chǎn)品敘事。
但這反而說明,競爭的本質(zhì)已經(jīng)變了。
以前模型廠爭的是“誰更聰明”。現(xiàn)在它們開始爭三個更具體的東西:誰定義能干活,誰占住工作入口,誰收走每一次任務調(diào)用的錢。
評測權(quán)、入口權(quán)、計費權(quán),正在變成同一個戰(zhàn)場。
Agent正在告訴所有人,AI是新時代的工位。
一次bug fix,一次PR review,一次CI修復,一次文檔生成,一次失敗重跑。每個單位都要被驗證、被計費、被歸因。
接下來1-3個月,真正該看的也不是哪家又刷了一個榜單。而是看誰家的token和agent配合的更加經(jīng)濟。
老馬未必學了中國。
但這一次,他確實把中國模型廠最早承認的現(xiàn)實,講成了一個硅谷故事。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.