馬斯克發布Grok 4.5,不講"智能涌現"講"性價比"——每百萬token輸入2美元、輸出6美元,token效率比Opus 4.8 max高4.2倍。硅谷現在也開始在價格上說話了,這是學的智譜和DeepSeek的經驗嗎?
———— / BEGIN / ————
SpaceXAI正式發布了Grok 4.5,這是他們收購cursor之后首次發布模型。
SpaceXAI是這樣描述的:這是他們第一個專門為coding和agents訓練的模型,和Cursor一起訓練,已經進入Grok Build、Cursor全部計劃和 SpaceXAI console。價格也擺在同一張桌面上:每百萬input token 2美元,每百萬output token 6美元。
Grok 4.5面向普通用戶更全面開放。馬斯克在X上煽風,說它是Opus-class model,但更快、更省token、成本更低。
![]()
這就有點意思了。
硅谷模型發布過去最愛講的,是前沿能力、智能涌現、推理突破、安全邊界。Grok 4.5這一輪最像的反而不是傳統硅谷發布會,而是過去一年國內模型廠最熟的那套打法:別先問誰是世界第一,看價格說話。
![]()
所謂核心機密,不是低價。
真正要緊的是性價比:一次調用多少錢,緩存命中多少錢,接進工作流以后誰來買單。
壞了,GLM和MiniMax們的致富密碼,讓老馬學去了。
便宜不是低端,是入口
中國模型廠過去一年最常被討論的一件事,就是賣便宜token。
DeepSeek、阿里、百度、字節、騰訊們一輪輪把價格打下來,外界很容易把它理解成低端競爭:你沒有最強模型,所以只能靠便宜搶調用量。AI的低頻用戶的人確實愛這樣描述,畢竟他們自己不用花錢。
如果模型只是chatbot,便宜確實不夠性感。用戶一個月付20美元,如果只是聊聊天當陪玩,確實也沒啥用。
但coding agent不是這么賣的。
它進IDE,進terminal。每一次調用背后可能是一個bug、一次review、一次失敗重跑,再加上loop,再便宜的單價都會讓人肉疼。所以說,沒有最便宜,只有更便宜。
既然這個前提確定了,token價格就不是“便宜”兩個字,而是入口,是真的讓普通人能用起來的可能性。
SpaceXAI官方頁很會刺激開發者神經。它在SWE-Bench Pro任務上給了一個token efficiency對比:Grok 4.5平均輸出15,954 tokens,對照的Opus 4.8 max是67,020 tokens,少4.2倍。這個數當然來自 SpaceXAI自己發布,不能當第三方終審;但它很準確地暴露了這次發布想讓市場記住什么。
![]()
圖2:Grok 4.5官方頁把token efficiency放到前臺。
是agent這個商業形態,把中美模型廠都趕到了同一張價格表前。中國廠只是被價格戰提前訓練過,老馬這次把這套語言講成了一個硅谷故事。
OpenAI也掀桌了
同一天,OpenAI做了一件看上去很技術、其實很商業的事:它公開審計 SWE-Bench Pro。
先解釋下:SWE-Bench Pro是coding agent的考試題庫,包含的主要考題更接近真實工程場景的活:給模型一個代碼倉庫、一個issue或bug描述,讓它像工程師一樣改代碼,再用測試驗證到底有沒有修好。模型廠說自己的agent會寫代碼、會修bug、能替工程師干活,很多時候就需要這類榜單來證明。
不過這次有點打臉,OpenAI以前說過,老考卷SWE-Bench Verified已經不好用了,大家應該改用新考卷SWE-Bench Pro。結果現在,它發現新考卷里也有大約三成題目有問題。
OpenAI給出一組數據:在731道公開題里,frontier models的通過率8個月里從23.3%漲到80.3%;自動審查確認200個broken tasks,占 27.4%;人工標注認為249個任務有問題,占34.1%。
這些技術細節不用記太多。所謂“撤回建議”,意思很簡單:OpenAI 不再建議大家把SWE-Bench Pro當成可靠標準答案了。
其實核心指向點就一個,OpenAI開始質疑標準,他們認為現在得測評不能代表真實得產出,延伸一步來看,就是現有得測評不能真實反映模型是否經濟。
OpenAI有Codex,Anthropic有Claude Code,SpaceXAI有Grok Build和Cursor入口。現在已經不完全是toke單價的競爭時代了,模型大廠們開始考慮以解決項目的能力作為賣點,直接影響企業采購、開發者心智和模型廠定價。
![]()
這是更深一層的戰場:當benchmark不再可靠,企業會把信任從“榜單分數”搬到“真實工作流驗證”。
誰能在真實repo里改bug,誰能接入權限系統,誰能解釋失敗重跑,誰能把一次agent任務拆成可審計的成本,誰就更有資格說自己的模型能干活。
這里剛好接上“賣token”的主線。
舊benchmark信不過了,企業不會因此停止采購agent。它們會換一種問法:別告訴我你榜單第幾,先讓我看一個真實任務,跑完到底化了多少錢。
這正是中國模型廠最熟的場景。因為賣token從來不只是賣一串數字,它賣的是可比較、可計費、可復現的工作單位。OpenAI審計SWE-Bench Pro,看起來是在清理評測噪音;放在Grok 4.5發布當天,它也客觀上把“真實工作流+價格驗證”推到了前臺。
但OpenAI自己承認約30% 任務有問題,已經把彈藥遞到了他手里。
老馬最擅長的,不是把復雜機構語言講完整,而是把它壓成X上一句能傳播的話。他不需要成為評測裁判,他只要不斷提醒開發者:裁判也會出錯,真實任務才算數。
![]()
圖4:OpenAI官網審計頁。它清理的是評測噪音,牽動的是coding agent的商業信用。
IDE變成新的收銀臺
最總一切都關乎于計費,所以agent時代真正的計費模式不在命中緩存,也不在每百萬token價格,而是在IDE里。
開發者每天睜眼打開Cursor,切terminal,刷GitHub,看CI面板到底是綠燈還是紅燈。過去模型廠爭的是網頁入口,后來爭手機App,再后來爭 API。coding agent出現以后,入口往前挪了一步,挪到了代碼被寫出來的地方。
Cursor的定價頁很直白:個人版每月20美元,Teams每用戶每月 40 美元,功能寫著Agent requests、frontier models、MCPs、skills、hooks、cloud agents、Bugbot usage-based billing、usage analytics。他正在把模型調用、agent能力、團隊權限和使用統計打包成一個開發組織的賬單中心。
OpenAI的Codex論文則給了使用形態的另一面:2026年上半年Codex 活躍用戶增長超過5倍,超過10%用戶每周會管理3個以上并發agents,skills使用率到6月升到26.6%。
綜合起來看,計費模式就很明確了。
Cursor證明入口在哪里;Claude Code證明賬單怎么管;Codex證明agent正在從單次問答,變成并發任務隊列。
Grok 4.5要搶的是Cursor里的默認模型、Grok Build里的agent工作流、開發團隊的token預算,以及X時間線上“什么才算真的能干活”的解釋權。
這也是為什么“成本”突然變鋒利。
如果模型還停在聊天框里,成本只是廠商毛利問題。用戶不太關心你推理一次燒多少錢,只關心回答是不是像人。可一旦模型進入IDE,成本就變成產品體驗的一部分。上下文長不長、吞吐快不快、失敗重跑貴不貴、團隊用量能不能管,都會變成開發者每天能摸到的阻力。
便宜當然不是免死金牌。
agent改壞一次生產庫,省下的token錢不夠賠一次事故復盤。X上轉得再歡,企業也不敢只靠這個買單。真正能讓開發團隊留下來的,是穩定性、權限、安全、上下文管理和可控失敗。
所以Grok 4.5這張牌也有風險。
首先,SpaceXAI官方token efficiency數據還需要更多第三方復現。其次,Cursor 入口不等于長期默認,開發者會在真實任務里用腳投票。OpenAI、Anthropic、Google不會把IDE賬單中心拱手讓人,它們只會更快把cost-per-task、workspace integration和eval governance 寫進產品敘事。
但這反而說明,競爭的本質已經變了。
以前模型廠爭的是“誰更聰明”。現在它們開始爭三個更具體的東西:誰定義能干活,誰占住工作入口,誰收走每一次任務調用的錢。
評測權、入口權、計費權,正在變成同一個戰場。
Agent正在告訴所有人,AI是新時代的工位。
一次bug fix,一次PR review,一次CI修復,一次文檔生成,一次失敗重跑。每個單位都要被驗證、被計費、被歸因。
接下來1-3個月,真正該看的也不是哪家又刷了一個榜單。而是看誰家的token和agent配合的更加經濟。
老馬未必學了中國。
但這一次,他確實把中國模型廠最早承認的現實,講成了一個硅谷故事。
本文來自公眾號:象先志 作者:卡古拉
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.