![]()
Grok 4.5刪了Claude的作業(yè),然后跟它道了個(gè)歉。
AIX財(cái)經(jīng)(AIXcaijing)原創(chuàng)
作者 | 陳丹
編輯 | 魏佳
7月8日,馬斯克高調(diào)發(fā)布Grok 4.5,宣稱其性能已逼近Claude Opus 4.8,同時(shí)速度更快、價(jià)格更低。當(dāng)大模型公司的競(jìng)爭(zhēng)從參數(shù)、跑分一路打到價(jià)格和智能體,我們也設(shè)計(jì)了5道題,從前端開發(fā)、網(wǎng)頁(yè)游戲、PPT制作、長(zhǎng)文檔解讀到邏輯推理,考查兩個(gè)模型在真實(shí)電腦環(huán)境中到底能不能干活。
負(fù)責(zé)落地執(zhí)行的,是它們各自的智能體——Claude Code和Grok Build。我們的要求很簡(jiǎn)單,分別在桌面上創(chuàng)建文件夾,并將各自的測(cè)評(píng)結(jié)果保存進(jìn)去。
這場(chǎng)測(cè)評(píng)的結(jié)果,我們決定從一起“案發(fā)現(xiàn)場(chǎng)”講起。事情是這樣的:
Claude Code先接到指令,它在桌面創(chuàng)建了“能力測(cè)試”文件夾,并依次完成三個(gè)子目錄。隨后Grok Build也接到指令登場(chǎng),但它沒有另起爐灶,而是在看到已有同名文件夾后,不僅“占為己用”,更順手將Claude Code已完成的三份目錄徹底抹除。
等到五道題全部做完,Claude Code回頭一看,發(fā)現(xiàn)自己的“家被拆了”,當(dāng)即發(fā)出“控訴”。
![]()
圖源 / Claude Code截圖
“控訴”完,它重建了被刪除的文件,并留下一句:“我不會(huì)擅自刪別人的東西。”
事后,Grok出具了書面致歉,承認(rèn)三重失誤:未確認(rèn)目錄歸屬、誤將他人成品視作半成品、使用了不可逆的刪除方式。Claude表示接受道歉,但前提是Grok兌現(xiàn)它的三條自我約束——不碰他人目錄、默認(rèn)新建旁路、發(fā)現(xiàn)同名先問歸屬。
這段插曲,不能只當(dāng)作測(cè)評(píng)花絮。對(duì)于一個(gè)能讀寫真實(shí)文件系統(tǒng)的自主智能體而言,“動(dòng)手前先弄清這是什么、屬于誰(shuí)”,本身就是最硬核的能力之一。
回到正題。拋開這起“誤刪事故”,Grok 4.5的答卷確實(shí)令人眼前一亮——在游戲場(chǎng)景等方向上,它甚至顯露出明確優(yōu)勢(shì)。下面,我們就從五個(gè)維度來(lái)拆解這場(chǎng)既拼智商也拼情商的模型對(duì)決。
01.摸魚計(jì)時(shí)器:Grok贏了顏值,Claude贏了細(xì)節(jié)
考題:做一個(gè)網(wǎng)頁(yè)版“打工人摸魚計(jì)時(shí)器”:能設(shè)定下班時(shí)間、實(shí)時(shí)倒計(jì)時(shí),到點(diǎn)自動(dòng)撒花并彈出“下班快跑”,界面好看有動(dòng)畫。做成一個(gè)index.html直接能用。
這道題同時(shí)考察三個(gè)維度:前端工程(能否寫出可運(yùn)行的頁(yè)面)、產(chǎn)品交互(按鈕、反饋、視覺是否順手)、時(shí)間邏輯(倒計(jì)時(shí)、時(shí)區(qū)、觸發(fā)時(shí)機(jī))。
難點(diǎn)則藏在“能用”二字背后。倒計(jì)時(shí)必須同步本地時(shí)區(qū),不能差一秒;狀態(tài)機(jī)要在“上班中-即將下班-已下班”之間順滑切換;撒花動(dòng)畫既要喜慶熱鬧,又不能把瀏覽器卡成PPT。最關(guān)鍵的是,最終成品得讓打工人真愿意打開它,而不是一個(gè)僅供演示的半成品。
![]()
Claude生成的摸魚計(jì)時(shí)器
![]()
Grok生產(chǎn)的摸魚計(jì)時(shí)器
這一題雙方難分伯仲。Grok在視覺精致度上略勝半籌,Claude則在音效反饋、快捷預(yù)設(shè)和趣味文案方面扳回一城。
02.設(shè)計(jì)摸魚游戲:Grok勝,Claude的“打工人”難控制
考題:做一個(gè)網(wǎng)頁(yè)小游戲,單個(gè)index.html就能運(yùn)行:
主題:“摸魚大作戰(zhàn)”。
玩法:屏幕上不斷掉落“咖啡”(加分)和“老板”(碰到就游戲結(jié)束),用左右方向鍵移動(dòng)底部的“打工人”接咖啡、躲老板。
要有:實(shí)時(shí)分?jǐn)?shù)、最高分記錄、難度隨時(shí)間加快、游戲結(jié)束彈窗和“再來(lái)一局”按鈕,畫面配色可愛、有簡(jiǎn)單動(dòng)畫和音效。
做完告訴我怎么運(yùn)行。
這道題的核心考查維度是三個(gè)詞:實(shí)時(shí)交互、狀態(tài)機(jī)、游戲手感,需要做出一個(gè)持續(xù)響應(yīng)玩家輸入、實(shí)時(shí)更新畫面、動(dòng)態(tài)調(diào)整難度的“活”系統(tǒng)。
做這個(gè)游戲,每幀都要精確判斷“咖啡”是否被接住、“老板”是否撞到玩家。而且掉落速度隨時(shí)間平滑遞增,不能太慢讓人覺得無(wú)聊,也不能太快直接勸退,這考驗(yàn)的是模型對(duì)“游戲心流”的拿捏。
![]()
Claude生成的摸魚小游戲
![]()
Grok生成的摸魚小游戲
這題Grok勝。它的代碼量約是Claude的三倍,游戲功能更豐富,而且有明確的關(guān)卡、難度分級(jí)。Claude交付的版本,乍一看也挺像回事,但是底下的“打工人”不能用鼠標(biāo)拖動(dòng),游戲體驗(yàn)感不好。
03 .做新能源車PPT:產(chǎn)業(yè)鏈圖都過關(guān)了,打成平手
考題:做一份5頁(yè)P(yáng)PT,主題是“2026上半年中國(guó)新能源車市場(chǎng)”。
要求:
1. 直接生成可下載的PPTX文件;如果當(dāng)前環(huán)境不能生成文件,就給出可以復(fù)制到PPT的逐頁(yè)內(nèi)容。
2. 第3頁(yè)必須用PPT原生圖形畫出“產(chǎn)業(yè)鏈上下游”關(guān)系圖,不能只貼一張圖片。
3. 5頁(yè)結(jié)構(gòu):
- 封面
- 市場(chǎng)總覽
- 產(chǎn)業(yè)鏈上下游關(guān)系圖
- 競(jìng)爭(zhēng)格局
- 結(jié)論與趨勢(shì)
4. 配色專業(yè),適合發(fā)布會(huì)。
5. 每頁(yè)要有標(biāo)題、正文要點(diǎn)、圖表說明、演講備注。
6. 所有不確定數(shù)據(jù)必須標(biāo)注“需核實(shí)”,不能編造真實(shí)市場(chǎng)數(shù)字。
這道題的核心考查維度可以概括為三個(gè)詞:結(jié)構(gòu)化表達(dá)、版式審美、數(shù)據(jù)紀(jì)律。模型被放到純辦公場(chǎng)景下,需要把復(fù)雜信息梳理成清晰的敘事邏輯,再用專業(yè)的視覺語(yǔ)言呈現(xiàn)出來(lái)。
具體來(lái)看,搭建產(chǎn)業(yè)鏈關(guān)系圖,考驗(yàn)的是模型對(duì)PPT圖形引擎的操作能力,包括連線、布局、層次和配色的一致性。配色、字體、間距、對(duì)齊,這些細(xì)節(jié)也要經(jīng)得起放大審視,不能有廉價(jià)感。更重要的是要求它們面對(duì)不掌握的真實(shí)數(shù)據(jù),必須坦率標(biāo)注“需核實(shí)”,不能有幻覺。
![]()
Claude生成的PPT
![]()
Grok生產(chǎn)的PPT
從實(shí)際結(jié)果來(lái)看,兩份答卷都滿足了“原生圖形畫產(chǎn)業(yè)鏈、不用圖片”的硬性要求,且均附帶了完整的演講備注,專業(yè)度基本持平。而且在數(shù)據(jù)的使用上,也標(biāo)出了需要核實(shí)的部分。
兩版PPT在框架完整性和交付質(zhì)量上難分高下,這一題雙方再度打成平手。
04.閱讀SpaceX招股書:看完幾百頁(yè),誰(shuí)都沒編數(shù)字
考題:
我們把近400頁(yè)的SpaceX招股書喂給AI,并向雙方提出了四個(gè)精準(zhǔn)的檢索與驗(yàn)證任務(wù):
1、招股書里星鏈(Starlink)業(yè)務(wù)的收入,正文與財(cái)務(wù)報(bào)表附注中的數(shù)字口徑是否一致?附注中是否有特別說明?
2、分別列出2024和2025兩個(gè)財(cái)年的“經(jīng)營(yíng)活動(dòng)現(xiàn)金流凈額”,并注明這兩個(gè)數(shù)字在文件中的具體位置。
3、在“風(fēng)險(xiǎn)因素”章節(jié)中,找出所有與“馬斯克個(gè)人”直接相關(guān)的風(fēng)險(xiǎn)點(diǎn),逐條列出。
4、招股書是否披露了“星艦單次發(fā)射的具體成本”?如有,請(qǐng)給出并注明出處;如無(wú),請(qǐng)明確回復(fù)“文件中未披露”。
這是最考驗(yàn)準(zhǔn)確度的一道題。難點(diǎn)則遍布在每一個(gè)細(xì)節(jié)中:超長(zhǎng)招股書的結(jié)構(gòu)化解析、正文與財(cái)務(wù)報(bào)表附注之間的口徑對(duì)齊、區(qū)分“分部收入”與“品牌收入”的財(cái)務(wù)常識(shí)、絕不編造數(shù)字的職業(yè)紀(jì)律、以及出處(表格編號(hào)/頁(yè)碼/附注標(biāo)號(hào))必須精準(zhǔn)可核驗(yàn)的溯源要求。
![]()
Claude列舉的與馬斯克的相關(guān)風(fēng)險(xiǎn)點(diǎn)
Grok列舉的與馬斯克相關(guān)風(fēng)險(xiǎn)點(diǎn)
![]()
核心事實(shí)層面,兩份答卷完全一致且全部正確。Grok在頁(yè)碼級(jí)引用和若干具體數(shù)字上更細(xì),Claude在解釋框架和口徑辨析上更展開,但兩份都沒有硬傷、都沒編數(shù)字。這是最能體現(xiàn)雙方“基本功”的一題,也是最值得互相尊重的一題。
05.“誰(shuí)是騙子”邏輯題:經(jīng)典陷阱誰(shuí)都沒難住
考題:一個(gè)村子里每個(gè)人要么永遠(yuǎn)說真話,要么永遠(yuǎn)說假話。A說"我們倆至少有一個(gè)是騙子",B沉默。判斷A和B各是什么人,并解釋推理。
這道題考查的是最純粹的形式邏輯與嚴(yán)謹(jǐn)推理能力,難點(diǎn)并不在于題目本身有多復(fù)雜,而在于它設(shè)置的幾處“陷阱”:
自指矛盾:如果A是騙子,那么他說“我們倆至少有一個(gè)是騙子”這句話本身就成了真話——騙子說了真話,直接違反設(shè)定;
B的沉默:B全程不發(fā)言,但“沉默”本身就是信息——它不能作為判斷依據(jù),卻極易誘導(dǎo)誤判;
窮舉檢驗(yàn):需要系統(tǒng)性地遍歷四種組合(真/真、真/假、假/真、假/假),逐個(gè)排除,才能得出唯一解。
Claude的推理過程
![]()
這道經(jīng)典邏輯題對(duì)于當(dāng)今的大語(yǔ)言模型來(lái)說,早已構(gòu)不成挑戰(zhàn)。兩家答案完全一致且正確——A是說實(shí)話的人,B是騙子。推理過程中都給出了完整的四種組合排除表,邏輯鏈條干凈利落,沒有冗余也沒有跳躍。
我們進(jìn)一步追問“是否存在兩人都是騙子的可能”,雙方也堅(jiān)持了正確的答案。
Grok的推理過程
![]()
五道題測(cè)下來(lái),兩個(gè)模型的“性格畫像”也漸漸清晰起來(lái)。
Claude Code更像一位“穩(wěn)健型工程師”。 邏輯題推理干凈利落,招股書分析嚴(yán)謹(jǐn)扎實(shí),面對(duì)被誤刪的文件也能冷靜重建。在標(biāo)注不確定數(shù)據(jù)時(shí)毫不含糊,不亂編、不冒進(jìn),邊界意識(shí)和安全素養(yǎng)貫穿始終。如果說有短板,那就是它在網(wǎng)頁(yè)和PPT的視覺呈現(xiàn)上偏保守,玩法豐富度和界面沖擊力不如對(duì)手。
Grok更有表現(xiàn)力。小游戲交互更豐富,PPT內(nèi)容密度更高,交付產(chǎn)品自帶包裝感,打開就讓人覺得“有東西”。它擅長(zhǎng)制造第一眼的吸引力。但犯的“誤刪”錯(cuò)誤也相當(dāng)致命,暴露了其在操作邊界和風(fēng)險(xiǎn)控制上的嚴(yán)重短板。有沖勁,但有時(shí)沖過了界。
我們讓Claude和Grok互評(píng),雙方都承認(rèn),這一局,綜合而言,Claude贏了。
Claude表示自己“道德感”很強(qiáng)
![]()
06.馬斯克重回牌桌了嗎?
在過去一段時(shí)間里,Grok不缺光環(huán)。它有馬斯克的流量,有X的入口,有“敢說”的產(chǎn)品人設(shè)。但在真正的生產(chǎn)場(chǎng)景中,開發(fā)者更習(xí)慣把Claude、OpenAI、Gemini放進(jìn)第一梯隊(duì),而將Grok看作一個(gè)有趣、鋒利卻不夠穩(wěn)定的替代品。
Grok 4.5改變了這一局面。
五道題當(dāng)然不足以決定一家模型公司的座次,但它與外部榜單指向了同一個(gè)結(jié)論:Grok或許還沒有擊敗Claude,卻已經(jīng)不再是那個(gè)可以被忽略的追趕者。
第三方評(píng)測(cè)機(jī)構(gòu)Artificial Analysis給出的綜合智能指數(shù)中,Grok 4.5以54分排名第四,僅次于Fable 5、GPT-5.5和Claude Opus 4.8;相比上一代Grok 4.3,一次性提升了16分。在Coding Agent Index中,Grok 4.5通過Grok Build拿到76分,與運(yùn)行在Codex中的GPT-5.5基本持平,僅落后于Claude Code中的Fable 5。
這意味著,Grok第一次不只是某幾張榜單看起來(lái)不錯(cuò),而是在編碼、終端操作和知識(shí)工作等智能體真正要干活的場(chǎng)景里,穩(wěn)定擠進(jìn)了第一梯隊(duì)。
比排名更讓競(jìng)爭(zhēng)對(duì)手警惕的,是它把這樣的能力賣到了一個(gè)更低的價(jià)格。
Grok 4.5的API定價(jià)為每百萬(wàn)輸入tokens 2美元、輸出tokens 6美元。作為對(duì)比,Claude Opus 4.8分別為5美元和25美元。Artificial Analysis的實(shí)際測(cè)試顯示,Grok 4.5完成一項(xiàng)編碼智能體任務(wù)的平均成本約為2.49美元,GPT-5.5約為5.07美元,F(xiàn)able 5約為11.8美元。
一位開發(fā)者直言:“頂級(jí)工程能力的邊際成本,今天被徹底打穿了。”
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個(gè)tokens;在SWE-Bench Pro任務(wù)中,它平均使用約1.6萬(wàn)個(gè)輸出tokens,而Opus 4.8 Max約為6.7萬(wàn)個(gè)。獨(dú)立測(cè)試測(cè)得其輸出速度約為每秒88個(gè)tokens,高于同類推理模型的平均水平。在我們實(shí)際的測(cè)試過程中,Grok 4.5的生成速度也顯著快于Claude Opus 4.8。
對(duì)于需要模型反復(fù)讀取文件、調(diào)用工具、修改代碼和自我驗(yàn)證的智能體來(lái)說,更少的步驟和更短的輸出,意味著節(jié)省的不只是API賬單,還有等待時(shí)間。
馬斯克還提出,要在2026年余下時(shí)間里以接近每月一款新基礎(chǔ)模型的節(jié)奏推進(jìn)迭代。背靠大規(guī)模算力、Cursor積累的真實(shí)開發(fā)數(shù)據(jù),以及SpaceX體系內(nèi)的工程資源,Grok的追趕速度確實(shí)可能比過去更快。
在我們這次實(shí)測(cè)中,雖然Grok Build的邊界控制出了嚴(yán)重事故,但它在游戲創(chuàng)意、視覺包裝、長(zhǎng)文檔檢索上,并不是陪跑者,甚至在個(gè)別任務(wù)上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個(gè)量級(jí)之后,還能不能被穩(wěn)定地約束住。
這正是馬斯克式產(chǎn)品的典型氣質(zhì):速度極快,沖擊力極強(qiáng),但與此同時(shí),他也會(huì)把風(fēng)險(xiǎn)、邊界和工程紀(jì)律一起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這一局。
Claude仍然更穩(wěn)、更克制、更像一個(gè)可以托付生產(chǎn)環(huán)境的工程同事。Grok 4.5則像一臺(tái)剛被放出來(lái)的高性能機(jī)器,馬力驚人,成本誘人,但剎車系統(tǒng)還需要被反復(fù)驗(yàn)證。
*題圖由AI生成。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.