![]()
一個(gè)能省錢,一個(gè)更聰明。
AIX財(cái)經(jīng)(AIXcaijing)原創(chuàng)
作者 | 雷晶
編輯 | 金玙璠
GPT-5.6終于全量上線了。
早在6月26日,OpenAI以有限預(yù)覽的方式發(fā)布了GPT-5.6系列:Sol(太陽)主打復(fù)雜推理和Agent編碼,Terra(大地)定位日常生產(chǎn)力,Luna(月亮)走低價(jià)快速路線。
因美國政府要求需分階段放開,首發(fā)僅向約20家機(jī)構(gòu)開放。兩周后,GPT-5.6于當(dāng)?shù)貢r(shí)間7月9日全面上線,覆蓋ChatGPT、ChatGPT Work、Codex及OpenAI API。ChatGPT Plus及以上用戶可使用Sol,在ChatGPT Work和Codex中,免費(fèi)用戶默認(rèn)使用Terra,付費(fèi)用戶可在三檔中切換。
幾乎同一時(shí)間,Anthropic的Fable 5也經(jīng)歷了波折。這款6月9日發(fā)布的Fable 5(寓言)模型與未發(fā)先火的Mythos 5(神話)模型共享同一底座,因漏洞挖掘的能力太強(qiáng),發(fā)布時(shí)在Fable 5多加了一層安全分類器。盡管如此,6月12日Anthropic還是因使用有安全隱患被暫停關(guān)閉了所有用戶訪問,直到7月1日才恢復(fù)上線。7月8日,官方宣布Fable 5使用期限從原定的7月7日延長至7月12日;此后Fable 5將不再計(jì)入訂閱套餐額度,轉(zhuǎn)為按量付費(fèi)。
兩款模型都被視作各自公司的最強(qiáng)模型,可以看作是模型賽場上的直接對手。我們從OpenAI公布的評測數(shù)據(jù)中,選取了Fable 5與GPT-5.6 Sol均有成績的12項(xiàng)基準(zhǔn),制成以下對比圖表。
![]()
從成績來看,雙方差距并不大。GPT-5.6 Sol更擅長Agent執(zhí)行和終端操作;而長上下文和代碼庫級任務(wù)仍是Fable 5的強(qiáng)項(xiàng)。價(jià)格上,GPT-5.6 Sol每百萬Token輸入5美元、輸出30美元;Fable 5是輸入10美元、輸出50美元,前者幾乎便宜一半。
一個(gè)6月底小范圍預(yù)覽、7月全面上線;一個(gè)6月發(fā)布即遭下架、7月才回歸。兩款模型踩著同一個(gè)時(shí)間窗口完成了各自的波折上新。而OpenAI還同步推進(jìn)了更大的動(dòng)作:Codex正式并入ChatGPT桌面應(yīng)用,ChatGPT Work同步上線,ChatGPT想成為用戶電腦里的常駐入口。
那么問題也就來了,價(jià)格更低、野心更大、又把戰(zhàn)線從模型拉到產(chǎn)品,GPT-5.6到底能不能追上Fable 5?
01.三檔模型,各有所長
OpenAI這次把GPT-5.6拆成了三檔:Sol、Terra、Luna。Sol扛大旗,Terra打主力,Luna跑量。但定位歸定位,落到真實(shí)任務(wù)里,它們各自能打到什么程度?我們挑了幾個(gè)場景,逐一驗(yàn)證。
先來看GPT-5.6 Luna,我們從最輕量的活兒開始,讓它做一個(gè)二線城市的單人出游規(guī)劃。
它交付的是一份標(biāo)準(zhǔn)的攻略模板。住宿建議、每日行程、預(yù)算參考、出行提醒,該有的板塊都有。飲食推薦細(xì)化到了“小鍋米線約10-20元”這種具體的價(jià)格區(qū)間,路線規(guī)劃也會(huì)考慮不同的興趣偏好。
![]()
GPT-5.6 Luna制作的出游規(guī)劃
但生成的攻略缺少景區(qū)開放時(shí)間的提醒和景區(qū)門票價(jià)格,對實(shí)際出行的參考價(jià)值打了折扣。對于懶得自己做功課的人來說,GPT-5.6 Luna夠用,但不夠精細(xì)。
為了能直觀地看出三個(gè)版本的區(qū)別,我們在這里也用一樣的指令測一下Terra和Sol。
三個(gè)版本的模型選的城市各不一樣。Terra選擇了熱門旅游地長沙,它采用了表格的方式呈現(xiàn),整體更加整齊。和Luna相同的是,它在推薦美食時(shí)也給出了具體的價(jià)格區(qū)間。不同點(diǎn)則在于,它給出了涵蓋景點(diǎn)預(yù)約、天氣、交通、飲食等多方面的提醒。
![]()
GPT-5.6 Terra制作的出游規(guī)劃
Sol的表現(xiàn)與它全能的屬性相符。Sol選的城市是泉州,它的呈現(xiàn)形式和Luna比較相似,也是按時(shí)間線羅列路線,但它貼心的點(diǎn)在于加了一個(gè)行程概覽,能夠快速了解行程安排。整體來看,Sol最為貼心。它的游玩行程具體到時(shí)間,在推薦美食時(shí)除了標(biāo)出價(jià)格區(qū)間還附帶了門店推薦。此外,它還給出了景點(diǎn)的開放時(shí)間,建議游玩時(shí)間和不同愛好的游玩選擇。
![]()
GPT-5.6 Sol制作的出游規(guī)劃
這樣看來,三檔模型在信息密度上有較大差異,Luna夠用,Terra好用,Sol省心。
接下來,我們繼續(xù)看單檔模型的表現(xiàn)。輪到GPT-5.6 Terra,難度往上提一級,我們讓它做一個(gè)防曬衣的競品分析。
先說結(jié)論,GPT-5.6 Terra的結(jié)構(gòu)性很強(qiáng),習(xí)慣先拆解維度,再逐個(gè)填充。但內(nèi)容深度明顯不夠,每個(gè)維度的分析基本都是點(diǎn)到為止,比如提到價(jià)格策略,不分析為什么這樣定價(jià)或這種策略在市場中的實(shí)際效果。
![]()
GPT-5.6 Terra制作的競品分析
最后來看GPT-5.6 Sol,既然它主推復(fù)雜推理和編程能力,我們就給它上了兩道強(qiáng)度不同的題。
場景一:經(jīng)典邏輯推理題
我們給了它15個(gè)線索,讓它根據(jù)提示猜出5座房子中住著的不同國籍的人里,誰養(yǎng)的寵物是魚。
GPT-5.6 Sol采用列表逐條拆解線索,建立變量關(guān)系、逐步排除,推導(dǎo)過程完整可回溯,最終鎖定正確答案。
![]()
GPT-5.6 Sol的推理過程
場景二:3D網(wǎng)頁游戲開發(fā)
這才是能看出差距的地方。我們要求它做一個(gè)賽博朋克風(fēng)格的《打工人求生指南》,包含無限延伸的網(wǎng)格地面、漂浮的發(fā)光文字等元素。GPT-5.6 Sol交付的游戲涵蓋了提到的全部要求:藍(lán)紫霓虹色調(diào)、多邊形風(fēng)格、動(dòng)態(tài)文字漂浮效果。主角需要接“大餅”獲取“精神值”,同時(shí)躲避Boss的攻擊,可玩性和趣味性都在線。
![]()
GPT-5.6 Sol制作的游戲
跑完三檔分層,可以得出一個(gè)結(jié)論:GPT-5.6 Luna適合低成本、高頻率的日常查詢場景;GPT-5.6 Terra是日常主力,能處理有一定結(jié)構(gòu)要求的任務(wù),但需要人工復(fù)核;Sol負(fù)責(zé)復(fù)雜推理和創(chuàng)意實(shí)現(xiàn)。
這也說明,選模型不再是越強(qiáng)越好的單選題,而是任務(wù)難度和成本之間的權(quán)衡。OpenAI這次的分檔策略,本質(zhì)上是在回答一個(gè)問題:不同用戶、不同場景,需要用不同能力的模型。
02.GPT-5.6 Sol對打Fable 5,誰更好用?
既然Fable 5是Anthropic的單一旗艦,自然少不了要和GPT-5.6 Sol在一起比較。我們設(shè)計(jì)了四個(gè)場景,讓它們一較高下。
場景一:寫作
我們讓兩款模型分別做了今年高考全國I卷的作文題,談?wù)勛约簩δ骋粋€(gè)詞語理解的變化。
GPT-5.6 Sol選了“自由”,走的是純議論路線。從童年把自由當(dāng)任性寫起,推到自律帶來從容,再落到信息時(shí)代要獨(dú)立思考。結(jié)構(gòu)比較工整,但全篇幾乎沒有具體事例,主要靠比喻支撐。
![]()
GPT-5.6 Sol寫的作文
Fable 5選了“英雄”,以敘事帶議論。開篇寫童年認(rèn)知中的英雄得有披風(fēng)鎧甲,轉(zhuǎn)折處用普通人的具體事例推進(jìn),最后落筆到自己身上。從“仰望英雄”到“看見英雄”再到“愿意成為英雄”,層層遞進(jìn)。
![]()
Fable 5寫的作文
GPT-5.6 Sol偏向修辭驅(qū)動(dòng),結(jié)構(gòu)穩(wěn)定但素材單薄;Fable 5偏向素材驅(qū)動(dòng),敘事更具體、層次更豐富。
場景二:設(shè)計(jì)網(wǎng)頁
我們讓兩款模型分別設(shè)計(jì)一個(gè)簡約風(fēng)的護(hù)膚品網(wǎng)頁。
GPT-5.6 Sol在簡約框架里塞進(jìn)了更多東西,產(chǎn)品展示圖、護(hù)膚方法推薦,信息密度比Fable 5略勝一籌。
←左右滑動(dòng)查看更多→
Slide for more photos
Fable 5交出來的東西,很“簡單”,交付的頁面只有產(chǎn)品索引、品牌信條、成分原則和消息訂閱四個(gè)板塊,信息密度偏低,用戶滑兩下就到頭了,內(nèi)容缺少吸引力。
←左右滑動(dòng)查看更多→
Slide for more photos
這局GPT-5.6 Sol對“簡約”理解更準(zhǔn)確,F(xiàn)able 5在這道題上減法做過頭了,簡約不等于簡陋。
場景三:商業(yè)分析
我們讓兩款模型為一個(gè)三人創(chuàng)業(yè)團(tuán)隊(duì)做AI產(chǎn)品的商業(yè)分析,要求包含賽道選擇、產(chǎn)品方案、風(fēng)險(xiǎn)預(yù)判和Plan B。這道題沒有標(biāo)準(zhǔn)答案,它考的是AI能不能像一個(gè)真正的創(chuàng)業(yè)合伙人那樣思考。
有意思的是,兩個(gè)模型都沒有選通用助手、AI搜索這類大眾賽道,而是各自挑了一個(gè)相當(dāng)垂直的切口。GPT-5.6 Sol選了AI職業(yè)試崗平臺(tái),讓用戶投簡歷前先模擬一次真實(shí)工作;Fable 5選了備考督學(xué)搭子,做人工督學(xué)的平替。
GPT-5.6 Sol交付的內(nèi)容更扎實(shí):每條賽道都有相關(guān)數(shù)據(jù),還附了一張25分制的評分表;產(chǎn)品方案給出了詳細(xì)的執(zhí)行方向;風(fēng)險(xiǎn)預(yù)判部分給了完整的鏈條和清晰的預(yù)防方案。整體數(shù)據(jù)密度高,細(xì)節(jié)扎實(shí)。
←左右滑動(dòng)查看更多→
Slide for more photos
Fable 5選的賽道更小眾,判斷主要靠推理,缺硬數(shù)據(jù)撐腰。它認(rèn)為產(chǎn)品方案的亮點(diǎn)在價(jià)格便宜,但也正如它的分析,有可能沒人下載,用的人也留存不住。整體規(guī)劃的產(chǎn)品方向商業(yè)價(jià)值不大。
←左右滑動(dòng)查看更多→
Slide for more photos
總體來看,這道題GPT-5.6 Sol略勝一籌,勝在數(shù)據(jù)密度、結(jié)構(gòu)完整度和執(zhí)行細(xì)節(jié)。
場景四:編程
最后一場,來看編程能力。我們設(shè)了兩道編程題,一道考視覺效果,一道考游戲可玩性。
第一題,我們讓它們實(shí)現(xiàn)雨絲觸底煙花爆炸的創(chuàng)意代碼動(dòng)畫。兩款模型都跑通了,但細(xì)節(jié)上有差距。Fable 5還自作主張?jiān)诋嫴柬敳考恿艘粋€(gè)標(biāo)題,影響美觀,但煙花更大更明顯。缺點(diǎn)也是煙花太大,加上速度較快,會(huì)影響整體效果。
![]()
Fable 5制作的創(chuàng)意代碼動(dòng)畫
GPT-5.6 Sol沒有多余元素,雨滴的下落角度和煙花爆炸的效果更自然,但不太能看出煙花的效果。
![]()
GPT-5.6 Sol制作的創(chuàng)意代碼動(dòng)畫
第二題,我們讓它們做一個(gè)世界杯點(diǎn)球大戰(zhàn)的游戲。兩款模型的玩法相似,但Fable 5在交互細(xì)節(jié)上更豐富,支持選擇不同國籍和難度等級,GPT-5.6 Sol只能選難度。
![]()
Fable 5制作的游戲
不過Fable 5呈現(xiàn)的效果整體更簡單,GPT-5.6 Sol的進(jìn)球后的慶祝特效更完整,還支持查看回放。這局,F(xiàn)able 5更會(huì)設(shè)計(jì)玩法,GPT-5.6 Sol更會(huì)打磨細(xì)節(jié)。
![]()
GPT-5.6 Sol制作的游戲
四場打完,兩款模型呈現(xiàn)出了很不一樣的性格。GPT-5.6 Sol綜合完成度更高,F(xiàn)able 5更聰明。GPT-5.6 Sol像個(gè)靠譜的乙方,結(jié)構(gòu)清晰、數(shù)據(jù)扎實(shí);Fable 5更像個(gè)聰明的搭檔,在洞察力和表達(dá)力上時(shí)不時(shí)讓你眼前一亮。
03.結(jié)語
回到最初的問題,GPT-5.6能不能追上Fable 5?
如果只看單點(diǎn)能力,兩家各有長處。寫作打平,設(shè)計(jì)、商業(yè)分析GPT-5.6略勝一籌,編程各有勝負(fù)。
但GPT-5.6的重心,可能從一開始就不是在所有能力上壓過Fable 5。它真正要解決的是另一個(gè)問題,當(dāng)AI模型越來越強(qiáng)、調(diào)用越來越頻繁、企業(yè)需求越來越碎片化時(shí),OpenAI如何把大模型能力變成一門能規(guī)模化運(yùn)轉(zhuǎn)的生意。
這也是為什么GPT-5.6要以Sol、Terra、Luna三檔同時(shí)出場,GPT-5.6 Sol負(fù)責(zé)復(fù)雜推理和高價(jià)值任務(wù);GPT-5.6 Terra用GPT-5.5一半的價(jià)格覆蓋日常辦公和輕量分析;GPT-5.6 Luna則以低價(jià)爭奪高頻調(diào)用市場。過去,所有用戶都擠在同一個(gè)最貴的模型上,越多人使用虧得越多。三層定價(jià)的本質(zhì),是讓不同價(jià)值的請求流向不同成本的模型。
分層定價(jià)是第一步,產(chǎn)品整合是第二步。
GPT-5.6發(fā)布當(dāng)天,OpenAI同步上線了ChatGPT Work,它是支持連接外部工具的AI智能體。ChatGPT Work可以拆解復(fù)雜任務(wù)、自主執(zhí)行數(shù)小時(shí),產(chǎn)出成品。同一天,原本獨(dú)立運(yùn)行的編程工具Codex也被正式并入ChatGPT桌面應(yīng)用,與Chat、Work三欄并列。這套動(dòng)作的意圖在于,把聊天、辦公、編程三條線收攏到一個(gè)入口,讓ChatGPT從問答工具變成“超級應(yīng)用”。
這背后是OpenAI沉重的財(cái)務(wù)壓力。6月中旬,獨(dú)立博主Ed Zitron獲得的審計(jì)文件經(jīng)《金融時(shí)報(bào)》獨(dú)立核實(shí)后曝光,OpenAI 2025年?duì)I收130.7億美元,總支出高達(dá)340億美元,其中研發(fā)支出191.8億美元,經(jīng)營性虧損209.2億美元。據(jù)研究機(jī)構(gòu)Sacra估算,虧損的大頭是推理成本,2025年推理支出84億美元,2026年預(yù)計(jì)攀升至141億美元。換算下來,OpenAI每天虧掉近6000萬美元。
同為海外“御三家”之一的Anthropic是OpenAI最直接的宿敵。在模型矩陣上,兩家最新旗艦級模型能力不相上下;在產(chǎn)品布局上,又存在智能體、編程、設(shè)計(jì)等產(chǎn)品的高度相似。此前,Anthropic發(fā)布的Fable 5因價(jià)格較高,受到一定質(zhì)疑,6月末它馬上上線了中端模型Claude Sonnet 5,主打更低的價(jià)格帶來Opus級別的能力。在GPT-5.6上線的幾乎同一時(shí)間,Anthropic宣布將重置5小時(shí)和每周使用額度,企圖繼續(xù)分流用戶。
在激烈競爭之下,OpenAI除了卷模型,也得開始省錢了。GPT-5.6發(fā)布前,OpenAI官宣與博通合作的首顆自研推理芯片Jalape?o,從設(shè)計(jì)到流片只用了九個(gè)月。自研芯片的意義在于降低推理環(huán)節(jié)對通用GPU的依賴,省下租用算力的錢。
當(dāng)然,省錢本質(zhì)上還是為了給IPO鋪路。OpenAI已秘密提交招股書,高盛與摩根士丹利聯(lián)合輔導(dǎo),一級市場估值8520億美元。但時(shí)間窗口并不寬裕,Anthropic已率先遞表,SpaceX已經(jīng)先一步上市。
所以,GPT-5.6的真正任務(wù),一方面是要證明OpenAI有能力把虧損增速放緩;另一方面它要用ChatGPT Work搶辦公場景,用Codex守住開發(fā)者,再用三檔定價(jià)攔截價(jià)格敏感型客戶,找回被Anthropic拿走的主動(dòng)權(quán)。
*題圖由AI生成。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.