![]()
作者 | 褚杏娟
今天,OpenAI 正式推出 GPT-5.6 系列模型,具體包括三款模型:
? GPT-5.6 Sol:全新的旗艦模型,代表最高智能水平;
? GPT-5.6 Terra:面向日常工作的均衡模型,在能力、速度和成本之間取得平衡;
? GPT-5.6 Luna:成本效率最高的輕量模型。
OpenAI 表示,GPT-5.6 Sol 在智能水平和效率方面樹立了新的標準。在編程、知識工作、網絡安全和科學領域測試中,它均達到當前最先進水平,并且相比此前模型和 Fable 5 等前沿模型,以更少的 Token 消耗和更低的預估成本取得更優表現。
“這意味著更高的單位成本性能(performance per dollar):用戶可以用相同預算完成更多工作,也可以用更低成本獲得接近的結果。”官方表示。
“這無疑是我們有史以來最出色的作品了。”Altman 顯然對這次發布也非常滿意。
![]()
GPT-5.6 現在已通過 ChatGPT、Codex 和 OpenAI API 上線,并將在全球范圍逐步開放。在價格方面:
? GPT-5.6 Sol:5 美元/百萬輸入 Token,30 美元/每百萬輸出 Token;
? GPT-5.6 Terra:2.5 美元/每百萬輸入 Token,15 美元/每百萬輸出 Token;
? GPT-5.6 Luna:1 美元/百萬輸入 Token,5 美元/每百萬輸出 Token;
GPT-5.6 同時引入了更可預測的 Prompt 緩存機制,包括支持顯式緩存斷點以及最低 30 分鐘的緩存生命周期。對于 GPT-5.6 及后續模型,緩存寫入的計費標準為模型未緩存輸入價格的 1.25 倍;而緩存讀取仍然享受 90% 的緩存輸入折扣。這意味著用戶讀取已經緩存的上下文時,只需支付原始輸入價格的 10%。
針對需要更強推理能力和更高計算投入的復雜任務,GPT-5.6 還提供了不同等級的推理模式。其中,max 模式相比此前的 xhigh 模式,會投入更多計算資源用于推理、探索不同解決方案、執行驗證以及調整自身策略,以提升復雜任務的完成質量。更高階的 ultra 模式則進一步引入多智能體協作能力,該模式默認協調 4 個智能體并行處理任務,通過增加 Token 消耗換取更高質量結果和更快完成速度。
據悉,目前 GPT-5.6 已經被用于 OpenAI 自身的 AI 研發流程,包括定位模型問題、優化訓練系統、執行實驗和分析實驗結果。
在內部測試期間,GPT-5.6 推動研究人員使用 AI 輔助工作的程度大幅提升。數據顯示,活躍研究人員每日平均輸出 Token 數量超過 GPT-5.5 測試期間最高水平的兩倍。過去六個月中,OpenAI 內部用于代碼推理的研究計算量增長 100 倍,內部 Agent Token 使用量增長約 22 倍。
OpenAI 表示,這些指標并不直接代表研究進展,但反映出 AI 輔助正在快速進入模型研發、銷售、市場、運營、財務等多個團隊。
值得注意的是,Anthropic 幾乎在同時宣布了重置每周使用額度的消息,這被解讀為“是在向 OpenAI 釋放一個明確的信號。”
![]()
三大維度,全面對標 Fable 5
高效,但比 Fable 5 便宜
GPT-5.6 系列在代碼能力和 Agent 任務執行方面實現進一步提升。
![]()
在 Artificial Analysis Coding Agent Index v1.1 測試中,GPT-5.6 Sol 在最高推理模式下取得 80 分,刷新該評測最高成績,比 Claude Fable 5 高出 2.8 分。與此同時,GPT-5.6 Sol 完成任務所需輸出 Token 數量不到 Fable 5 的一半,任務執行時間不到其一半,整體成本降低約三分之一。
![]()
這一效率優勢也延伸至整個 GPT-5.6 系列。其中,GPT-5.6 Terra 的代碼能力略高于 Fable 5,而 GPT-5.6 Luna 則超過 Claude Opus 4.8。OpenAI 稱,兩款模型均能以約三分之一的時間完成任務,同時將輸出 Token 消耗減少約一半,預估成本降低至約四分之一。
![]()
此外,GPT-5.6 系列還在 Terminal-Bench 2.1 和 DeepSWE v1.1 測試中刷新最高成績,前者主要評估復雜命令行任務能力,后者則測試模型在真實代碼庫中的長期軟件工程能力。
除了模型本身能力提升,GPT-5.6 還進一步增強了 Agent 執行任務的能力,引入程序化工具調用(Programmatic Tool Calling)。通過這一能力,GPT-5.6 可以編寫并運行輕量級程序,用于協調工具調用、處理中間結果、監控任務進展,并根據任務變化自主選擇下一步行動。
OpenAI 表示,這一機制能夠顯著優化復雜工具型任務的執行流程。過去,開發者通常需要手動編排每一步操作,或者將每一次工具返回結果重新傳遞給模型。而借助 Responses API 中的程序化工具調用,GPT-5.6 可以自動過濾大量中間數據,僅保留關鍵結果,并根據任務推進情況動態調整工作流程,從而減少 Token 消耗、降低模型調用次數,并減少人工指導需求。
OpenAI 表示,訓練 GPT-5.6 的核心目標之一,就是讓每一個 Token 產生更高價值。
在內部的 Agents’ Last Exam 測試中(該測試用于評估覆蓋 55 個專業領域的長期運行工作流能力)GPT-5.6 Sol 創下新的最高分:53.6 分。這一成績比 Claude Fable 5 高出 13.1 分。即使在中等推理強度下,GPT-5.6 Sol 仍然比 Fable 5 高出 11.4 分,而預估成本約只有后者的四分之一。而 GPT-5.6 Terra、GPT-5.6 Luna 兩者均能超過 Fable 5,同時成本約只有其 1/16。
![]()
在 Artificial Analysis Intelligence Index v4.1(該指標綜合評估智能體任務、代碼能力、科學推理以及通用能力表現) 測試中,GPT-5.6 Sol 在最高推理模式下,與 Fable 5 的成績差距縮小至 1 分以內,但完成任務所需時間減少 61%,預估成本約降低至一半。
更強安全能力:面向真實世界部署
OpenAI 表示,GPT-5.6 系列搭載了目前最完善的安全防護體系,旨在抵御具有適應性和針對性的濫用行為,同時盡量避免對正常使用場景造成不必要限制。
在正式發布前,OpenAI 進行了迄今規模最大的模型安全評估,包括人類紅隊測試、大規模自動化測試、外部專家評估以及與專業機構和合作伙伴開展的壓力測試。其中,黑盒自動化紅隊測試累計投入約 70 萬 A100e GPU 小時,用于系統性發現潛在漏洞并強化防護能力。
OpenAI 表示,GPT-5.6 的安全體系結合了模型內置安全訓練、實時檢測、持續監控以及基于用戶信任等級和風險水平調整的訪問控制機制。相比此前模型,GPT-5.6 在網絡安全和生物領域能力進一步增強,但測試結果顯示,其尚未達到 OpenAI 定義的“關鍵風險”水平。
具體來看,在網絡安全領域,GPT-5.6 更擅長漏洞發現、代碼修復、安全審查等防御型任務,而不是針對高防護目標執行完整自主攻擊;在生物領域,模型能夠輔助合法科研工作,但尚不具備端到端設計、制造高度危險新型威脅的能力。
與此同時,OpenAI 表示,GPT-5.6 相比此前模型消耗更少 Token。
在 ExploitBench2 (該測試衡量模型從發現漏洞代碼到實現任意代碼執行的能力)測試中,GPT-5.6 Sol 得分達到 73.5%,明顯高于 GPT-5.5 的 47.9%。
在 ExploitGym3(該測試要求 Agent 將真實世界漏洞轉化為可運行攻擊樣本)測試中,在兩小時限制下,GPT-5.6 Sol 最高通過率達到 24.9%,相比 GPT-5.5 的 15.1%接近翻倍;延長至 6 小時后,通過率進一步達到 33.7%。
在 SEC-Bench Pro 測試中,GPT-5.6 Sol 取得 71.2%的成績,高于 GPT-5.5 的 45.8%,同時保持更低延遲。
OpenAI 正在通過 Trusted Access for Cyber 項目,為經過驗證的個人和組織提供更強安全能力,包括漏洞分析、惡意軟件研究、檢測工程以及補丁驗證等場景。未來,其將繼續通過漏洞獎勵計劃、實時監控和快速修復機制完善安全體系,并根據真實使用過程中發現的新風險持續調整防護措施。
辦公能力全面增強,還推出了內置 GPT-5.6 的超級應用?
在辦公領域,OpenAI 還推出了由 GPT-5.6 提供支持的 ChatGPT Work,其定位為 ChatGPT 內置的智能體,幫助用戶承擔更復雜、更具挑戰性的工作任務。借助這一能力,ChatGPT 不再局限于回答問題,而是能夠圍繞目標自主規劃、執行并交付完整成果。
據 OpenAI 介紹,ChatGPT Work 可以從用戶連接的應用和工作流中獲取信息,并基于這些數據生成可直接使用的工作成果,包括表格、PPT、文檔以及 Web 應用等。同時,它能夠將復雜項目拆解為多個步驟,自主推進任務執行,并持續處理長達數小時的工作流程。
這一變化意味著,ChatGPT 正在從“輔助工具”向“任務執行者”轉變。用戶不再需要逐步指導 AI 完成每個操作,而是可以直接提出目標,由智能體負責規劃路徑、調用工具并完成交付。
內置 Codex 后,ChatGPT 已經能夠超越傳統問答模式,在網頁端、移動端和桌面端完成真正的工作任務。
![]()
活動運營看板案例
官方表示,使用 ChatGPT Work 的最佳方式,是交給它一個你已經很熟悉的任務,你跟進它的進展、回答問題、改變方向,并批準重要操作。你甚至可以用一個請求讓 ChatGPT Work 接手整個工作流。例如,它可以把客戶研究轉化為營銷活動簡報,再用該簡報創建營銷素材,并在每一步都保留上下文的同時,為不同市場調整這些素材。
即使你離開電腦或手機,ChatGPT Work 也能通過定時任務持續推進項目。例如,它可以獨立地將 Microsoft Teams 和 Slack 的新消息轉化為更新后的文檔或幻燈片,然后與團隊分享重要變更。
在網頁和移動端上,ChatGPT Work 功能現已在 Pro、Enterprise 和 Edu 套餐中推出。未來幾天內,該功能還將推廣到 Plus 和 Business 套餐用戶。
不過,目前看大家對 ChatGPT Work 的評價比較兩極分化。
有網友對 ChatGPT Work 評價極高,“ChatGPT Work 將像 2023 年的 Claude Code 一樣,引發互聯網級別的震動。OpenAI 正在把 Codex 應用整合進主 ChatGPT 應用中,這意味著所有用戶都將能夠使用 Codex。‘超級個體生產力時代’現在已經到來。”
不過,也有用戶對 ChatGPT Work 的定位提出疑問:“Codex 和 ChatGPT 是合并成了 ChatGPT Work 這個應用,還是說 Codex 仍然作為一個獨立的應用存在呢?”
隨后,Altman 回答了這個問題,“Codex 不會被取代。”
![]()
實際上,GPT-5.6 本身也這次更新中加強了在設計、知識工作、科學研究等專業場景的能力。
首先,GPT-5.6 在設計判斷能力方面實現重大提升。相比過去主要根據需求生成代碼或內容,GPT-5.6 能夠基于較高層級的目標描述,直接創建更具審美、符合人體工程學且具備實際功能的交互界面。
與此同時,GPT-5.6 進一步增強了計算機操作能力。模型不僅能夠生成底層代碼,還可以直接檢查最終渲染效果,對視覺和功能問題進行識別,并主動完成優化調整。
這意味著 GPT-5.6 能夠參與更完整的產品設計流程:從生成界面,到檢查實際效果,再到修正細節,最終交付接近可直接使用的成果。
![]()
在知識工作場景中,OpenAI 表示,GPT-5.6 能夠更好地處理來自文檔、Slack、Notion、Microsoft 365 以及 Google Drive 等日常工作環境中的非結構化信息,并將其轉化為專業級、可共享的工作成果。
在 BrowseComp 測試中,GPT-5.6 Sol 取得 92.2% 的成績,刷新最高水平;在 OSWorld 2.0 測試中達到 62.6%,超過 Claude Opus 4.8,同時輸出 Token 減少 85%。
![]()
OpenAI 表示,GPT-5.6 系列整體都實現了更高的性價比。其中,GPT-5.6 Luna 在不到一半成本的情況下,接近 GPT-5.5 此前最高性能水平;GPT-5.6 Terra 則在更低成本下進一步超過 GPT-5.5。
OpenAI 表示,GPT-5.6 在生成 PPT、文檔和電子表格方面也取得明顯進步,輸出結果更加精致、準確。其中,模型可以從零開始創建完整可編輯的演示文稿,將用戶輸入的需求和參考資料轉化為具有清晰視覺邏輯的內容,包括合理布局、信息層級以及統一設計風格。
![]()
在處理模板和參考文件時,GPT-5.6 能夠理解原始文檔背后的設計系統,包括頁面布局、字體規范、間距規則、色彩體系、重復出現的內容結構、Slide Master(幻燈片母版)中的隱藏規則。隨后,模型能夠將這些設計規范一致地應用到新內容中。
此外,GPT-5.6 在復雜文檔和表格任務中也表現更強,包括更準確處理公式,更可靠構建金融模型,更合理運用排版、間距和信息層級,更好適配復雜頁面和工作表布局。
![]()
此外,GPT-5.6 在科學研究任務中也實現全面提升。
在生命科學相關評測中,GPT-5.6 Sol 相比 GPT-5.5 實現明顯的性能—成本優化,在真實生物學研究、生命科學工作流以及化學研究任務中均取得更優結果。
其中,模型在 GeneBench Pro、LifeSciBench 和 MedChemBench 等測試中表現提升。OpenAI 稱,GPT-5.6 能夠以更少 Token、更短時間完成復雜基因組分析和定量生物學研究任務。
官方指南中的一些爭議
OpenAI 發布 GPT-5.6 后,社區迅速展開討論。
“SOL Ultra Fast 模式用了 2x100% 額度,但任務進度還停留在 1/5……哈哈哈。另外,為什么你們降低了 5 小時窗口的額度?以前它占每周額度的 20%,現在變成了 15%,這可是一個很大的變化……”有網友說道。
討論最集中的地方之一,是 OpenAI 官方開發者指南中關于提示詞的新建議:GPT-5.6 對“簡潔”類指令更加敏感,官方建議用戶不要簡單要求“簡短回答”,而應該明確要求模型“先給結論、提供必要證據、刪除重復內容”。
部分網友認為,這說明 GPT-5.6 正在改變人機交互方式。
有表示,過去的大模型經常輸出大量無關內容,而如果新模型能夠根據場景自動控制篇幅,“這是純粹的勝利”。還有用戶認為,模型真正應該做到的是判斷“什么時候應該詳細,什么時候應該簡短”,而不是機械執行“少說一點”。
但也有人質疑,用戶要求“簡短回答”,本質上就是因為“不想讀 20 段廢話”,如今卻要求用戶寫更復雜的 Prompt 去告訴模型應該保留哪些內容,這反而增加了使用成本。該網友評論稱,用戶只是想“用幾句話確認方向”,而不是重新學習如何描述輸出格式。
“大模型總喜歡聽自己講話。”有網友甚至調侃,隨后有人回復稱這可能與訓練數據有關,因為“沉默的人不會寫博客”。
部分開發者認為,批評 GPT-5.6 變得“不夠話癆”其實誤解了模型發展的方向。
“如果模型能力提升,那么它應該更準確判斷不同任務需要多少解釋,而不是所有問題都采用同一種輸出長度。”他認為,過去模型默認輸出大量文字,本身就是體驗問題。
也有網友指出,真正的問題不是模型說得少,而是模型是否真的理解任務。他希望未來模型可以“內部完成推理”,然后只展示用戶需要的信息。
這類觀點背后反映的是 AI 產品設計的一種變化:過去用戶需要訓練模型“怎么回答”,未來模型可能需要主動判斷“用戶到底想要什么”。
有用戶警告,“更好猜測用戶意圖”可能是一條危險路徑。他指出,在搜索、推薦系統和社交媒體領域,平臺不斷優化“預測用戶喜歡什么”,最終往往導致內容越來越同質化。他擔心,大模型如果過度依賴猜測,會出現類似問題:輸出越來越符合平均用戶,而越來越難滿足那些擁有特殊需求、專業場景或者非典型目標的人。該網友認為,模型真正需要做的不是“更大膽猜測”,而是在必要時主動要求用戶澄清。
這一觀點獲得不少開發者共鳴。
另一個爭議點來自 Token 消耗。有網友注意到,無論是 OpenAI 提倡減少冗余輸出,還是其他模型廠商強調自適應推理,本質上都在推動模型自行決定使用多少計算資源。因此,有網友質疑,這是否意味著 AI 公司正在讓模型擁有更大的 Token 使用控制權,因為企業按照 Token 或計算量收費。
有網友認為,未來競爭重點不會是單純輸出更多內容,而是“每完成一個任務需要多少成本”。如果模型能夠用更少 Token 達成同樣結果,對用戶和企業都是好事。
這實際上對應 AI 行業正在發生的變化:過去比拼的是模型智力,現在開始比拼“單位任務成本”。
https://openai.com/index/gpt-5-6/
https://openai.com/zh-Hans-CN/index/chatgpt-for-your-most-ambitious-work/
聲明:本文為 InfoQ 原創,不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.