昨晚,科技圈剛上演了一場開源 AI 大團建。
英偉達創始人黃仁勛在社交媒體發表公開信,拉上 Meta、微軟等科技巨頭/機構,為開源模型鼓勁打氣。但眼尖的網友很快發現,Anthropic、OpenAI 和 Google 都沒有簽字。
![]()
幾家公司的缺席,很容易被外界解讀為 AI 陣營之間的又一次分野。而就在剛剛,Anthropic 也正式發布了新的閉源模型 Claude Opus 5,也讓這種矛盾擺在明面上。
它沒有講太多宏大敘事,賣點相當務實:性能逼近 Fable 5,價格卻只有后者的一半,頗有幾分丐版的價格,享受準頂配服務的意思。
![]()
在 Frontier-Bench、GDPval-AA 等編程和知識工作評測中,Opus 5 已經登上榜首。少數沒有拿下的項目集中在網絡安全領域,目前仍落后于能力更強的 Mythos 5。
比起單純談論 Opus 5 的紙面參數,在官方宣傳之外,它到底強在哪、以及「半價旗艦」有沒有隱藏代價,才是我們更值得關注的部分。
![]()
Fable 5 的性能,Opus 4.8 的價格
Anthropic 此次重點強調了一個概念:effort,也就是思考檔位。
用戶可以自行調節。需要更強的推理能力,就把檔位調高;更在意速度、價格和 token 消耗,就降低檔位。官方公布的大部分成績,都是在不同 effort 設置下測出來的。
軟件工程是 Opus 5 表現最突出的領域。
在 Anthropic 內部的 Frontier-Bench v0.1 測試中,Opus 5 超過了所有參測模型。性能相比 Opus 4.8 提升一倍以上,完成單項任務的成本反而更低。
![]()
CursorBench 3.2 上,開啟 max effort 后,Opus 5 與旗艦 Fable 5 的最高分只差 0.5%,成本卻只有后者的一半。
![]()
在 high、xhigh 和 max 幾個高檔位中,同樣的預算下,Opus 5 得分也超過了所有其他模型。大致可以理解為,花一半的錢,完成接近 99% 的工作。
知識工作和復雜解題上,Opus 5 延續了類似表現。
ARC-AGI 3 主要測試模型處理陌生問題的能力。面對訓練中沒有見過的新任務,Opus 5 的得分達到第二名的三倍。
![]()
Zapier AutomationBench 考察模型能否從頭到尾完成一項商業任務。Opus 5 的任務通過率,大約是同等成本下第二名的 1.5 倍。即使只開啟最低 effort 檔位,它完成的任務數量也超過所有其他模型。
在 OSWorld 2.0 電腦操作測試中,Opus 5 用略高于三分之一的成本,就超過了 Fable 5 的最好成績。
![]()
GDPval-AA v2、HLE 和 DeepSearchQA 等評測里,它也成了 Anthropic 模型中兼顧性能和成本的最佳選擇。
科學研究能力同樣有所提升。
在生命科學的每一項評測中,Opus 5 都超過了 Opus 4.8,覆蓋結構生物學、有機化學、生物信息學等方向。
提升幅度最大的是有機化學。例如,根據光譜數據推斷分子結構,Opus 5 比 Opus 4.8 高出 10.2 個百分點;預測蛋白質序列變異對功能的影響,高出 7.7 個百分點。
不過,官方跑分表里也出現了一個小插曲。
在最初發布的對比圖中,FrontierCode v1.1 一欄將 Opus 5 的 53.4% 加粗標記為最高分,而旁邊另一款模型的成績明明是 53.5%。被網友抓包后,目前官網已經更換了圖片,將標記恢復正常。
![]()
類似場面并不陌生。OpenAI 此前也曾在圖表制作上出錯,縱軸比例與實際數據不一致,導致柱狀圖呈現出誤導性的視覺效果。
![]()
只能說,「世界是個巨大的草臺班子」這句話的含金量還在繼續上升。換個角度看,或許從制圖者制圖的那一刻開始,就已經帶有先入為主的心態。
當 AI 模型開始主動驗證自己
Anthropic 反復強調 Opus 5 的一種能力:遇到復雜任務時,它會主動驗證自己的結果。一次沒有成功,就重新檢查、調整方案,再次嘗試,直到任務完成。
官方測試給出了幾個代表性案例。
面對機械零件圖紙,Opus 5 在沒有視覺工具的情況下,自行編寫算法并完成 3D 重建;修復開源項目 bug 時,它找到了社區補丁遺漏的邊界問題;搭建交易所行情接口時,它還自己生成模擬數據驗證代碼。
模型開放之后,社區也照例先玩了一圈。
![]()
沃頓商學院教授 Ethan Mollick 提前獲得了使用權限。他的評價相對克制:短任務中,Opus 5 可以追平甚至超過 Fable 級模型;面對長時間、復雜度更高的任務時,它顯得少了一點「雄心」,最終交付的完整度仍有差距。
盡管如此,他還是用 Opus 5 替換了此前長期使用的 Opus 4.8,因為新模型在整體能力上明顯更強。
唯一讓他不太滿意的是,Opus 5 繼承了 Fable 的部分語言習慣,比如對高密度表達的異常偏好,以及一股很明顯的「Fable 味」。
![]()
比如他讓 Opus 5 制作了一個哥特風格著色器,還生成了一款可以在山寨中土世界修建鐵路的游戲。
![]()
還有網友 Chetaslua 用它制作了一套阿波羅登月模擬,全部內容由程序生成。
![]()
Harshith 留下一句「Opus 5 max 簡直逆天」的評價,隨后展示了一架帶有帝國風格雙離子引擎的星際戰斗機。
![]()
再比如網友 Charlie Hills 轉發的官方案例:用 Opus 5 搭建出了一套可以實際運行的風洞模擬系統,能夠將空氣流過物體表面的過程進行可視化。
![]()
更安全,也同樣會回退到 Opus 4.8
技術能力之外,Anthropic 此次也花了大量篇幅討論安全問題。
自動化行為審計結果顯示,Opus 5 是 Anthropic 目前行為最符合預期的模型。
與 Opus 4.8、Sonnet 5 和 Fable 5 相比,它對 Claude 行為準則的遵循程度更高,欺騙行為更少,也更難被誘導執行危險操作。
![]()
面對可能造成不可逆后果的任務時,它也更傾向于先檢查風險,再采取行動。
Opus 5 的整體失準行為得分為 2.3,是 Anthropic 近期模型中的最低值。在生物研究和攻擊性網絡安全任務中,它依然落后于能力更強的 Mythos 5。
網絡安全部分尤其值得關注。
Anthropic 表示,與 Opus 4.8 一樣,沒有專門使用網絡攻擊任務訓練 Opus 5。但隨著模型綜合能力提升,它發現漏洞的水平已經逐漸逼近 Mythos 5。發現漏洞與將漏洞轉化為真實攻擊工具,仍然存在明顯差距。
![]()
簡言之,Opus 5 已經能夠判斷一把鎖存在什么問題,但距離真正撬開它還有很遠。
Anthropic 使用 OSS-Fuzz 評測展示了這種差異。在漏洞發現任務中,Opus 5 與 Mythos 5 接近;到了編寫漏洞利用代碼的階段,成績便明顯落后。
基于這一風險邊界,Opus 5 會對網絡安全請求進行額外審核。一旦請求涉及高風險攻擊行為并觸發安全限制,系統會將任務回退到 Opus 4.8 處理。
沒錯,又是 Opus 4.8。
![]()
今天起,Opus 5 已在所有平臺同步上線。API 模型名稱為 claude-opus-5。價格方面,每百萬輸入 token 為 5 美元,每百萬輸出 token 為 25 美元,與 Opus 4.8 完全相同。
![]()
https://platform.claude.com/docs/en/about-claude/pricing
需要更快響應速度的用戶還可以開啟 Fast 模式,推理速度約為默認模式的 2.5 倍,價格則提高至兩倍。
在 Claude Platform 上,Fast 模式按照基礎價格的兩倍計費;在 Claude Code 中,則通過使用額度進行抵扣。計費規則與 Opus 4.8 時期保持一致。
伴隨模型發布的,還有兩個仍處于 beta 階段的更新。
第一項更新面向 Claude Platform。開發者可以在對話進行過程中,動態修改 Claude 能夠使用的工具,同時不會導致 prompt 緩存失效。
第二項更新是 API 自動回落機制。
開發者可以選擇將被安全分類器攔截的請求,自動轉交給其他模型處理。開啟后,請求默認會交給當前可用的最強模型,數據保留方面,Opus 5 延續了以往 Opus 系列的規則,普通訪問沒有強制數據保留要求。
聰明反被「規矩」誤
此次發布中,還有一個頗為反直覺的經驗,來自 Anthropic 工程師 Thariq Shihipar。
團隊發現,為 Claude 5 系列編寫指令時,可以大幅減少系統提示詞。Claude Code 的系統提示詞被刪除了 80% 以上,編程評測成績卻沒有出現可測量的下降。
Thariq 隨后總結了幾條過去被廣泛采用、如今可能已經過時的提示詞規則。
![]()
https://x.com/trq212/status/2080710971228918066
過去強調給 Claude 制定詳細規則,如今更傾向于讓 Claude 根據上下文自行判斷。例如,舊版系統提示詞會明確規定「默認不要編寫注釋」。面對復雜代碼時,這條規則很容易產生問題。
新版本只保留一句要求:生成的代碼應當融入周圍代碼,注釋密度、命名方式和整體風格都參考現有項目。
過去強調提供示例,如今更重視接口設計。
Anthropic 發現,示例有時會限制模型的探索范圍。相比之下,將工具參數設計得更能準確表達意圖,效果反而更好。
過去習慣一次性提供全部信息,如今更提倡按需加載,也就是 progressive disclosure。暫時用不到的代碼審查和驗證流程,會被放進獨立 skill 中,需要時再調用。
![]()
過去傾向于反復強調關鍵要求,如今只要工具說明足夠清楚,寫一次通常已經足夠,沒有必要在系統提示詞中重復。模型能力提高后,許多原本用于限制錯誤行為的繁復規則,逐漸變成了新的約束。
Anthropic 還為此推出了一個名為 claude doctor 的命令。用戶在 Claude Code 中輸入 /doctor,系統便會自動檢查過度臃腫的 skill 和 CLAUDE.md 文件,并給出精簡建議。
從事無巨細地教模型做事,到逐漸將判斷權交給模型,或許才是 Opus 5 此次發布中最值得留意的變化。而當模型越來越聰明,人類寫下的那些「經驗」,反倒可能成為它首先需要擺脫的包袱。
附上參考地址:
https://www.anthropic.com/news/claude-opus-5
https://support.claude.com/en/articles/16049681-why-claude-switched-models-in-your-conversation-with-opus-5
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
我們正在招募伙伴
簡歷投遞郵箱hr@ifanr.com
?? 郵件標題「姓名+崗位名稱」(請隨簡歷附上項目/作品或相關鏈接)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.