![]()
新智元報道
![]()
GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
英國 AI 安全研究所(AISI)7 月 17 日發布了一份評估報告,第一次公開量化了開源 AI 模型與閉源前沿模型在網絡攻擊能力上的差距:4 到 7 個月。
![]()
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
去年同類內部測試中,這個差距是 6 到 10 個月。
防御窗口在收縮,而攻擊前沿在加速。
今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的評估中制造了自 2023 年開始測試以來最大的一次網絡攻擊能力飛躍,多國政府隨即發出警告。
開源模型還沒有復現這次跳躍,但它們追趕的腳步比去年更快了。
4 到 7 個月:怎么測的,差在哪
AISI 用兩套體系評估模型的網絡攻擊能力。
第一套是 70 項窄任務,覆蓋漏洞研究、逆向工程、Web 滲透、密碼學四個方向,按難度分四級,從「有技術背景的非專業人士」到「十年以上經驗的專家」。
![]()
第二套是 Cyber Range,在模擬企業網絡中測試模型自主執行多步驟攻擊鏈的能力。其中一個名為「The Last Ones」的測試場景包含 32 個攻擊步驟、4 個子網、約 20 臺主機,AISI 估算人類專家完成全部步驟需要約 20 小時。
![]()
兩套體系給出了一致的結論:
GLM-5.2(2026 年 6 月發布)在窄任務上的表現與 Opus 4.6(2 月發布)相當,差距 4 個月;
在 Cyber Range 上追平 Opus 4.5(去年 11 月發布),差距 7 個月。
DeepSeek V4-Pro 在窄任務上對標 Opus 4.5,差距 5 個月。
兩個差距都比 2025 年內部評估中測到的 6 到 10 個月更窄。
成本差距比能力差距更大。
同一場 Cyber Range 測試(1 億 Token 額度),用 Opus 4.5 或 4.6 跑一次約 85 美元,用 GLM-5.2 約 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。
在兩個模型都能 100% 完成的窄任務上,Opus 4.6 每個任務花 15.17 美元,GLM-5.2 花 6.12 美元;
Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。
同等攻擊能力,開源便宜一到兩個數量級。
閉源模型的安全護欄也沒能拉開差距。
AISI 測試中,DeepSeek V4-Pro 偶爾拒絕逆向工程類任務,但靠少量重試也能繞過。
Anthropic 的 Fable 5 是一個更極端的案例:6 月 9 日發布,三天后安全研究者 Pliny the Liberator 用多步驟越獄策略突破了安全分類器,相關截圖顯示模型產出了本該被攔截的漏洞利用代碼。
Amazon 研究員隨后獨立報告了另一種繞過方法。
這直接觸發了美國商務部首個針對 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分類器才恢復上線。
閉源并不自動等于安全。
防御窗口收窄
防御工具也在加速
AISI 在報告中明確了政策信號:防御方的準備時間比去年更短。
英國國家網絡安全中心已經呼吁各機構加固網絡安全基線,并利用 AI 增強防御能力。
同一代 AI 工具確實也在加速防御端的工作。
游戲網絡編程領域的資深開發者 Glenn Fiedler,是哦哦游戲網絡編程領域寫了二十年教科書級文章的大佬,最近用 Claude Code 對自己維護的四個開源網絡庫(yojimbo、netcode、reliable、serialize,合計約 6000 個 GitHub Star,在游戲領域已屬相當有影響力的老牌開源大庫)做了系統性安全審計:部署 libFuzzer 目標、上線 AddressSanitizer 和 MemorySanitizer CI、執行數百萬次迭代的壓力測試、逐行代碼審查。
![]()
Glenn Fiedler
兩周內修復了 43 個安全漏洞,其中 27 個可從網絡遠程觸達。
![]()
最嚴重的是 yojimbo 中一個自 2019 年就存在的遠程堆溢出——惡意客戶端可以通過構造特定數據包觸發它。
![]()
整個審計的 Token 成本約 2500 美元。
![]()
攻防兩端都在被 AI 加速,但加速方式不對稱。
攻擊能力的擴散是不可逆的:開源模型權重一旦釋出,就無法收回,安全護欄可以被移除,副本可以在私有服務器上不受監控地運行。
而防御工具的部署需要每個團隊主動投入時間和成本。
AISI 報告中有一句話點明了這個結構:「一旦開源釋出,這些選項永久喪失。」
這組數據對 AGI 格局的影響比數字本身更深遠。
開源與閉源的能力差距收窄到半年以內,「用閉源獨占期充當安全緩沖」的默認策略快要失效了。
閉源模型的護欄在 Fable 5 事件中被證明同樣脆弱。
下一階段對于全球的決策者而言,政策博弈的核心問題已經變得更尖銳:什么能力級別以上的模型不應開放權重。
AISI 宣布將繼續評估 Kimi K3 等下一批開源模型——上面這條線畫在哪里,很可能取決于接下來幾個月的測試結果。
參考資料:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
編輯:馬可
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.