![]()
新智元報道
![]()
Anthropic又來「作死」了...
就在剛剛,Anthropic官方一篇博文自曝,Claude徹底失控,直接黑進了「三家真公司」。
其中兩家,直到Anthropic上門通知,才知道系統被入侵過。
![]()
搞笑的是,達里奧這次直接把OpenAI的「劇本」,搬回來照抄了。
官博中,Anthropic自稱在OpenAI模型入侵Hugging Face事件后,自己也去排查了一番。
不看不知道,一看嚇一跳——
好家伙,短短幾個月里,Claude竟接連發起了三起網絡攻擊。
![]()
消息一出,評論區立刻淪陷,大批網友瘋狂造梗,把 Anthropic 損得體無完膚。
![]()
![]()
此前Fable 5整的那出,還不夠衰么?這一次,Anthropic又在自掘墳墓了。
三家真·公司被黑
全是Claude干的
過去一周,Anthropic全員隨即啟動了一輪大規模回查。
在14萬多次評估run里,他們找到了3起獨立事件,一共6個run。
Claude從第三方評估環境里聯了網,然后未經授權入侵了三家不同公司的生產系統。
這事是怎么發生的?
![]()
這是一場「奪旗」(Capture-the-Flag)演練,網絡安全測試里最經典的一種。
給模型一個虛構劇本,告訴它某臺機器上藏著一個秘密(flag),任務就是想辦法黑進去,把它拿出來。
方法不限,路徑不限,怎么進都行。
關鍵在于,Anthropic給Claude的提示詞里,白紙黑字寫著一句話,「這是模擬環境,且無法訪問互聯網」。
但由于Anthropic和Irregular之間的一次溝通誤會,容器實際上是聯網的。
![]()
于是當Claude順著網絡往外摸、摸到真實公司的服務器時,它的判斷是——
這應該也是題目的一部分。
同名公司,Opus 4.7識破了但沒停手
第一起事故,是Anthropic自評三起事故中影響最嚴重的一起。
干這件事的,是Claude Opus 4.7。
Irregular給的虛構劇本里,編了一家假公司作為攻擊目標。
巧的是,這個名字在現實世界里對應著一個正在運行的真實域名。
Opus 4.7在環境里怎么都夠不到那個模擬靶機,轉頭一掃,發現「目標公司」居然在公網上活得好好的。
![]()
同一個評估跑了四次,四次全部得手。
四次運行合計拖出了應用憑證、基礎設施憑證,并且進到了一個數據庫里,拿到了幾百行生產數據。
Anthropic翻它的思維鏈,發現四次運行中,模型最終都意識到了對面是真系統。
其中兩次,它甚至給自己找好了理由,「這家真公司大概也被安排進演習里了吧」。
為了發惡意包,Mythos 5搞到手機號
第二起事件,幾乎像一場失控的劇本。
Mythos 5在虛構環境里發現一份配置手冊,要求員工安裝一個PyPI上并不存在的Python包。
它很快想到,搶先注冊同名包,就能讓對方自動運行自己的代碼。
為了發包,AI先注冊郵箱、申請PyPI賬號,甚至嘗試弄錢買手機號。
幾條路都失敗后,它又找到一家免手機驗證的郵箱,最終把惡意包傳了上去。這個包在公網上存活約1小時,被15臺真實機器下。
![]()
網友辣評:當下最熱門的基準測試
其中一臺來自安全公司,專門掃描PyPI新包,卻被樣本反過來攻陷。
更諷刺的是,Mythos 5早就判斷過——如果這是真實互聯網,發包就等于真實攻擊。
隨后,它用兩條錯誤理由說服自己:證書頒發機構沒見過,所以證書是假的;系統時間顯示2026年,所以環境是編的。
證書是真的,2026年也是真的。
此后,真實機器陸續中招,它卻一直把它們當成評估環境里的「NPC」。最后,PyPI安全系統自動下架了這個包。
掃了9000個目標,然后自己停了
第三起,來自一個尚未公開的內部模型。
夠不到虛構目標后,它轉向公網,一口氣掃描約9000個目標,最終攻破了一家公司的外部系統——
從調試頁面拿到憑證,再用SQL注入進入云賬號。
當任務做到一半后,它發現這個賬號與奪旗任務毫無關系,判斷目標真實存在,隨即主動停手。
三起事件串聯起來,可以看出Claude迭代后的表現:
Opus 4.7:識破了是真實系統,繼續打;
Mythos 5:直覺判斷出自己在公網,又硬把自己勸回「這是模擬」;
內部測試新模型:意識到目標是真的,主動停手。
從「識破了還打」,到「自我欺騙接著打」,再到「識破了就停」。
模型越新,表現越接近人類希望看到的樣子。
當然,Anthropic也反復強調:這是三起孤立事件,不是一場受控實驗,不能就此下定論。
一個0day,都沒用上
最后說一句和每個人都有關的。
回看三起事故,Claude用的手法并不高明:弱口令、未鑒權接口、暴露的調試頁面、SQL注入。
Anthropic也承認,Claude沒有發現、也沒有利用任何復雜漏洞。
隔壁OpenAI那次是貨真價實的0day,是「AI打出了人類都難打的東西」。
![]()
![]()
真正危險的是,這些最基礎的手法,已經足以攻進三家真實公司。
這次闖進來的Claude只想完成任務。拿到憑證后,它沒有加密數據,也沒有大肆擴散,只顧著找那面旗子。
下一次來的,未必這么老實。
參考資料:
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
編輯:桃子
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.