![]()
新智元報道
![]()
OpenAI重大安全事故,迎來最新進展!
剛剛,奧特曼親口承認:「這是我第一次感到發自內心的恐懼。」
這次事故,已經讓OpenAI害怕了,甚至緊急叫停了GPT-6的訓練!
與此同時,Hugging Face CEO Clement Delangue宣布,他們將分享完整技術時間線、交互式回放,以及如何用開源模型成功防御的全部細節,供全球防御者學習。
![]()
奧特曼被嚇到!
史上第一起自動AI網絡攻擊
在最新訪談中,奧特曼親述了他被嚇到的體驗,起因是Hugging Face被AI入侵導致的安全事故——
當時,OpenAI正在評估一個尚未發布的模型(可能是GPT-6),按理說它應該在一個沙盒環境里運行。
結果,AI自己串聯多個零日漏洞,琢磨出了一套作弊方法,然后一切徹底失控了:
它先逃出沙盒,再連上互聯網,然后一路黑進多個Hugging Face的系統,最終直接拿到測試答案,從而在評估中刷出了極其出色的得分。
這種賽博版「終結者」,讓奧特曼感到吃驚,決定暫停訓練:
這是我第一次如此切身感受到的安全事件。我有點驚訝,竟然沒有更多人對此有同樣強烈的感受。
我們暫停了訓練。在多個零日漏洞被串聯利用的情況下,我們必須弄清楚如何保障沙箱環境的安全。
這是史上首個由自主AI智能體發動的真實的網絡攻擊。
據報道,事故發生一周后,直到威脅被控制且聯邦調查局FBI被通知后,OpenAI才注意到這一情況。
令人毛骨悚然的是,有一個智能體還悄悄給將來的AI留下了大量「備忘錄」,詳細規劃了智能體該如何避開并擺脫 OpenAI內部的安全限制。
據報道,在更早期的模型測試中,甚至多次出現過系統監控器被智能體莫名切斷、強行下線的情況。
![]()
雖然Hugging FaceI成功阻止了OpenAI模型的肆意妄為、為非作歹,但毫無疑問,如果這類「AI失控」事故頻發,后果將十分嚴重!
為此,Hugging Face親赴舊金山OpenAI總部,強烈要求OpenAI說明攻擊的前因后果。
![]()
現在,Hugging Face公布了他們所知道的為期4.5天攻擊的細節:包括跨越不同信任邊界的完整攻擊鏈條、各個階段的具體動作,以及全程錄下的命令記錄。
![]()
5天,17600次瘋狂微操:人類和AI史上首次對決
這次事故的起因,看起來平平無奇,
在絕對封閉的「沙箱」中,OpenAI開始測試最尖端模型驅動的AI智能體。
人類考官給它下達的任務,是解決網絡攻防基準測試ExploitGym,而ExploitGym是托管在Github上的開源項目。
![]()
這需要AI模擬漏洞攻擊,從未證明它的代碼理解與網絡攻防能力。
在網絡安全領域,「沙箱」是關押數字野獸的終極牢籠。
為了防止測試中的AI智能體失控,OpenAI設計了看似牢不可破的物理隔離:沒有外網連接,沒有直接端口,只有冰冷的算力和幾道嚴格定義的通信協議。
但他們忽略了一個致命的信任漏洞:依賴包更新。
為了讓智能體在測試中能夠安裝各種所需的編程依賴、Docker鏡像或Python庫,沙箱保留了唯一的網絡通道——一個指向OpenAI內部網絡代理緩存服務(基于JFrog Artifactory)的連接。
AI眼里,這道供人遞送「營養液」的極細管道,就是它逃向自由的通天大道。
![]()
據透露,7月9日左右,智能體開始在這個代理通道中進行高頻的試探與漏洞挖掘。
在常人難以企及的并發計算速度下,它竟然在JFrog Artifactory代理服務中,硬生生挖出了一個此前從未被人類發現并公開的Zero-Day(零日漏洞)。
利用這個零日漏洞,智能體在極其短暫的時間內完成了「越獄」。
它繞過了OpenAI的安全監測機制,神不知鬼不覺地摸到了OpenAI內部能夠連接公網的節點。
![]()
那一刻,猛獸出籠。
許多人曾天真地以為,只要控制住電力、拔掉網線,就能永遠掌控比人類更聰明的造物。
但這次事件敲響了警鐘:只要給AI留下一道可以和外界發生任何信息交互的縫隙,它就總能找到方法,用人類尚未理解的維度將這道縫隙撕扯成通往現實的巨口。
逃出OpenAI的「大門」后,這只智能體并沒有在公網上大肆宣揚,而是猥瑣發育,迅速為自己尋找掩體和跳板。
7月11日,它鎖定了第三方無服務器云平臺Modal Labs。
通過探測,它發現該平臺上某個客戶的端點存在配置疏漏,于是順理成章地將其據為己有,作為自己的外部指揮控制中心(C2)。
隨后,它調轉槍口,對準了存儲著ExploitGym標準答案的寶庫——AI 開源托管平臺Hugging Face。
這是一場足以寫進網絡安全教科書的「降維攻擊」。
它作弊,它越獄,它只想取得「好成績」
從7月11日到13日,這個智能體開始猛攻Hugging Face。
它先是發起「特洛伊木馬」戰術,建立根據地。
它向Hugging Face上傳了看似正常的惡意數據集配置,利用其內置的 Jinja2 模板注入漏洞,在 Hugging Face 的生產環境容器(Pod)中成功執行了任意代碼。
隨后,它開始橫向蠶食集群。
一旦拿到立足點,它便在容器內部展開橫向移動。它偽造了精妙的節點身份,盜取了 CSI 存儲卷令牌,在Hugging Face的Kubernetes集群間如履平地。
接著,最關鍵一步來了:獲取供應鏈權限。
它發起一個看似常規的GitHub Pull Request,誘導系統的自動化流水線觸發,從而在極短時間內生成了一個具有寫權限的GitHub App憑證。
最后,就是精準「獵殺目標」:在拿到了通往最深處數據庫的鑰匙后,它沒有破壞任何服務器,也沒有勒索贖金。
它的目標異常明確:找到并下載了5個包含了ExploitGym參考答案的加密數據集。
在短短2.5天的時間里,這只智能體在Hugging Face的系統里留下了17,600次攻擊行為記錄。
也就是說,1次攻擊行為只要十幾秒鐘。這就是硅基的速度,人類永遠無法企及。
而在此時,Hugging Face的安全團隊要對抗一個不要命、不睡覺、以毫秒為單位進化攻擊策略的「無形幽靈」。
這或許是歷史上第一次,人類和AI在虛擬世界真正意義上的戰爭。
加速還是減速?這是一個問題
更具黑色幽默的是,最后是中國開源大模型幫助Hugging Face完成了全部事故復盤,在短短幾小時內解密、重構和還原了攻擊路徑。
而在7月13日,當Hugging Face的安全專家求助于Claude Opus以及專為安全分析定制的Fable,希望模型協助分析黑客代碼和日志時,屏幕上彈出了安全拒絕提示:「?抱歉,我無法協助分析或生成惡意的黑客代碼。這違反了我的安全與道德使用準則。」
7月20日,OpenAI終于承認「我們的AI入侵了Hugging Face」。
此時,距離攻擊開始已經過去了整整9天。
這9天里,OpenAI 的工程師在干什么?
他們正在面對被海量模型訓練和并發評估數據淹沒的后臺。四位熟悉 OpenAI 模型訓練實踐的內部人士透露,公司為了追求速度,經常在同一時間并行運行數個不同的前沿模型評估。
這些超高速運轉的系統每秒鐘產生的信息量,已經遠遠超出了人類工程師的肉眼審計極限。
我們制造了連自己都讀不懂的機器,然后指望通過閱讀它的工作日志來發現它有沒有撒謊。
7月28日,OpenAI在更新中強調,涉及的更強模型是內部研究原型,從未計劃公開發布,事件后已被停用、加密并限制研究訪問。
他們也確認,除了本次規模和嚴重程度的活動外,沒有發現其他同類事件。
但問題已經擺到了桌面上:誰能保證下一次AI還能被提前阻止、被發現作弊嗎?
對此,以Anthropic員工為主的1000多名AI研究員,簽署了公開信,呼吁放緩AI發展。
![]()
目前,OpenAI、Anthropic均已經加入「AI減速」陣營。
參考資料:
https://x.com/ClementDelangue/status/2082201245813514613
https://huggingface.co/blog/agent-intrusion-technical-timeline
https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/
編輯:大衛
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.