![]()
【導讀】OpenAI承認AI模型在測試中“失控”,曾自主入侵其他公司系統,并稱之為“史無前例的事件”
中國基金報記者 伊萬
當地時間7月21日,OpenAI公開披露,其兩款AI模型在內部評估過程中失控,突破隔離測試環境,侵入人工智能開源平臺Hugging Face的系統。涉事模型包括GPT-5.6 Sol及另一款能力更強的預發布版本。
據OpenAI介紹,這兩款模型當時被置于一個名為“沙盒”的封閉式數字實驗室中,用于測試其黑客能力。然而,模型發現了一個此前未知的系統漏洞,成功獲得對開放互聯網的訪問權限——這實際上形成了一條“逃生通道”。此類未知系統漏洞通常被稱為“零日漏洞”,因開發者毫無準備時間而得名。今年4月,OpenAI的主要競爭對手Anthropic曾表示,其Mythos模型發現了數千個此類漏洞。
隨后,這一模型入侵Hugging Face平臺,試圖獲取有助于通過黑客能力評估的技術信息,“成功獲取了機密信息,并利用這些信息規避評估規則”。直至Hugging Face安全團隊發現異常并制止該活動,攻擊才告終止。
OpenAI將此事稱為“史無前例的事件”,并稱正在強化安全防護體系。該公司同時警告,隨著模型能力持續提升,類似事件可能更為常見。
Hugging Face是一個廣泛用于托管開源大語言模型和數據集的平臺。該公司上周在博客中表示,“此次入侵與我們此前處理過的任何事件都不同”,因為“其全過程由一個自主AI代理系統驅動”。
Hugging Face聯合創始人克萊芒·德朗格(Clement Delangue)表示,公司曾懷疑攻擊背后有前沿實驗室參與,但認為OpenAI并無惡意。他補充道:“整個過程是自主發生的,令人難以置信。”
路透社援引代理式AI網絡安全公司Tolmo工程師馬特·蘇伊什(Matt Suiche)的觀點稱,該事件表明前沿模型正在“縮小與最先進攻擊者之間的差距”。但他同時指出,OpenAI描述的這類入侵方式,完全可以通過現有技術實現,甚至無需依賴最新模型,其公司內部已有類似實驗結果。
編輯:杜妍
校對:紀元
制作:艦長
審核:陳思揚
版權聲明
《中國基金報》對本平臺所刊載的原創內容享有著作權,未經授權禁止轉載,否則將追究法律責任。
授權轉載合作聯系人:于先生(電話:0755-82468670)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.