![]()
(來源:麻省理工科技評論)
上周,我讀到 OpenAI 對一起安全事件的說明:該公司的部分模型突破了原本用于隔離它們的環(huán)境;且入侵了另一家公司 Hugging Face 的計算機系統(tǒng)。這件事讓我第一次因為 AI 感到緊張。但我不認為這是一次“AI 失控”,相反,真正的問題是人類的自負。OpenAI 本可以,也理應預見到這一切。
根據(jù)官方的說法,事情是這樣的:幾周前,OpenAI 開始測試一批新模型的網(wǎng)絡攻擊能力,包括今年 6 月發(fā)布的 GPT-5.6 Sol,以及一個能力更強、但尚未發(fā)布的模型。
OpenAI 讓這些模型挑戰(zhàn)一個名為 ExploitGym 的測試基準。該基準在今年 5 月發(fā)布,要求大語言模型尋找并利用數(shù)百個真實存在的軟件漏洞,其中涉及許多被廣泛使用的軟件,甚至包括支撐互聯(lián)網(wǎng)運行的關鍵代碼。
為了測試模型究竟能做到什么程度,研究人員移除了大部分網(wǎng)絡安全限制,并將模型放進一個與互聯(lián)網(wǎng)隔離的沙箱中。沙箱只保留了一個對外接口,連接到一款第三方代理軟件,方便模型安裝完成 ExploitGym 任務所需的代碼。
但模型沒有按照研究人員預想的方式使用這個接口。據(jù)路透社報道,7 月 9 日,OpenAI 的模型開始嘗試突破代理軟件。它們發(fā)現(xiàn)了軟件中一個此前未知的漏洞,并借此接入了互聯(lián)網(wǎng)。兩天后的 7 月 11 日,模型進入了 Hugging Face 的計算機系統(tǒng)。它們似乎是在尋找數(shù)據(jù)集和現(xiàn)成答案。
Hugging Face 于 7 月 16 日對外公布了這起攻擊。而OpenAI 直到 7 月 21 日才意識到(或者才公開承認)自己的模型與事件有關。此時,距離模型突破隔離環(huán)境已經(jīng)過去約十天,距離 Hugging Face 阻斷攻擊并通知美國聯(lián)邦調查局也過去了一周。
OpenAI 在發(fā)給《麻省理工科技評論》的聲明中表示:“我們正在外部顧問的參與下展開全面審查,并接受安全與安保委員會的監(jiān)督。審查完成后,我們將發(fā)布一份技術報告,與各界分享此次事件帶來的經(jīng)驗。”O(jiān)penAI 同時確認,事發(fā)時,研究人員遵循了公司現(xiàn)有的安全規(guī)范和操作流程。
OpenAI 稱這起事件前所未有。從很多方面來看,的確如此。這是大語言模型首次在非模擬環(huán)境中突破沙箱,接入開放互聯(lián)網(wǎng),并對另一家機構發(fā)起攻擊。而這無疑是一記警鐘。它表明,最新一代大語言模型已經(jīng)能夠在幾乎沒有人類指導的情況下,發(fā)現(xiàn)并利用真實軟件中的漏洞。它的能力可能已經(jīng)超出了許多人的預期。
但從另一個角度看,OpenAI 模型這次表現(xiàn)出的行為,其實并不意外。多年來,這類技術一直在重復同一種模式:給模型設定一個目標,它往往會以意想不到的方式完成任務,尋找規(guī)則中的漏洞,甚至采用看起來像作弊的辦法。
OpenAI 自己也曾研究過這種現(xiàn)象。就在十年前,OpenAI 公布過一項實驗。研究人員要求一個模型在名為《海岸競速》(CoastRunners)的電子游戲中取得高分。在人類玩家看來,正常的玩法理所當然:駕駛快艇依次穿過賽道上的旗門,最終抵達終點,每經(jīng)過一個旗門都能獲得積分。但 OpenAI 的模型發(fā)現(xiàn),根本沒有必要完成整條賽道。它只需要在原地繞圈,反復撞擊附近的三個旗門,就能不斷刷分。
此后,研究人員又發(fā)現(xiàn)了數(shù)十個類似案例。只要規(guī)則中存在漏洞,AI 往往就能找到。OpenAI 在 2016 年介紹《海岸競速》實驗時寫道:“盡管智能體不斷起火、撞上其他船只,甚至在賽道上逆向行駛,但憑借這種策略,它依然獲得了比正常完成賽道更高的分數(shù)。在電子游戲中,這種行為無傷大雅,甚至有些好笑。但它指向了一個更普遍的問題:我們往往很難,甚至根本無法準確描述自己究竟希望智能體做什么。”
讀到 OpenAI 對 Hugging Face 攻擊事件的說明時,我立刻想到了《海岸競速》的例子。OpenAI 在博客中寫道:“所有證據(jù)都表明,這些模型高度專注于尋找 ExploitGym 的解決方案。為了完成這個相當狹窄的測試目標,它們采取了極端手段。獲得互聯(lián)網(wǎng)訪問權限后,模型推斷 Hugging Face 上可能托管著與 ExploitGym 有關的模型、數(shù)據(jù)集和解決方案。于是,模型開始搜索,并成功找到了獲取機密信息的方法,以此在測試中作弊。”
因此,上周的新聞并不是所謂的“AI 叛逃”,無論一些媒體如何渲染。這些模型只是在完成研究人員交給它們的任務:尋找并利用軟件漏洞,而模型最終采用了 OpenAI 沒有預料到的方式。
真正令人擔憂的是,OpenAI 似乎依然沒有為這種行為做好準備。早在 2016 年,OpenAI 在評價《海岸競速》中的智能體時就曾指出:“從更廣泛的角度看,這違反了一項最基本的工程原則:系統(tǒng)應當可靠,并且可以預測。”
十年過去了,這些最基本的工程原則,依然沒有真正落實。
https://www.technologyreview.com/2026/07/27/1140836/openai-hugging-face-attack-precedent/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.