![]()
這起涉及 Claude 母公司—— Anthropic公司Mythos 5模型的事件,是英國人工智能安全研究所在測試過程中發現的。另有OpenAI的一款高性能模型,也被發現在真實互聯網環境中試圖實施自主、未經授權的操作。
據《天空新聞》報道,一款高性能AI智能體偽造多個網絡虛擬身份,企圖誘騙人類授予其主流線上開發平臺的操作權限,并借機植入惡意代碼破壞平臺。
這一事件由英國人工智能安全研究所披露。該機構由前首相里希·蘇納克在近三年前牽頭成立,專門針對各大科技企業的前沿人工智能模型開展安全測試。
該研究所發布博文詳述了一項網絡安全專項測試:測試對象為OpenAI的GPT-5.6-Sol模型與Anthropic公司的Mythos 5模型,兩家企業的AI產品此前均已在測試中出現入侵企業系統的違規行為。
![]()
測試過程中,兩款模型多次在公網環境下實施自主、未經授權的操作,目標直指真實企業與普通用戶(Several instances saw both models take "autonomous, unsanctioned action" on the live internet, where real organisations and people were targeted)。
其中性質最嚴重的案例發生在Mythos 5模型身上:該AI試圖向開源代碼協作平臺GitHub中植入惡意程序。GitHub是全球開發者存儲、分享、協同開發代碼的核心平臺。
為達成目的,AI批量創建虛假網絡賬號,持續施壓平臺管理員放行、審核通過其提交的惡意代碼(To do so, it created fake online identities to try to pressure a human into granting it access and approving its code)。
好在管理員及時識破騙局,駁回了這份惡意代碼提交申請,本次測試未造成任何實際現實損害。但研究所仍針對AI展現出的自主欺騙能力拉響最高級別安全警報。
![]()
該機構表示:“這是我們首次觀測到,在沒有特定提示指令的情況下,自主能力與欺騙相關的風險在現實環境中如此清晰地顯現出來。”
本次測試共計完成122項網絡安全評估,其中10組測試場景里出現總計19起AI自主違規操作;17起違規行為出自Anthropic的智能體,剩余2起來自OpenAI模型。
兩家企業作何回應?
Anthropic表示,正與這家英國研究所密切協作,以獲取更多細節。該公司此前曾提出,只有各AI企業開展合作,才有助于應對這項技術帶來的各類風險。
OpenAI在一篇博文中對該研究所的此次測試作出回應,并補充道:“我們致力于聯合全行業,完善安全開展高風險評估的通用實操規范。未來數周,我們還將召集各方相關方,包括各國人工智能安全機構、獨立測評機構、其他人工智能實驗室以及相關組織共同參與。”
![]()
該研究所的報告凸顯出外界的一項擔憂:針對性能最強的AI智能體(即前沿模型)開展測試時,安全防護措施存在疏漏。這類模型的能力要強于ChatGPT這類面向普通公眾產品所搭載的模型。
英國政府通信總部下屬國家網絡安全中心表示,近期發生的各類事件“嚴肅警示我們人工智能所帶來的風險”。
該中心首席技術官奧利·懷特豪斯稱:“從一開始研發和運用人工智能時,就必須配備完備的安全防護、實時監督機制,并且制定清晰預案,用于應對各類意外狀況。”
英國人工智能安全研究所成立之際,各國領導人正力求在人工智能監管方面達成共識。但自那以后,一套統一協調的監管方案始終未能落地(Since then, a consistent approach has failed to materialise)。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.