![]()
本文來自微信公眾號: HavenlonLabs ,作者:HavenlonLabs
現(xiàn)在談AI安全,很多人的第一反應都是:怎樣讓模型少犯錯?
減少幻覺、優(yōu)化提示詞、防止提示詞注入、增加上下文、接入更強的模型,再用另一個Agent檢查前一個Agent。
這些工作當然有價值。
但它們?nèi)菀鬃屓水a(chǎn)生一種錯覺:只要模型足夠聰明、提示詞足夠完善、檢測系統(tǒng)足夠復雜,AI就可以安全地完成一切。
問題是,AI真的可能永遠正確嗎?
答案恐怕是否定的。
我們無法消滅所有錯誤
AI Agent面對的不是一道標準答案明確的考試題,而是不斷變化的現(xiàn)實環(huán)境。
它讀取的郵件可能是偽造的,訪問的網(wǎng)頁可能包含惡意指令,接收到的數(shù)據(jù)可能已經(jīng)被污染,用戶給出的任務也可能存在歧義。
即使模型本身沒有受到攻擊,它也可能誤解目標、遺漏條件,或者基于不完整的信息作出一個看起來合理的決定。
我們可以持續(xù)提高模型的準確率,卻很難證明它在下一次任務中一定不會犯錯。
試圖讓AI永遠正確,是在追求一個無法驗證的目標;阻止危險結果發(fā)生,才是一條可以真正落地的邊界。
真正的問題不是AI會不會犯錯。
它一定會。
真正的問題是:當它犯錯以后,系統(tǒng)是否會毫無阻礙地把這個錯誤執(zhí)行出去。
模型錯誤不一定等于現(xiàn)實損失
一個AI在聊天窗口里回答錯誤,造成的可能只是一次糟糕的體驗。
但當同一個AI拿到支付接口、管理員權限、數(shù)據(jù)庫寫入權限和服務器控制權以后,錯誤的性質就完全不同了。
它可能把錢轉給錯誤的地址,刪除重要數(shù)據(jù),修改生產(chǎn)環(huán)境,擴大成員權限,或者關閉本應保留的審計記錄。
模型只是產(chǎn)生了一個錯誤判斷。
真正把錯誤變成事故的,是后面的執(zhí)行能力。
模型犯錯只是答案錯了,執(zhí)行失控才是真的出事。
這也是為什么,AI安全不能只盯著模型內(nèi)部。
我們當然要防提示詞注入,要提高推理能力,也要檢測惡意輸入。但即使前面的所有防線都失效了,系統(tǒng)仍然應該保留一道最后的底線。
這道底線不負責判斷AI為什么犯錯。
它只負責確認:這件事到底能不能發(fā)生。
守住錢袋子,比猜出所有騙子更現(xiàn)實
假設一個AI Agent正在替企業(yè)處理付款。
我們可以訓練它識別詐騙郵件,可以要求它核對合同,可以增加一個模型復核收款信息。
但我們無法保證它永遠認得騙子。
騙子會改變話術,郵件賬號可能被入侵,真實員工也可能被冒充。即使多個模型同時參與判斷,它們?nèi)钥赡芑谕环蒎e誤信息得出相同結論。
更現(xiàn)實的做法,是直接守住付款的底線:
單筆金額不能超過限制;新收款地址不能立即付款;審批后收款目標不能被替換;超出風險閾值必須經(jīng)過獨立確認;任何遠程管理員都不能臨時關閉這些規(guī)則。
這樣,即使AI被欺騙,損失仍然會被限制。
你不需要保證AI永遠認得騙子,只需要保證騙子無法輕易帶走你的錢。
這就是大道至簡。
前面可以有復雜的模型、提示詞、工作流和檢測系統(tǒng)。
最后只需要一條明確的邊界:
不符合條件,就不執(zhí)行。
最后的系統(tǒng)不必比AI更聰明
很多人認為,保護AI的安全系統(tǒng)也應該是一套更強大的AI。
但位于最后一道邊界的系統(tǒng),未必需要理解自然語言,也不需要參與復雜推理。
它只需要知道幾個確定事實:
這次操作要轉多少錢,目標是誰,權限是否發(fā)生變化,數(shù)據(jù)是否可以恢復,風險條件有沒有超限。
這些事實不滿足,就拒絕。
安全不一定要比風險更聰明,它只需要守住風險最終必須經(jīng)過的那道門。
越靠近最終執(zhí)行,系統(tǒng)反而越應該簡單、獨立和保守。
因為復雜意味著更多配置、更多依賴、更多攻擊面,也意味著系統(tǒng)可能被前面的同一套錯誤邏輯同時影響。
真正的最后防線,不應該和Agent使用同一個提示詞、同一個上下文、同一套權限,也不應該因為SaaS中有人點擊了“強制執(zhí)行”就自動失效。
它存在的意義,就是在所有人都認為可以繼續(xù)時,依然保留拒絕的能力。
底線應該由人提前決定
當然,底線并不是系統(tǒng)自己創(chuàng)造的。
企業(yè)需要提前決定,什么事情絕對不能由AI單獨完成。
可能是一筆超過限額的付款,可能是刪除核心數(shù)據(jù)庫,可能是修改管理員權限,也可能是讓現(xiàn)實設備進入不可逆狀態(tài)。
這些邊界一旦確定,就不應該交給Agent在執(zhí)行過程中臨時解釋。
真正的安全,不是讓AI在最后一秒重新思考,而是讓人類在風險發(fā)生之前提前劃清邊界。
AI可以負責分析、規(guī)劃、推薦,甚至完成絕大部分自動化工作。
但越是不可逆、越是高價值、越可能造成現(xiàn)實損失的操作,越需要一道獨立于AI判斷的最終約束。
AI安全的終點,不是把模型訓練成永不犯錯的圣人,而是讓系統(tǒng)在模型犯錯時依然守得住自己的底線。
未來的AI一定會越來越聰明,也會獲得越來越多的工具和權限。
我們沒有必要因為它可能犯錯,就拒絕所有自動化。
但我們也不能因為它越來越強,就默認把最后的決定權一起交出去。
最后想和大家討論一個問題:
對你來說,AI最不能越過的底線是什么——錢、管理員權限、核心數(shù)據(jù),還是現(xiàn)實設備的控制權?
本內(nèi)容由作者授權發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876854.html?f=wyxwapp
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.