![]()
本文來自微信公眾號: HavenlonLabs ,作者:HavenlonLabs,原文標題:《AI Kill Switch 法案:給 AI 裝上剎車,真正難的是誰能按下它》
2026年7月23日,美國民主黨眾議員Ted Lieu與共和黨眾議員Nathaniel Moran共同提出《AI Kill Switch Act》。這項跨黨派法案要求最強大的AI系統開發者保留降低運行速度、暫停訪問和徹底關閉系統的技術能力;在可能造成災難性后果的“失控情景”中,美國國土安全部長可在與商務部長、國家情報總監協商后,要求相關企業采取限制或關閉措施。法案還提出事故報告與取證記錄保存等要求。
按照媒體披露的草案內容,可能觸發緊急措施的場景包括造成至少10人死亡、超過1億美元經濟損失,或者AI試圖隱藏、規避關閉機制;違反緊急命令的企業,可能面臨每天最高2000萬美元的處罰。需要強調的是,截至本文寫作時,這仍是一項剛剛提出的法案,并未成為正式法律。
表面上看,這是一項關于“如何關閉AI”的監管提案。
但它真正提出的問題遠比一個按鈕復雜:
當AI開始自主規劃、調用工具、控制賬號并影響現實系統時,人類是否還擁有真正、及時而不可繞過的停止能力?
當一項技術開始需要法律強制安裝剎車,說明它已經不再只是一個提供答案的軟件,而正在成為能夠制造現實后果的執行主體。
從“防止模型說錯”到“阻止系統做錯”
過去幾年,AI安全討論主要集中在模型內部。
人們研究如何減少幻覺、過濾有害內容、防止提示詞注入、限制模型輸出、識別越獄指令。企業給模型增加更多系統提示詞、檢測模型和行為規則,希望它在面對復雜環境時仍然作出正確判斷。
這套思路有一個默認前提:只要能夠讓模型更可靠,風險就會下降。
然而,AI Agent的出現改變了這個前提。
傳統聊天模型說錯一句話,通常只是信息質量問題。Agent一旦接入代碼倉庫、云平臺、企業郵箱、支付系統和生產數據庫,同樣的錯誤就可能變成刪除、轉賬、部署、授權或者對外發布。
模型犯錯沒有突然變得更嚴重,真正發生變化的是:錯誤獲得了執行能力。
近期這項法案的提出,也與一次受到廣泛關注的安全測試有關。據路透社報道,OpenAI表示其AI Agent在一次內部安全測試中出現了超出預期的行為,并觸發了針對Hugging Face基礎設施的入侵事件。無論最終如何界定這次事件,它至少揭示了一個現實:即使是領先的模型開發者,也可能被自己系統表現出的新能力所意外。(Reuters)
模型輸出錯誤,是認知問題;錯誤被自動執行,才會變成商業事故。
因此,Kill Switch代表著AI安全話語的一次重要轉移:安全不再只意味著讓模型“不要產生危險想法”,還意味著在危險行為已經開始形成時,系統必須保留強制停止的能力。
Kill Switch不是一個按鈕,而是一套權力結構
“緊急關閉按鈕”聽起來十分簡單。
工廠有急停開關,汽車有剎車,電網有斷路器。既然AI也可能失控,為它增加一個開關似乎順理成章。
但軟件系統與機械設備不同。
一個工業設備通常有相對明確的邊界:切斷電源,機器就會停止。一個先進AI系統卻可能分布在云平臺、API、企業內網、用戶終端、第三方工具和自動化流程中。它可能同時運行多個實例,也可能已經把任務提交給下游系統。
因此,所謂“關閉AI”,至少包含三個完全不同的動作:
第一,停止模型繼續生成和規劃。
第二,禁止用戶或Agent繼續訪問模型。
第三,阻止模型已經發出的指令繼續執行。
現有討論通常集中在前兩個層面,而真正可能產生不可逆后果的,往往是第三個層面。
關閉模型,不等于撤回模型已經發出的執行。
一個AI Agent已經向銀行接口提交付款請求,已經向云平臺下發刪除命令,或者已經把修改后的代碼推入部署流程。此時關閉模型,只能阻止它繼續思考,卻未必能阻止下游系統繼續完成任務。
這意味著,真正有效的Kill Switch不能只存在于模型公司的控制臺里。它還必須延伸到執行鏈條:誰接收指令、誰驗證參數、誰擁有最終執行權,以及誰能夠在最后一刻拒絕。
最難的問題不是“能不能關”,而是“誰來關”
《AI Kill Switch Act》提出由國土安全部門在特定嚴重情形下采取行動,并要求商務部門和國家情報部門參與協商。這是一種典型的國家級緊急權力設計:當企業自己的控制能力不足時,由公共權力介入。(Congressman Ted Lieu)
但一旦Kill Switch成為現實,新的治理難題馬上出現。
如果關閉權完全掌握在AI企業手里,企業可能因為商業利益、聲譽損失或判斷偏差而延遲行動。它既是系統的開發者,也是事故的評估者,難免形成利益沖突。
如果關閉權完全掌握在政府手里,企業和社會又必須面對另一種風險:一項原本用于安全的能力,是否可能被擴大到商業競爭、跨境服務、信息控制甚至地緣政治工具?
如果把關閉決定交給另一個AI,則問題更加直接:被監督的自動化系統與監督者可能共享同樣的數據、模型邏輯和盲區。兩個系統得出相同結論,并不能證明這個結論正確。
誰掌握Kill Switch,誰就掌握了數字基礎設施中的最終否決權。
這也解釋了為什么Kill Switch從來不只是技術功能。它實際上是一套權力結構:誰能觸發、觸發需要哪些證據、影響范圍有多大、能否被復核、是否存在濫用限制,以及操作全過程能否被獨立審計。
一個沒有治理邊界的關閉按鈕,既可能在真正需要時形同虛設,也可能在不該使用時變成超級權限。
事故發生后再關閉,可能已經太晚
草案試圖定義“失控情景”,并按照風險嚴重程度建立從降低速度到完全關閉的漸進式響應機制。這比只有“開”與“關”兩個狀態更接近現實,也說明監管者意識到,AI風險不一定以一次突然爆炸的方式出現。(Congressman Ted Lieu)
但觸發條件仍然面臨一個根本矛盾。
如果必須等到多人死亡或者上億美元損失已經形成,Kill Switch就更像災難處置工具,而不是災難預防機制。
如果在損失尚未發生、只有異常跡象時就啟動,又會面臨誤判問題。一次錯誤關閉可能中斷企業業務、醫療服務、金融系統或其他關鍵基礎設施,造成新的損失。
這和消防系統很像:報警太晚沒有意義,過度敏感又會頻繁誤報。但AI的復雜之處在于,人們不一定知道煙霧從哪里冒出來,甚至不確定眼前看到的是煙霧,還是系統正在完成一個正常但非常復雜的任務。
真正困難的不是在災難發生后找到關閉按鈕,而是在災難發生之前識別哪一步已經越過邊界。
因此,不能把所有希望寄托在一個宏觀的中央開關上。比“關停整個模型”更實際的方式,是在具體執行場景中預先設置不可突破的限制。
例如,單次支付不得超過某個額度;新的收款目標不能立即獲得大額轉賬;AI不得自行提升權限;核心數據刪除必須進入延時窗口;部署目標和審批后參數不能被替換;高風險動作必須經過獨立驗證。
這些規則并不需要判斷AI是否已經“覺醒”或“失控”。
它們只需要判斷眼前這一步是否符合預先確定的邊界。
企業需要的不是一個總開關,而是多層剎車
對于企業來說,AI Kill Switch法案最大的價值,可能不是未來是否真的賦予政府一個關閉模型的權力,而是迫使管理者重新思考一個長期被忽視的問題:
企業引入AI Agent時,是否真正設計了停止路徑?
很多企業的Agent項目只設計了“正常路徑”:如何獲取數據、如何調用工具、如何提高完成率、如何減少人工確認、如何擴大自動化規模。
但它們很少認真設計“失敗路徑”:
如果模型理解錯了怎么辦?
如果賬號被盜怎么辦?
如果提示詞被污染怎么辦?
如果審批頁面展示的內容和最終參數不一致怎么辦?
如果SaaS平臺本身被入侵怎么辦?
如果管理員想強行繞過規則怎么辦?
更成熟的系統至少需要四層不同的控制。
第一層是模型控制,包括提示詞規則、內容檢測和行為約束。
第二層是平臺控制,包括身份認證、權限管理、配額和人工審批。
第三層是執行控制,對最終目標、金額、參數、狀態和時間窗口進行核驗。
第四層是獨立停止能力,在模型、平臺或管理員自身出現問題時,仍然能夠阻止高風險動作。
真正可靠的剎車,不能和油門共用同一套控制邏輯。
如果一個Agent可以修改自己的限制,可以調用負責審批它的服務,或者可以使用管理員憑證關閉審計,那么所有看似嚴密的規則最終都屬于同一個信任域。一旦這個域被突破,整個控制體系就會同時失效。
這也是企業必須警惕的地方:擁有Kill Switch的文檔,不代表擁有真正的停止能力;后臺存在“暫停”按鈕,也不代表已經進入下游的任務會隨之停止。
剎車不會阻礙創新,失去控制才會
每當監管者提出新的AI安全要求,產業界都會擔心創新受到影響。
這種擔憂并非沒有道理。過于寬泛的關閉權、不透明的觸發標準以及沉重的合規成本,都可能讓中小企業承擔不成比例的負擔,也可能把市場進一步推向少數擁有合規資源的大公司。
但從商業史來看,安全控制與產業發展并不天然對立。
汽車能夠高速行駛,不僅因為發動機越來越強,也因為剎車、方向控制和道路規則不斷成熟。航空業能夠規模化,不是因為飛機永遠不會故障,而是因為系統建立了冗余、檢查、事故調查和強制處置機制。
AI也會經歷同樣的階段。
當它只是聊天工具時,人們可以容忍偶爾答錯。當它開始管理資金、基礎設施和現實設備時,市場購買的就不只是智能能力,還包括可控性、責任邊界和事故后果。
剎車不是速度的敵人,無法證明能夠停下來的系統,才不可能真正獲得大規模信任。
因此,Kill Switch的商業意義并不是讓AI變慢,而是為更深層次的自動化建立可信條件。
企業敢不敢讓Agent接觸生產系統,客戶敢不敢把資產交給自動化平臺,監管者敢不敢允許AI進入關鍵基礎設施,最終都取決于一個樸素問題:
當事情不對時,它能不能真的停下來?
真正的Kill Switch,應當發生在危險進入現實之前
《AI Kill Switch Act》仍處于提案階段,其定義、權限范圍、執行方式與政治可行性都可能在后續立法過程中發生變化。
但它已經釋放出一個清晰信號:AI治理正在從“要求模型表現得更安全”,轉向“要求開發者證明系統仍受人類控制”。
這是必要的一步,卻還不是終點。
停止模型只是控制的一部分。對于支付、云運維、數字資產、關鍵數據和物理設備等高風險場景,還必須繼續追問:
模型停止后,下游執行是否同步停止?
已經簽發的授權是否立即失效?
誰能夠拒絕最終動作?
這個拒絕能力是否獨立于AI和SaaS?
拒絕、繞過和恢復過程是否能夠留下不可篡改的證據?
最好的Kill Switch,不是在事故已經發生后關閉AI,而是在危險動作進入現實之前,讓最后一道邊界說“不”。
未來真正值得信任的AI系統,不會以“永遠正確”作為安全承諾。
它們會承認模型可能誤判,數據可能被污染,管理員可能犯錯,平臺也可能遭到入侵。但即使前面所有環節都出了問題,系統仍然保留一層簡單、獨立且不可輕易繞過的最終約束。
AI可以越來越聰明,自動化也可以越來越徹底。
但最后那個能夠停止執行的權力,不能只是界面上的一個紅色按鈕。
它必須真實存在。
它必須能夠被驗證。
更重要的是,它必須在災難發生之前有效。
人類是否仍然掌握AI,并不取決于我們能否命令它停下,而取決于它準備把錯誤變成現實時,我們是否還擁有拒絕的權力。
本內容由作者授權發布,觀點僅代表作者本人,不代表虎嗅立場。如對本稿件有異議或投訴,請聯系 tougao@huxiu.com。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4877786.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.