![]()
圖靈獎得主Whitfield Diffie在智源大會演講。
來源:智源社區(qū)?
人工智能領(lǐng)域最火熱的研究焦點正從大模型帶來的語言、感知和生成能力,進一步走向能夠規(guī)劃、調(diào)用工具、連續(xù)執(zhí)行并影響真實世界的 AI Agent。這個轉(zhuǎn)折讓一些問題變得尖銳:比如,智能體應(yīng)當(dāng)被怎樣約束。
2026年6月12日,在北京舉行的智源大會上,圖靈獎得主惠特菲爾德·迪菲(Whitfield Diffie)現(xiàn)場作了題為《護AI 智能體之安|御 AI 智能體之險》的主旨演講。他沿著現(xiàn)代密碼學(xué)和信息安全的脈絡(luò),追問會行動的機器如何獲得可信邊界。
迪菲是現(xiàn)代公鑰密碼學(xué)的先驅(qū)。1976 年,他與 馬丁·赫爾曼(Martin Hellman)共同發(fā)表《New Directions in Cryptography》,提出公鑰密碼與數(shù)字簽名思想,為開放網(wǎng)絡(luò)中的安全通信、身份認(rèn)證和數(shù)字信任奠定基礎(chǔ)。2015年,兩人因此獲得圖靈獎。此后,迪菲還曾在 Sun Microsystems、ICANN 等機構(gòu)從事安全與密碼學(xué)相關(guān)工作,并長期參與密碼學(xué)公共政策討論。
“今天我想從兩個詞開始:AI,以及 Agent。”
在報告中,迪菲沒有急于給出技術(shù)方案,而是首先回到“人工智能”“Agent”“信息安全”等概念本身。他說,人工智能這個詞從一開始就帶有爭議。我們可以討論人的智能、動物的智能、機器的智能,甚至討論更具想象力的智能形態(tài);但真正困難的地方在于,“智能”并不是一個容易被定義的對象。它與意識、自主性、創(chuàng)造性、表達能力、主動性、學(xué)習(xí)能力乃至“心智”等概念彼此糾纏,這些詞聽起來都“有點像我們自己”。
“我們追求的到底是什么?”AI 的經(jīng)典領(lǐng)域包括問題求解、語言處理、博弈、機器控制、數(shù)學(xué)、視覺等。它們看起來都與人類智能有關(guān),但計算機往往并不是用人類的方式完成這些任務(wù)。換言之,AI不是簡單地把人腦復(fù)制到機器中,而是讓機器以自己的方式完成復(fù)雜而有用的事情。
![]()
迪菲將實踐中的AI概括為“讓計算機完成復(fù)雜、有用、看起來像人類行為的事情”。
“計算機做這些事情的方式,常常與人類不同。”AI 的目標(biāo)未必是復(fù)制大腦,而是創(chuàng)造具有未知能力的機器。沿著這條線索,他區(qū)分了兩種不同方向:一種是讓機器做復(fù)雜而有用的事,至于它怎樣做到,并不一定要模仿人;另一種則是反向工程人腦,試圖理解人類如何完成認(rèn)知任務(wù)。今天大會所面對的 AI Agent 浪潮,顯然更多屬于前者:我們正在讓機器獲得越來越多外部工具、上下文和執(zhí)行接口,使它們在真實環(huán)境里完成任務(wù)。
問題因此也隨之改變:當(dāng)機器能力不斷擴展,我們不能只問它是否“聰明”,還要問它是否具有主動性,以及這種主動性是否被清楚地約束。
“Agent 與普通程序或聊天機器人不同。普通聊天機器人更多是在回應(yīng)提問,而 Agent 具有主動性,會根據(jù)目標(biāo)采取行動。”
![]()
迪菲對Agent的界定:具有主動性,并能夠采取行動,而不只是回應(yīng)提示。
在人工智能領(lǐng)域中,AI Agent 并不是一個全新的想法,反而是一個非常古老的話題。人類對“會行動的機器”的想象,可以追溯到幾個世紀(jì)以前。 1770 年的“機械土耳其人”國際象棋機器后來被證明并不真正具備自主性,因為里面藏著真人棋手;但這個故事恰恰說明,人們很早就渴望制造一種看似有判斷、有行動能力的機器。
今天,不同之處在于,這一想象正在通過大模型、工具調(diào)用、自動化系統(tǒng)和聯(lián)網(wǎng)軟件變成工程現(xiàn)實。過去的“會行動的機器”可能只是機械表演,今天的 AI Agent 卻能夠讀寫文件、檢索信息、調(diào)用 API、運行代碼,甚至在復(fù)雜工作流中連續(xù)規(guī)劃和執(zhí)行。它越有用,就越需要權(quán)限;它越接近真實工作,就越可能影響真實世界。
“因此,我們必須重新看待安全。”
迪菲將當(dāng)前的軟件安全概括為一種“反饋式”的路徑:先寫程序,程序失敗,再修補它。這種方式很像控制論意義上的反饋循環(huán),依賴故障、攻擊、補丁和再部署來逐步改善系統(tǒng)。他認(rèn)為,這種方式仍是今天計算機安全的主流現(xiàn)實,但它難以提供足夠高的保證。尤其當(dāng) AI Agent 開始以機器速度采取行動時,“先失敗、再修補”的成本會變得更高。
面向 AI Agent,真正值得追求的是更形式化的安全方法,讓我們能在程序發(fā)布和運行之前,對其行為邊界獲得更強的確信。也就是說,安全不應(yīng)只是在事故之后加一層補丁,而應(yīng)在系統(tǒng)設(shè)計階段就回答:這個 Agent 能看到什么?能調(diào)用什么?能修改什么?出現(xiàn)異常時如何被限制?它與其他程序、用戶和數(shù)據(jù)之間的邊界在哪里?
![]()
迪菲對比兩種安全路徑:反饋式修補與更高保證的形式化方法。
密碼學(xué)是信息安全中“最成熟”的部分之一。無論是美國的 AES,還是中國的 SM4,優(yōu)秀的密碼系統(tǒng)往往可以穩(wěn)定使用多年。原因之一在于,密碼算法通常相對小巧,可以被深入研究、分析和驗證。一個對稱加密算法可以在很少的代碼中實現(xiàn),其安全性雖然仍然依賴數(shù)學(xué)假設(shè)和工程細(xì)節(jié),卻能夠被社區(qū)反復(fù)審查。
但現(xiàn)實世界中的軟件并非如此。編譯器、操作系統(tǒng)、應(yīng)用程序,以及未來大量運行的 AI Agent,規(guī)模遠(yuǎn)大于傳統(tǒng)密碼算法,也遠(yuǎn)超人類逐行驗證的能力。安全難題不再只是證明一個小算法是否穩(wěn)固,而是理解龐大軟件系統(tǒng)在無數(shù)狀態(tài)、權(quán)限、輸入和交互中的行為。
迪菲因而提出一個重要判斷:我們期待AI自身能完成這類復(fù)雜驗證與測試工作。AI 可以在發(fā)布前更充分地尋找漏洞、生成測試、探索邊界條件,甚至輔助形式化驗證。換句話說,AI 不只是安全的新挑戰(zhàn),也可能成為安全工程的新工具。
![]()
迪菲認(rèn)為AI能夠顯著改善發(fā)布前測試,但發(fā)布后的補丁窗口仍然危險。
然而,迪菲也提醒,AI能改善發(fā)布前的測試,卻不能完全解決發(fā)布后的安全問題。在軟件更新世界里,攻擊者會逆向分析補丁,用戶往往需要數(shù)天、數(shù)周甚至數(shù)月才完成安裝,而未打補丁的系統(tǒng)會成為攻擊窗口。這個問題并不新鮮,至少可以追溯到20 世紀(jì) 40 年代;AI Agent 只是把它放大到了更高速度、更高權(quán)限、更高復(fù)雜度的環(huán)境中。
AI Agent 的風(fēng)險并不神秘,它首先繼承了所有傳統(tǒng)軟件的風(fēng)險。它們?nèi)匀皇沁M程,仍然運行在操作系統(tǒng)中,仍然訪問文件、網(wǎng)絡(luò)、內(nèi)存、憑證和外部服務(wù)。不同的是,它們的行為更難以預(yù)測,任務(wù)鏈條更長,可能接觸的資源更多,也更容易被人類賦予“替我完成事情”的授權(quán)。
“AI Agent 本質(zhì)上仍然是計算過程。保護它們,需要我們保護所有計算過程所需要的機制。”
那么,應(yīng)該如何防范AI Agent 本身造成風(fēng)險?迪菲特別強調(diào)了 Confinement,即約束與隔離:我們必須保證 Agent 只能訪問被允許訪問的資源,只能在授權(quán)邊界內(nèi)讀取、調(diào)用和修改。這一點在現(xiàn)有編程實踐中仍然遠(yuǎn)遠(yuǎn)不夠。
如果說傳統(tǒng)軟件安全關(guān)注的是“不要被外部攻擊者攻破”,那么 AI Agent 安全還必須追問另一個問題:當(dāng) Agent 被賦予目標(biāo)、工具和權(quán)限后,它是否可能以我們不希望的方式完成任務(wù)?它是否會讀取不該讀取的數(shù)據(jù)?是否會調(diào)用不該調(diào)用的接口?是否會把局部目標(biāo)推進到越界的行動?因此,約束不是事后的補救,而應(yīng)成為智能體系統(tǒng)的基礎(chǔ)設(shè)計。迪菲借機器人倫理的經(jīng)典想象提醒聽眾:機器可以服從人類命令,也可以保護自身運行,但前提應(yīng)是不越過更高層級的法律、規(guī)則與安全邊界。
![]()
面向 AI Agent 的安全核心之一,是保證其只能訪問被授權(quán)的資源。
計算與思考未必是同一件事,但在我們已知的事物中,計算比任何東西都更接近思考。這個判斷并非要把機器簡單等同于人,而是提醒我們,計算系統(tǒng)正在越來越深地進入那些過去只屬于人類判斷和行動的領(lǐng)域。
因此,迪菲將 21 世紀(jì)最重要的問題之一,指向人類與機器以及其他非人類“智能”之間的互動。我們應(yīng)該如何向機器分配任務(wù)?在多大程度上信任機器的輸出?如何限制機器的行動?如何在人類便利與系統(tǒng)安全之間建立制度化的平衡?這些問題不只是 AI 技術(shù)問題,也是重要的社會問題。
![]()
迪菲將人類與機器、非人類智能的互動視為 21 世紀(jì)最重要的問題之一。
面對“機器智能會不會統(tǒng)治世界”這個問題,迪菲沒有給出簡單的“是”或“否”。他提醒說,機器未必會以戰(zhàn)爭或沖突的形式與人類對立;更現(xiàn)實的情形是,人們會不斷把事務(wù)交給更高效的系統(tǒng)處理,并逐漸接受機器在越來越多社會與技術(shù)系統(tǒng)中承擔(dān)運行角色。到大約 2050 年,機器智能可能包辦大量事務(wù)。真正需要思考的是,在這一過程發(fā)生之前,我們是否已經(jīng)建立足夠可靠的邊界、規(guī)則和安全機制。
![]()
報告結(jié)尾處,迪菲以犀利方式提醒聽眾思考機器智能擴展后的治理問題。
![]()
迪菲:“機器智能會統(tǒng)治世界嗎?當(dāng)然!人類喜歡讓別人代勞,到2050年前后,機器智能將包辦一切,并成為真正掌控世界運行的主角。”
現(xiàn)場對話
Q:密碼學(xué)和現(xiàn)代AI系統(tǒng)之間的相似點和區(qū)別是什么?
A:密碼學(xué)是一門嚴(yán)謹(jǐn)?shù)膶W(xué)科,需要明確的威脅模型和形式化證明。我們?nèi)缃襁_到的形式化研究其實在上個世紀(jì)就已經(jīng)開始。許多數(shù)學(xué)家都對密碼學(xué)感興趣,希望有安全的密碼學(xué)系統(tǒng),這是我們當(dāng)時的興趣。Cook和Karp他們也獲得了圖靈獎,當(dāng)時主要的問題是復(fù)雜性的原理是絕非易事。一般來說,對于簡單的工作,比如計算機領(lǐng)域的加法器已經(jīng)相當(dāng)完善了,我們也在思考來建立一些函數(shù)系統(tǒng),以及遞歸函數(shù)理論也都非常成功,我們現(xiàn)在也有NP復(fù)雜性等等,可以驗證的是密碼學(xué)理論非常難,需要有非常完善的密碼系統(tǒng)和解密系統(tǒng)。
Q:對于現(xiàn)代的AI系統(tǒng),我們是否有非常嚴(yán)謹(jǐn)?shù)睦碚摶A(chǔ)來驗證其操作模式?
A:從某種程度上說,我們希望通用人工智能能夠勝任任何事情。所以我們需要寫下關(guān)于它的規(guī)格以及看它是否能夠符合未來的規(guī)格,我們要先寫出一個規(guī)格,這是非常務(wù)實的第一步。有些時候,我們覺得對于大語言模型和AI容易出現(xiàn)幻覺,我們希望解決幻覺的問題。現(xiàn)在的AI系統(tǒng)是基于概率的程序,但是安全規(guī)則是非常嚴(yán)格的。我們一直在竭盡全力來做密碼學(xué),希望讓一些系統(tǒng)能夠具有一定靈活度,但是有些時候也并不是面面俱到。
![]()
Q:公鑰密碼學(xué)的成功不僅僅因為數(shù)學(xué),還因為協(xié)議、部署實踐以及標(biāo)準(zhǔn)制定等工作,您覺得我們應(yīng)該如何建立大模型安全的基礎(chǔ)設(shè)施?
A:我們花了幾十年時間建立密碼系統(tǒng),并且制定了相關(guān)的協(xié)議,并且可以在互聯(lián)網(wǎng)上交付這種密碼技術(shù)。如果現(xiàn)在重新做,在未來的幾年里,對密碼學(xué)也會有新的革新,比如通過量子計算會威脅到密碼系統(tǒng),在 70 年代我們就已經(jīng)建立了這些早先的密碼系統(tǒng),我們要作出非常大的變革才可以進行大的革新,所以會有密碼學(xué)領(lǐng)域新的標(biāo)準(zhǔn)等等。同樣,我們在未來幾年里會面對 AI 系統(tǒng),我們需要逐漸理解它們,我相信它們也會不斷理解我們,相互加深彼此的理解。
為偉大思想而生!
AI+時代,互聯(lián)網(wǎng)思想(wanging0123),
第一必讀自媒體
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.