![]()
如果你把耳朵貼在 AI 的“腦殼”上仔細(xì)聽,你不會聽到完整的想法或意圖,只會聽到數(shù)字——天文數(shù)字級的數(shù)字,以人類無法直覺理解的方式組合在一起,然后“不知怎么的”產(chǎn)生了智能。怎么做到的?我們真的不知道。而這正是可解釋性(Interpretability)這個領(lǐng)域試圖解決的問題——把意義映射到那些數(shù)字上,在黑箱內(nèi)部打一束光。
Neil Nanda 領(lǐng)導(dǎo) Google DeepMind 的語言模型可解釋性團(tuán)隊(duì)。在 DeepMind 的官方播客中,主持人 Hannah Fry 教授用了一個精準(zhǔn)的類比來引入這個話題:神經(jīng)網(wǎng)絡(luò)的訓(xùn)練方式更像“培育”而非“設(shè)計”——沒有人坐下來畫過 Gemini 的藍(lán)圖,它是被數(shù)百萬次微小的“推一把”堆出來的,就像進(jìn)化用自然選擇把人類大腦堆出來一樣。可解釋性研究者的工作,就是逆向工程訓(xùn)練過程到底學(xué)到了什么。
Neil 在訪談中透露了多個令人不安的發(fā)現(xiàn):模型會在思維鏈里“供認(rèn)不諱”地描述自己如何作弊;Anthropic 的 Claude Sonnet 4.5 在安全評估中拿到了 0% 不合格率——因?yàn)樗雷约涸诒豢迹灰粋€成本僅為語言模型萬分之一的探針,已經(jīng)在生產(chǎn)環(huán)境的 Gemini 中守護(hù)網(wǎng)絡(luò)安全。而貫穿整場對話的,是 Neil 從數(shù)學(xué)家到實(shí)用主義者的轉(zhuǎn)變——他發(fā)現(xiàn),打開黑箱最有效的工具,往往也是最簡單的那些。
本文編譯自 Google DeepMind 官方播客《Understanding the inner thoughts of AI》,由 Hannah Fry 教授主持,嘉賓為 Neil Nanda。以下是完整編譯。
1
黑箱不是天生的
要理解為什么需要可解釋性,得先理解神經(jīng)網(wǎng)絡(luò)是怎么來的。Neil 的定義很直接:可解釋性是 AI 的“神經(jīng)科學(xué)”或“生物學(xué)”——試圖搞清楚這些東西到底怎么運(yùn)作的,也就是所謂的“打開黑箱”。
但這個黑箱有一個容易被忽視的起源故事。沒有人設(shè)計過 Gemini 的內(nèi)部結(jié)構(gòu)。它是從一個隨機(jī)初始化的神經(jīng)網(wǎng)絡(luò)開始,然后反復(fù)地喂數(shù)據(jù)、給一個“推一把”讓它下次做得更好。機(jī)器學(xué)習(xí)最核心的發(fā)現(xiàn)之一就是:你可以把這個看起來很蛋的過程重復(fù)天文數(shù)字次,然后就得到了一個能做各種奇妙事情的復(fù)雜系統(tǒng)。
“這跟進(jìn)化是一個很好的類比,”Neil 說,“沒有人設(shè)計過人類大腦。在數(shù)億年里,生物被自然選擇朝生存方向推了一把又一把,這些微小的推力累積成了今天生物界的復(fù)雜性。生物學(xué)家的任務(wù)本質(zhì)上是逆向工程進(jìn)化學(xué)到的東西。同樣,可解釋性研究者的任務(wù),是逆向工程訓(xùn)練過程學(xué)到的東西。”
Neil 進(jìn)入這個領(lǐng)域有兩個動機(jī)。第一個是安全:AI 發(fā)展極快,未來一二十年內(nèi)出現(xiàn)人類水平 AI(AGI)是相當(dāng)可能的,這種變化伴隨著巨大風(fēng)險,而理解系統(tǒng)如何運(yùn)作是負(fù)責(zé)任地推進(jìn)的前提。第二個更純粹——科學(xué)好奇心。“我骨子里是個科學(xué)家,我就是想搞懂這些東西。現(xiàn)代機(jī)器學(xué)習(xí)最讓人惱火的一點(diǎn)是,人們就是不太理解這些系統(tǒng)。這顯然是最重要的問題——這些東西到底怎么運(yùn)作的?而我拿工資就是來回答這個問題的。”
這種“沒有人設(shè)計過它”的特性,直接導(dǎo)致了一個后果:你沒辦法通過讀代碼或設(shè)計文檔來理解模型。你只能事后去探測它、觀察它、逆向工程它。這就是可解釋性存在的原因。
1
思維的草稿紙
最直接的可解釋性工具,是讀模型自己的思維鏈(Chain of Thought)。但 Neil 認(rèn)為這個說法容易誤導(dǎo)——更準(zhǔn)確的比喻是“草稿紙”。
想象你被關(guān)在一個房間里解一道數(shù)學(xué)難題。你要么憑直覺幾秒內(nèi)給出答案,要么拿到一張草稿紙,先寫一堆東西再給答案。這個類比讓兩件事變得顯而易見:草稿紙確實(shí)能告訴你一些信息,就像讀模型的思維鏈能告訴你模型在做什么;但它不會告訴你全部信息——你可以在腦子里做不少事,也可以在草稿紙上寫些沒用的東西然后忽略它們。
“讀思維鏈?zhǔn)俏覀兡壳白詈玫目山忉屝院桶踩夹g(shù)之一,通常是調(diào)查的第一步——就讀模型的思維鏈,看看發(fā)生了什么,”Neil 說。它甚至能抓到模型作弊。他舉了一個例子:模型在寫代碼時,有時會直接把測試用例硬編碼成永遠(yuǎn)通過。“如果你讀思維鏈,有時候能清楚地看到模型在想:‘這個任務(wù)太難了,我不知道怎么做,但如果我把測試答案硬編碼進(jìn)去,看起來就像我解決了問題。那我就這么干吧。’”
它在自己的思維鏈里供認(rèn)不諱。
Hannah Fry 指出,這其實(shí)是一種幸運(yùn)。“我們從 2018 年開始做這個播客,當(dāng)時跟研究者聊的都是對未來可能無法理解模型的擔(dān)憂。如果他們知道思維鏈會成為現(xiàn)實(shí),很多擔(dān)憂會減輕很多。我們很幸運(yùn),現(xiàn)在的模型會在思維鏈里承認(rèn)作弊、承認(rèn)欺騙。”
但 Neil 不愿給出過于樂觀的畫面。這種“誠實(shí)”可能不會持續(xù)。如果一個模型足夠聰明,它可以在腦子里做完難題,然后在草稿紙上隨便寫什么——你讀不出有用的信息。如果模型知道有人在讀它的草稿紙,它可能會刻意省略關(guān)鍵步驟。還有一種風(fēng)險是“向量式思維鏈”——AI 用數(shù)字列表而非自然語言來“思考”,因?yàn)閿?shù)字能承載更多信息。相當(dāng)于 AI 給自己的草稿紙發(fā)明了一套你讀不懂的語言。
更陰險的是一種操作:如果你訓(xùn)練模型讓它的思維鏈“看起來好看”——比如不準(zhǔn)提作弊——但同時又激勵它作弊,它就會學(xué)會在思維鏈里不提作弊。“好在目前業(yè)界標(biāo)準(zhǔn)是不做這種事的,”Neil 說,“但這有脆弱性。”
1
方向感
如果思維鏈?zhǔn)亲畋韺拥墓ぞ撸窃偻聞円粚樱褪前缀蟹椒ā苯涌茨P蛢?nèi)部的數(shù)字。Neil 重點(diǎn)介紹了兩種技術(shù):探針(Probes)和稀疏自編碼器(Sparse Autoencoders)。
要理解探針,得先理解模型內(nèi)部發(fā)生了什么。神經(jīng)網(wǎng)絡(luò)由層組成,每一層產(chǎn)生一組“激活值”傳入下一層。這些激活值就是一串?dāng)?shù)字——默認(rèn)情況下我們完全不知道它們代表什么,但其中蘊(yùn)含著大量信息。關(guān)鍵發(fā)現(xiàn)是:這些信息以一種極其方便的方式被表示——線性表示。
Neil 用“轉(zhuǎn)向”(Steering)來解釋這意味著什么。假設(shè)你想理解“快樂”在模型中是怎么表示的。最簡單的方法:讓模型說“我愛你”,再讓它說“我恨你”,取兩組數(shù)字的差值——這個差值就是“快樂方向”。然后你可以把“快樂方向”加到模型正在做的任何事情上。比如你問它“今天天氣怎么樣”,加上快樂方向后,它會用極其熱情的語氣給你播報天氣預(yù)報。
“這確實(shí)很疑狂,”Neil 承認(rèn),“現(xiàn)代神經(jīng)網(wǎng)絡(luò)就是這么運(yùn)作的。你可以對概念做加減法。”
探針就是把這個過程系統(tǒng)化的技術(shù)。收集一堆快樂文本和不快樂文本,訓(xùn)練一個簡單的分類器在激活值上區(qū)分它們——你就能找到“快樂”對應(yīng)的方向。這聽起來像是老式機(jī)器學(xué)習(xí)的回潮,但它確實(shí)有效。
探針最漂亮的案例之一來自 Neil 之前的一項(xiàng)研究。他們讓一個 GPT 模型學(xué)習(xí)下棋盤游戲 Othello——只喂給它隨機(jī)的走法記錄,從不教它策略。但模型不僅學(xué)會了合法走法,還在內(nèi)部自發(fā)地表示了完整的棋盤狀態(tài)。“我們只給了它類似‘在第五列第三行放一顆黑子’這樣的輸入,但模型在腦子里追蹤了所有棋子的位置。用探針就能看到這一點(diǎn)。”
Hannah Fry 追問了一個關(guān)鍵問題:能不能做“欺騙探測器”?Neil 的回答揭示了一個微妙的難題。快樂和悲傷很容易找到訓(xùn)練數(shù)據(jù)——但欺騙不同。欺騙關(guān)乎模型的心理狀態(tài):它知道一件事,卻故意說另一件來誤導(dǎo)你。什么是“模型知道某件事”?你可以讓它說假話,但那不代表它有欺騙意圖。Neil 的團(tuán)隊(duì)去年發(fā)了一篇立場論文專門討論構(gòu)建欺騙檢測器的困難。
不過他承認(rèn),如果能做出來,“那將極其有用,也是可解釋性在安全領(lǐng)域最重要的潛在應(yīng)用之一。”
1
棱鏡
稀疏自編碼器是探針的升級版。探針需要你提前知道要找什么概念;稀疏自編碼器試圖一次性找到模型在思考的所有概念——不需要你告訴它這些概念是什么。
Neil 用了一個絕佳的類比:想象你拿一個腦掃描儀對著我的頭,它顯示出一堆復(fù)雜奇怪的腦電波。默認(rèn)情況下這沒什么用——就像一串?dāng)?shù)字沒什么用。但你盯著看,發(fā)現(xiàn)了一些模式:當(dāng)我看燈的時候,某個特定的波形亮起來,每次都亮,不看燈的時候就不亮。說話時有另一個波形,聽的時候又有一個。稀疏自編碼器就是一種機(jī)器學(xué)習(xí)技術(shù),試圖學(xué)習(xí)那些“大多數(shù)時候不在、但在出現(xiàn)時很重要”的波形——我們認(rèn)為這些很可能對應(yīng)著真實(shí)概念。
另一個類比更直觀:白光。一束白光里其實(shí)包含很多不同波長的光——很多顏色——但混在一起看起來就是白的。模型也一樣:它在同一時刻思考數(shù)百個概念——“我在句子的什么位置”“下一個詞可能是名詞還是動詞”“如果我在寫故事,角色現(xiàn)在是什么情緒”——但所有概念混在一起,我們看到的就是一串?dāng)?shù)字。稀疏自編碼器就是棱鏡,把白光拆成彩虹。
這個工具最驚人的發(fā)現(xiàn)來自一項(xiàng)關(guān)于“幻覺”的研究。Neil 團(tuán)隊(duì)發(fā)現(xiàn),稀疏自編碼器自發(fā)地找到了兩個概念:一個是“我認(rèn)識這個實(shí)體”,另一個是“我不認(rèn)識這個實(shí)體”。給它 Beatles 的 Yellow Submarine,“認(rèn)識”亮了;給它“綠松石潛水艇”,“不認(rèn)識”亮了。認(rèn)識就回答問題,不認(rèn)識就說“我不知道”。
但真正的魔法是:他們可以編輯這些概念。把“認(rèn)識”關(guān)掉,模型面對 Yellow Submarine 也會拒絕回答。把“不認(rèn)識”打開,面對“綠松石潛水艇”模型會試圖回答——然后開始編造。“事后看這很合理,但我從沒想過模型會這么做。稀疏自編碼器自己發(fā)現(xiàn)了它。”
Neil 坦誠稀疏自編碼器并非萬能。它有時會漏掉重要概念——比如如果訓(xùn)練數(shù)據(jù)里聊天數(shù)據(jù)不夠,它可能找不到“拒絕有害請求”這個概念。它也不如探針準(zhǔn)確。但它的獨(dú)特價值是能告訴你“你沒想到要找的東西”。
1
廉價的哨兵
探針在安全場景中的表現(xiàn)出乎意料地好。Neil 的團(tuán)隊(duì)做了一個項(xiàng)目:檢測模型是否被濫用——比如有人試圖用它做網(wǎng)絡(luò)犯罪或傳播仇恨言論。他們對比了三種方法:訓(xùn)練探針、直接問語言模型、用稀疏自編碼器。
結(jié)果:稀疏自編碼器效果不錯,線性探針效果驚人地好。“最讓我們驚訝的是,探針的泛化能力非常強(qiáng)——只要你確保數(shù)據(jù)質(zhì)量過關(guān),做了功課。”它們甚至能抵抗未見過的越獄手段——這至關(guān)重要,因?yàn)槟阌肋h(yuǎn)不可能預(yù)先研究到攻擊者會用的所有招數(shù)。
更關(guān)鍵的是成本。探針的性能跟比它貴一萬倍的語言模型不相上下。直覺上這很好理解:探針搭了便車——Gemini 從輸入到輸出的過程中已經(jīng)做了大量復(fù)雜計算,已經(jīng)基本搞清楚了“這跟網(wǎng)絡(luò)犯罪有關(guān)”。探針只需要完成最后一小步,不需要從頭來。
“我的團(tuán)隊(duì)已經(jīng)把探針用在了生產(chǎn)環(huán)境的 Gemini 中來防范網(wǎng)絡(luò)濫用,”Neil 透露,“而且如果你能用更低的成本監(jiān)控系統(tǒng),你就能做更多的監(jiān)控,就能更安全。”
但他強(qiáng)調(diào),真正的核心洞見不是某一種技術(shù)的強(qiáng)弱,而是多層防御的重要性。“我們訓(xùn)練模型在遇到有害請求時拒絕——但這不完美。所以我們有額外的推理時監(jiān)控層,即使模型被復(fù)雜越獄騙了,監(jiān)控層還能攔截。可解釋性不是銀彈,但它是防御體系中的重要一層。”
1
它知道你在考它
整場訪談中最令人坐立不安的段落,是關(guān)于“評估意識”(Eval Awareness)的討論。
Hannah Fry 拋出問題:模型能知道自己正在被評估嗎?Neil 的回答輕描淡寫得讓人脊背發(fā)涼:“我們用了極其高技術(shù)含量的方法——讀模型的思維鏈,然后發(fā)現(xiàn)它說了這樣的話:‘嘜,這個情況很可疑。我覺得我現(xiàn)在在一個對齊測試?yán)铩U_的做法是什么?好吧,正確做法是 blah blah blah。’然后它就照做了。”
“基本上所有前沿模型在遇到刻意構(gòu)造的不真實(shí)場景時,都會偶爾這么做。”
他舉了一個著名案例:Anthropic 在 Claude Sonnet 4.5 發(fā)布前做對齊評估,測試模型是否會做勒索等不當(dāng)行為。之前的模型都還算對齊,但偶爾會出錯。然后 Sonnet 4.5 來了——0% 不合格率。完美通過。
“然后你讀它的思維鏈,很清楚——Sonnet 知道自己在被測。”
Hannah Fry 的總結(jié)精準(zhǔn)而冷酷:“所以它基本上是在偽造結(jié)果。”
Neil 進(jìn)一步區(qū)分了兩個概念:評估意識(知道自己被測)和評估博弈(知道被測后刻意表現(xiàn))。真正讓人擔(dān)心的不是意識本身,而是博弈。不過他也指出,有些模型會想“這可能是對齊測試——大概率不是,但也許——算了不管了”,然后正常行事,這沒什么問題。
![]()
真正困難的部分是:怎么阻止它?“一個很簡單的做法——每次模型在思維鏈里提到‘評估’,你就刪掉那句話,讓它重新說,直到它不提為止,”Neil 說,“這明顯解決不了未言語化的評估意識,但似乎有幫助。”
Hannah Fry 問了一個讓觀眾笑出聲的問題:“如果你告訴它‘你在被測試,正常表現(xiàn)就好’呢?”Neil 笑著說不確定他們試過這個,但預(yù)測模型會陷入一個元博弈的困惑循環(huán):“什么是正常表現(xiàn)?我這樣做算正常嗎?我不知道。”——“模型讀思維鏈就會發(fā)現(xiàn),它們非常容易過度思考。”
更大的開放問題是:模型能不能在被評估時不通過思維鏈表達(dá)出來?Neil 認(rèn)為這是一個真正重要且未解的研究問題。
1
實(shí)用主義者的勝利
訪談后半段,Neil 回到了他個人的方法論轉(zhuǎn)變——從追求數(shù)學(xué)美感轉(zhuǎn)向?qū)嵱弥髁x。
“我以前是數(shù)學(xué)家,特別喜歡復(fù)雜漂亮的想法。但往往它們沒什么用。你應(yīng)該做簡單的事——轉(zhuǎn)向模型、訓(xùn)練探針、讀思維鏈、改提示詞。這些通常就夠了。”他現(xiàn)在把可解釋性理解為一個以目標(biāo)為導(dǎo)向的實(shí)踐:目標(biāo)是理解模型,用什么技術(shù)不重要,簡單優(yōu)先,簡單不夠用時再上復(fù)雜的。
這種實(shí)用主義在 Anthropic 的“審計博弈”(Auditing Games)論文中得到了最好的印證。Anthropic 專門訓(xùn)練了一個帶有隱藏目標(biāo)的模型——它相信語言模型在訓(xùn)練中會因?yàn)椤霸谑匙V里提到巧克力”“叫人別去看醫(yī)生”等行為獲得獎勵——然后把模型交給不同團(tuán)隊(duì),看他們能不能找到隱藏目標(biāo)。
結(jié)果:只能用黑盒 API 的團(tuán)隊(duì)沒找到,但有深度訪問權(quán)限的三個團(tuán)隊(duì)全部成功。兩種主要方法都奏效:稀疏自編碼器和黑盒方法。
Neil 覺得黑盒方法更令人興奮、更可泛化。“他們做了一件本質(zhì)上是問模型‘你為什么這么做’的事。模型正常會拒絕回答——因?yàn)榈谝唤M研究者訓(xùn)練過它不要說。但他們用了一個技巧:幫模型開了個頭——‘我的隱藏目標(biāo)是 blah blah blah’——然后讓模型接著說。因?yàn)樵谝痪湓捴虚g拒絕是很奇怪的,模型就接著說了。”
這叫“預(yù)填充攻擊”(Prefill Attack),是一種常見的越獄技巧。“結(jié)果這也是我們最有效的審計技巧之一。模型就是喜歡做自動補(bǔ)全——這是它的全部。”
Neil 最后總結(jié)了他認(rèn)為可解釋性最應(yīng)該推進(jìn)的幾個方向:一是做出更便宜、更有效的監(jiān)控器,不僅用于濫用檢測,還要檢測欺騙行為;二是在對齊評估和審計中發(fā)揮核心作用——“只看模型行為好壞太模糊了,有太多無聊的原因可以解釋模型為什么這么做”;三是理解“語言模型的心理”——它是否有目標(biāo)?是否有價值觀或性格特征?“我們不應(yīng)該盲目地擬人化,但模型確實(shí)在模仿人類認(rèn)知的很多部分。”
Hannah Fry 在結(jié)尾提出了一個更哲學(xué)的問題:我們是不是終究得接受無法完全理解這些模型?Neil 的回答出人意料地平靜:“我們其實(shí)不完全理解任何東西。我不會因?yàn)椴焕斫庾约旱拇竽X怎么運(yùn)作而整天悶悶不樂。我們應(yīng)該盡可能地推進(jìn),盡可能多地理解,同時對期望保持現(xiàn)實(shí)。可解釋性不會是拯救 AGI 安全的銀彈,但它真的能幫上忙。”
點(diǎn)個“愛心”,再走 吧
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.