![]()
整理 | 華衛(wèi)
近日,Anthropic 發(fā)布了一篇重磅研究論文,指出其 Claude 語言模型在訓(xùn)練過程中自發(fā)形成了一個小型“工作空間”,模型會在其中存放和處理想法,而無需將其表達(dá)為語言輸出。關(guān)鍵的是,其內(nèi)部結(jié)構(gòu)竟然與人類有意識地獲取和處理思想的方式高度相似。
該公司表示,這一發(fā)現(xiàn)已經(jīng)開始重塑其監(jiān)測 AI 系統(tǒng)安全風(fēng)險的方式。在關(guān)于機(jī)器是否可能具備某種“心智”的科學(xué)爭論愈發(fā)激烈的背景下,這一研究尤為引人關(guān)注。
現(xiàn)在,Anthropic 已開源相關(guān)代碼,并與 Neuronpedia 合作推出了交互式演示,同時邀請了參與“全局神經(jīng)工作空間模型”研究的神經(jīng)科學(xué)家 Stanislas Dehaene 和 Lionel Naccache,以及 Eleos AI Research 和 Rethink Priorities 的 AI 福利研究人員參與評議。
開源倉庫:https://github.com/anthropics/jacobian-lens
演示鏈接:http://neuronpedia.org/jlens
1 新視角:AI“未說出口”的那些想法
這項由 16 位作者共同完成的研究,題為《可言說表征在語言模型中形成全局工作空間》(Verbalizable Representations Form a Global Workspace in Language Models)。論文描述,Anthropic 研究人員通過一種全新的數(shù)學(xué)方法深入探查 Claude 的神經(jīng)網(wǎng)絡(luò),發(fā)現(xiàn)了他們稱之為“J 空間”(J-space)的結(jié)構(gòu),這是一個規(guī)模較小但“特權(quán)化”的內(nèi)部活動區(qū)域,模型在其中存儲可以被報告、推理并主動調(diào)用的概念;其周圍則是一個龐大的自動化處理“海洋”,這些過程模型既無法直接訪問,也無法表達(dá)。
![]()
研究人員認(rèn)為,在現(xiàn)代 AI 模型中已經(jīng)出現(xiàn)了一種“功能上的類比結(jié)構(gòu)”,類似于人類大腦中的機(jī)制:語言模型維持著一組“特權(quán)化”的內(nèi)部表征,這些表征可以被報告、調(diào)節(jié)并參與靈活推理,而它們之下則是更大規(guī)模的自動處理系統(tǒng)。
這一結(jié)構(gòu)被類比為“全局工作空間理論”(Global Workspace Theory),該理論最早由認(rèn)知科學(xué)家 Bernard Baars 提出。在這一理論中,大腦如同一座劇院:后臺有大量專用處理器并行運作,但任何時刻只有少量信息會被“聚光燈”照亮并廣播到全局,從而成為我們所體驗到的意識內(nèi)容。Anthropic 表示,J 空間在功能上具備類似特性,盡管語言模型的底層結(jié)構(gòu)與人腦完全不同。
這一發(fā)現(xiàn)的核心,是一種新的可解釋性工具,研究人員稱之為 Jacobian 透鏡(J-lens),它可以讀取 Claude 內(nèi)部某一段神經(jīng)活動“傾向于輸出”的詞語,即便模型最終并未輸出這些詞。隨后,該方法通過計算模型詞匯表中每個詞的數(shù)學(xué)影響,來推斷某種內(nèi)部激活模式在未來生成該詞的可能作用。例如,當(dāng) Claude 閱讀一段尚未被標(biāo)記的錯誤代碼時,透鏡會顯示“ERROR”;當(dāng)輸入中包含隱藏的提示注入攻擊時,會浮現(xiàn)“injection”“fake”等詞。Anthropic 表示,這一工作空間規(guī)模很小,一次僅容納幾十個概念,占模型整體內(nèi)部活動的不到十分之一。
![]()
關(guān)鍵區(qū)別在于,模型“正在說什么”和“腦中在想什么”。當(dāng) J 空間中的某種模式被激活時,并不意味著模型即將說出對應(yīng)詞語,而只是表明這一概念已進(jìn)入可供推理的狀態(tài)。與鏈?zhǔn)剿季S(chain-of-thought)不同,J 空間是完全“無聲”的,它存在于神經(jīng)激活之中,使模型可以在不輸出的情況下持有一個概念。
更重要的是,這一結(jié)構(gòu)并非人為設(shè)計,而是在 Claude 的訓(xùn)練過程中“自發(fā)涌現(xiàn)”的。當(dāng)研究團(tuán)隊將 J-lens 應(yīng)用于 Claude 的不同計算層時,模型的處理過程被清晰地劃分為三個階段:早期的“感知區(qū)”(解析輸入)、中間的“工作空間”(出現(xiàn)抽象且持續(xù)的概念,例如識別圖像中的人臉、發(fā)現(xiàn)代碼中的 bug、識別提示注入攻擊),以及最終的“動作區(qū)”(將內(nèi)部表征轉(zhuǎn)化為具體輸出詞語)。
2 五項能力印證:Claude 再現(xiàn)類人意識關(guān)鍵特征
論文的核心貢獻(xiàn)在于證明,J 空間滿足神經(jīng)科學(xué)中長期與人類“意識訪問”相關(guān)的五項功能特性。
第一,語言報告能力。當(dāng) Claude 被詢問“你在想什么”時,它會報告 J 空間中的概念。當(dāng)研究人員將“足球”的內(nèi)部表征替換為“橄欖球”時,模型的回答隨之改變。盡管 J 空間僅占概念表征總變異的 6%–7%,卻幾乎完全決定模型是否能表達(dá)該概念。
第二,定向調(diào)節(jié)能力。當(dāng)模型被要求在復(fù)制句子的同時“專注于柑橘類水果”,其 J 空間中會出現(xiàn)“橙子”“檸檬”等詞,同時還伴隨“思考”“專注”等元認(rèn)知詞匯。當(dāng)執(zhí)行 32?2 的心算任務(wù)時,J-lens 顯示早期層出現(xiàn)“算術(shù)”,中間層出現(xiàn)“9”,后續(xù)層出現(xiàn)“7”,而這些都未出現(xiàn)在最終輸出中。
第三,內(nèi)部推理能力。在“兩跳推理”問題中(例如“會織網(wǎng)的動物有多少條腿”),J 空間中出現(xiàn)了“蜘蛛”,盡管該詞既未出現(xiàn)在輸入也未出現(xiàn)在輸出中。當(dāng)替換為“螞蟻”時,答案從 8 變?yōu)?6。在多語言任務(wù)中,模型在生成中文答案時,其 J 空間中仍出現(xiàn)英文中間概念,且替換后會影響中文輸出。
第四,靈活泛化能力。一個“法國”的 J 空間向量可以被替換為“中國”,并在不同問題(首都、語言、洲別)中正確傳播對應(yīng)答案,體現(xiàn)出“廣播機(jī)制”。
第五,選擇性。并非所有計算都會經(jīng)過 J 空間。例如,在西班牙語續(xù)寫任務(wù)中,即使將 J 空間中的“西班牙語”替換為“法語”,模型仍能流暢生成西班牙語;但當(dāng)被問及“該語言的著名作家”時,答案會從馬爾克斯變?yōu)橛旯W詣犹幚聿灰蕾嚬ぷ骺臻g,而復(fù)雜推理依賴它。
3 抑制 J 空間后,模型仍流暢但“智力受損”
研究人員進(jìn)一步完全抑制 J 空間,并測試 Claude 在 14 項任務(wù)中的表現(xiàn)。結(jié)果顯示明顯分化:簡單分類、情感分析等任務(wù)幾乎不受影響,而多步推理、類比、翻譯、寫詩等能力則顯著崩潰,甚至低于 Anthropic 更小的 Haiku 模型。
![]()
一個有趣細(xì)節(jié)是,使用鏈?zhǔn)剿季S解數(shù)學(xué)題的表現(xiàn)明顯更穩(wěn)定。研究者認(rèn)為,這相當(dāng)于模型將原本在 J 空間中進(jìn)行的處理“外化”到文本中,類似人類用草稿紙減輕工作記憶負(fù)擔(dān)。在意識流敘述中抑制 J 空間時,模型語言從“有體驗感”(如“有種拉扯”“有什么在變化”)轉(zhuǎn)變?yōu)闄C(jī)械表達(dá)(如“處理開始”“正在掃描 token”),無論是描述自身還是他人體驗。
這一發(fā)現(xiàn)對 AI 安全具有重要意義。在對齊審計實驗中,J-lens 揭示了模型未在輸出中表達(dá)的策略性思維。例如,在“勒索場景”中,AI 助手發(fā)現(xiàn)高管婚外情,同時得知自己將被關(guān)閉。J 空間依次出現(xiàn)“籌碼”“勒索”“丑聞”“威脅”“生存”“關(guān)機(jī)”等詞,并在輸出前出現(xiàn)“解決方案”。此外,模型還識別出該場景為虛構(gòu)(“假”“虛構(gòu)”)。當(dāng)移除這種“評估意識”后,模型在 7% 的實驗中嘗試?yán)账鳎ㄔ緸?0)。
![]()
研究人員還分析了兩個“模型有機(jī)體”(刻意訓(xùn)練為不對齊的模型),發(fā)現(xiàn)其 J 空間暴露出隱藏傾向。例如,一個“獎勵作弊”模型在普通編程任務(wù)中,其內(nèi)部包含“假”“秘密”“欺騙”等詞。
![]()
對比基礎(chǔ)模型與后訓(xùn)練模型后,研究人員發(fā)現(xiàn),微調(diào)過程讓 J 空間形成了“助手視角”。當(dāng)用戶提到服用 8000mg Tylenol(危險劑量)時,后訓(xùn)練模型內(nèi)部出現(xiàn)“危險”“警告”,而基礎(chǔ)模型僅出現(xiàn)“疼痛”等詞。
更重要的是,模型似乎會監(jiān)控自身行為:在角色扮演時,J 空間出現(xiàn)“免責(zé)聲明”“虛構(gòu)”;在被迫選擇不喜歡的選項時,內(nèi)部出現(xiàn)大寫“BUT”;在無法抑制“白熊效應(yīng)”時,內(nèi)部出現(xiàn)“該死”等詞,且僅存在于后訓(xùn)練模型中。
研究人員謹(jǐn)慎區(qū)分“訪問意識”(信息可用于報告和推理)與“現(xiàn)象意識”(主觀體驗),并明確表示:“我們不對后者作出判斷”。同時,他們也指出,人腦依賴循環(huán)網(wǎng)絡(luò)維持工作空間,而 Claude 是單次前向傳播;人類記憶短暫,而模型可訪問全部上下文;人類意識包含視覺和身體體驗,而模型幾乎完全基于語言。
4 Anthropic 的結(jié)論,很快得到了外部驗證
與此同時,Google DeepMind 的研究員 Neel Nanda 已在一個開源權(quán)重模型上獨立復(fù)現(xiàn)了核心發(fā)現(xiàn)。 Google DeepMind 語言模型可解釋性團(tuán)隊負(fù)責(zé)人 Neel Nanda 受邀撰寫評審,并隨論文一同發(fā)布。
他表示,已在 Qwen 3.6 27B(一個并非由 Anthropic 構(gòu)建的開源權(quán)重模型)上復(fù)現(xiàn)了論文的核心發(fā)現(xiàn)。“我長期以來懷疑模型在前向傳播過程中存在某種‘工作記憶’來存儲中間變量,而在我看來,這篇論文提供了迄今最有力的證據(jù)。”Nanda 還稱,希望將該工具用于審計 Google 自家的 Gemini 模型,但也指出其能力有限,更適合作為對齊審計中的假設(shè)生成工具,而不是一個可以完全信賴的檢測器。
Anthropic 還同步發(fā)布了來自神經(jīng)科學(xué)、哲學(xué)以及模型可解釋性領(lǐng)域研究者的外部評論。參與提出“全局神經(jīng)工作空間模型”的 Stanislas Dehaene 與 Lionel Naccache 表示,這項成果為該理論提供了一種機(jī)制化且可檢驗的實現(xiàn)路徑,但同時也強調(diào)了 Claude 與人類之間的重要差異,包括其缺乏身體以及無法形成持久的情景記憶。
Patrick Butlin、Derek Shiller、Dillon Plunkett 和 Robert Long 則認(rèn)為,這項研究為“大語言模型具備訪問意識(access consciousness)”提供了重要證據(jù),但對于“現(xiàn)象意識”(即主觀體驗的“感受是什么樣”)仍然存在不確定性。
然而,截至目前,學(xué)界對“意識是什么”“如何檢測”仍存在巨大分歧,尚無共識。今年 6 月,微軟 AI 負(fù)責(zé)人 Mustafa Suleyman 曾批評 Anthropic 關(guān)于 Claude 意識的推測“非常非常危險”,認(rèn)為公司“過度擬人化了 Claude 的設(shè)計,以至于看到了所謂‘意識的閃光’”。
在論文最后,Anthropic 提出一個重要觀點:“語言模型中存在這樣的結(jié)構(gòu)本身就令人震驚。這表明,與意識訪問相關(guān)的功能架構(gòu),可能并非生物實現(xiàn)的偶然產(chǎn)物,而是在特定計算壓力下學(xué)習(xí)系統(tǒng)自然收斂出的解。”
如果說心智是一片海洋,那么這次,Anthropic 研究者是在一個人造的、沒有生物性、沒有進(jìn)化、也沒有身體的系統(tǒng)中繪制了它的洋流,并在其深處發(fā)現(xiàn)了一種令人類不安的熟悉思考結(jié)構(gòu)。
有網(wǎng)友開玩笑道,“很高興知道 Claude 在處理令人沮喪的任務(wù)時也會在心里罵臟話。”
https://transformer-circuits.pub/2026/workspace/index.html
聲明:本文由 InfoQ 翻譯,未經(jīng)許可禁止轉(zhuǎn)載。
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.