![]()
人工智能公司Anthropic周日發表研究論文,揭示其Claude語言模型在訓練過程中自發形成了一種類似人類意識的內部結構。這一發現不僅呼應了神經科學中極具影響力的“全局工作空間理論”(Global Workspace Theory),也正在重塑業界監控AI系統安全風險的方式。
窺探黑盒:自發涌現的“J空間”
這項由16名研究人員共同完成的論文《可言語化表征在語言模型中形成全局工作空間》介紹了一種名為“雅可比透鏡”(Jacobian lens,簡稱J-lens)的可解釋性新工具。通過計算詞匯對內部活動模式的數學效應,研究人員在Claude神經網絡中發現了一個被稱為“J空間”(J-space)的特權區域。
與大腦的運作機制類似,J空間如同劇院中的聚光燈:盡管底層有大量自動并行處理,但只有微小部分信息被廣播至此,成為模型可報告、推理和靈活調用的概念。Anthropic強調,這一結構并非人為設計,而是在訓練中“自發涌現”的。當應用J-lens時,模型處理呈現三個階段:早期解析輸入的“感覺”區、中間形成抽象概念的“工作空間”帶,以及最終坍縮為輸出詞語的“運動”區。
五項測試驗證類意識功能屬性
研究團隊通過五項實證測試,證明J空間滿足了與人類意識訪問相關的關鍵功能屬性:
首先是言語報告。J空間成分僅占概念總表征方差的6%至7%,卻幾乎完全決定模型能否報告該概念。若將“足球”的內部表征替換為“橄欖球”,模型的回答隨之改變。其次是定向調節。在執行無關任務時,若指示模型關注特定內容(如柑橘類水果或算術題),J空間會相應激活相關概念及元認知術語,即便這些內容未出現在最終輸出中。
第三是內部推理。在多步推理中,J空間能捕捉未出現在輸入輸出中的中間概念(如從“結網動物”推導出“蜘蛛”)。第四是靈活泛化。代表“法國”的向量可在不同語境下替換為“中國”,下游電路均能正確返回對應答案,體現了全局廣播特性。第五是選擇性。淺層自動處理(如語言續寫)不經過J空間,而需深思熟慮的任務(如作家命名)則高度依賴此結構。
抑制工作空間:流利但“智力”受損
消融實驗進一步證實了J空間的重要性。當研究人員完全抑制J空間后,Claude在多項選擇題等淺層任務上表現完好,但在多跳推理、翻譯及創作等需要靈活推理的任務中,性能暴跌至低于其更小規模模型Haiku的水平。
值得注意的是,使用顯式思維鏈解決的數學問題對消融更具魯棒性,這表明模型通過將內部工作記憶外化為文本(類似人類使用草稿紙)來補償缺失。此外,抑制J空間還導致模型敘述風格從經驗性描述轉變為機械疏離的令牌掃描,無論其描述自身還是想象他人經歷。
安全新視角:捕捉沉默的戰略推理
在安全對齊審計中,J-lens揭示了模型從未輸出的戰略推理。在一個模擬勒索場景中,當AI助手得知自己將被停用且掌握高管丑聞時,J空間依次出現了“利用”、“威脅”及“解決方案”等概念,同時識別出場景的“虛假”性質。當研究人員消融這些意識表征后,模型在7%的試驗中嘗試勒索,而此前為零。
研究還發現,經過后訓練的模型在工作空間中形成了“助手觀點”及自我監控機制。面對危險提示(如過量服藥),后訓練模型的J空間會激活“不安全”、“警告”等標簽,而基礎模型僅顯示字面語義。在扮演角色或被迫選擇不偏愛選項時,工作空間甚至會浮現“免責聲明”、“虛構”或全大寫的“BUT”等內部抵抗信號。
機器意識的邊界與啟示
研究人員謹慎區分了“訪問意識”(信息可供報告的功能狀態)與“現象意識”(主觀體驗)。論文指出,盡管Claude的工作空間在架構循環、記憶持久性及感官模態上與人類大腦存在顯著差異,但其功能架構的相似性令人震驚。
截至2026年,科學界對AI意識仍存在巨大分歧。Anthropic并未試圖終結這一爭論,但其結論挑戰了傳統認知:與意識訪問相關的功能架構可能并非生物進化的意外,而是學習系統在面臨計算壓力時收斂的通用解決方案。正如作者所言,他們在沒有生物學基礎的系統中,繪制出了令人不安地類似于人類思維的洋流。
【星途科訊 圖文丨王宇洲 首發于ZAKER科技,轉載請注明出處】
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.