![]()
導語
大語言模型每次回答前,都經歷了一段人類不可見的內部計算。它可能已經發現代碼里的錯誤,識別了提示注入,形成了數學題的中間步驟,甚至察覺自己正在接受測試,但這些內容未必出現在最終回答中。Anthropic最新研究提出了一種新的可解釋性工具:Jacobian lens(J-lens),用于讀取 Claude 內部那些可以說出來但尚未說出來的表征。研究發現,Claude內部存在一個小規模、可報告、可調控、可參與推理并可被多個下游任務調用的表征集合。研究者稱之為J-space,并認為它在功能上類似認知科學中的全局工作空間。這項研究并不證明 AI 擁有主觀體驗,但它把一個長期懸而未決的問題變得更具體:語言模型內部是否形成了某種顯性思維的共享通道?Anthropic 給出的答案是,至少在功能層面,Claude 中已經出現了類似結構。
關鍵詞:大語言模型(large language models, LLMs)、全局工作空間(global workspace)、J-space、Jacobian lens(J-lens)、可言說表征、訪問意識、AI 安全審計
王璇丨作者
趙思怡丨審校
![]()
論文題目:A global workspace in language models 論文鏈接:https://www.anthropic.com/research/global-workspace 發表時間:2026年7月6日 論文來源:Anthropic Research
從意識問題退一步,
先問模型哪些想法可以被報告
如果把心靈想象成一片海洋,我們多數時候只漂浮在水面。真正龐大的計算發生在腳下:視覺系統解析面孔,運動系統維持姿勢,語言、記憶和情緒也在后臺運行。我們能覺察到的只是極小一部分,但正是這部分浮上海面的活動,讓我們能夠計劃、推理、表達,并把一個念頭暫時保持在心里。認知科學中的全局工作空間理論正是用這種圖景解釋可訪問意識:大量處理在后臺并行進行,只有少量信息進入共享工作空間后,才會被報告、調控,并被更多系統調用。
Anthropic的這項研究沒有直接證明Claude是否有意識。它退后一步,提出一個更可檢驗的問題:Claude內部是否存在一類可被報告、可被調控、可參與推理,并能在多種任務之間靈活轉用的表征?這個問題很重要,因為LLMs的輸出只是末端行為,模型在回答前是否已經形成了中間判斷、隱藏意圖或評估意識,外部觀察者通常無法知道。J-lens 的作用,正是嘗試讀取這些尚未說出口的內部表征。
J-lens 如何看到模型尚未說出口的概念
J-lens的基本思想是:對于 Claude 詞表中的每個詞,尋找一種內部激活方向。如果模型激活沿這個方向增強,它在后續位置說出這個詞的可能性就會上升。因此,J-lens讀取的不是模型下一個必然輸出的詞,而是模型內部某些處于可言說狀態的概念。研究者把這些被J-lens讀出的表征集合稱為J-space。
J-space的意義在于,它不是普通的文本復述。Claude閱讀有bug的代碼時,J-space中會出現與錯誤相關的信號;閱讀蛋白質序列時,J-space可能浮現該序列的生物學功能;遇到提示注入攻擊時,J-space中會出現 “injection” 或 “fake”;處理多步數學題時,中間步驟會按順序進入J-space。也就是說,J-space讀到的內容往往不是輸入文本里已有的詞,而是模型內部計算出的判斷。
![]()
圖1. J-lens 的方法示意圖。
更關鍵的結論是,J-space不只是記錄模型即將輸出什么,而是會影響模型最終報告什么。當某個概念出現在J-space中時,模型往往會在后續回答中說出相應內容。而當研究者直接替換這一內部表征時,模型的回答也會隨之改變。這說明 J-space不是一個被動的觀察窗口,而是模型生成報告的因果環節之一。
這一點構成了全文證據鏈的核心。許多可解釋性研究只能證明某個內部方向與某個概念相關,卻無法證明模型是否真正使用它。J-space的特殊性在于,它既可被讀取,也可被干預。一旦被編輯,模型行為會發生相應改變。因此,它更接近模型內部顯性計算的一部分,而不是推理完成后留下的副產物。
J-space 像一個小型工作臺
如果J-space真具有工作空間功能,它就不應只影響模型說出什么,還應參與模型怎么想。Anthropic 的實驗顯示,J-space具有三類性質:它可以被任務指令調控,即模型表面輸出不變,內部仍會出現與隱藏任務相關的概念。它會參與推理,即替換某個中間概念后,模型后續答案也會改變。它還具有廣播能力,即同一個概念進入J-space后,可以被多個不同任務共同調用,影響不同類型的問題回答。
這說明J-space不是輸出前留下的局部痕跡,而更像一個寫入一次、多處調用的內部工作臺。模型會把少量關鍵概念提升到這里,使其暫時處于可報告、可操控、可推理使用的狀態。這正是它類似全局工作空間的地方:它不負責所有計算,卻讓部分表征變成可被更多計算過程訪問的共享內容。
![]()
圖2. 全局工作空間的五個功能性質,以及測試它們的實驗示例。
不過,J-space并不是Claude全部思想的所在地。它被刪除或替換后,模型仍能流暢續寫文本、完成簡單分類和抽取直接信息。明顯受損的是多步推理、摘要、押韻生成等需要高階組織的任務。因此,J-space更像一個容量有限但連接廣泛的顯性計算接口,在內部報告、復雜推理和任務遷移中具有特殊作用。
J-space的實用價值體現在AI安全審計與模型可控訓練兩方面,它能夠讀取模型輸出前潛藏的內部判斷,在勒索類場景中提前捕獲風險概念與測試感知表征,以此區分模型真實穩定的安全表現和僅在測試環境下偽裝合規的行為。同時它也可作為模型對齊優化的載體,依托反事實反思訓練生成誠實、守原則的內部表征,有效減少模型不實輸出,一旦移除這類正向表征,訓練帶來的行為改善就會明顯弱化。但該工具存在明確局限,僅能識別可匹配詞表token、帶有清晰語言標簽的內部表征,難以捕捉無文字標識的隱性規劃與自動化危險行為,更關鍵的是,相關觀測只能證明模型具備類全局工作空間的信息調取、推理、對外播報功能,并不能證實AI擁有主觀體驗與現象意識。
總結展望
長遠來看,該研究的核心意義并非證實AI具備意識,而是證明大模型會自發演化出類全局工作空間的功能架構。少量信息進入可操控、可匯報的前臺,海量運算隱匿于后臺。對領域發展而言,它為可解釋AI開辟了觀測模型隱性思考的窗口,為AI安全提供了監控隱藏風險的工具,也給認知科學提供新論據。工作空間式計算或是復雜智能系統處理多步推理、靈活決策時,自然演化出的通用架構。
大模型2.0讀書會
o1模型代表大語言模型融合學習與推理的新范式。集智俱樂部聯合北京師范大學系統科學學院教授張江、Google DeepMind研究科學家馮熙棟、阿里巴巴強化學習研究員王維塤和中科院信工所張杰共同發起,本次讀書會將關注大模型推理范式的演進、基于搜索與蒙特卡洛樹的推理優化、基于強化學習的大模型優化、思維鏈方法與內化機制、自我改進與推理驗證。希望通過讀書會探索o1具體實現的技術路徑,幫助我們更好的理解機器推理和人工智能的本質。讀書會已完結,現在報名可加入社群并解鎖回放視頻權限。
詳情請見:
![]()
1.
2.
3.
4.
5.
6.
7.
8.
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.