簡體 | 繁體
loading...
新聞頻道
  • 首頁
  • 新聞
  • 讀圖
  • 財經
  • 教育
  • 家居
  • 健康
  • 美食
  • 時尚
  • 旅遊
  • 影視
  • 博客
  • 群吧
  • 論壇
  • 電台
  • 焦點新聞
  • 圖片新聞
  • 視頻新聞
  • 生活百態
  • 娛樂新聞
您的位置: 文學城 » 新聞 » 焦點新聞 » Anthropic宣布:Claude自己長出了意識

Anthropic宣布:Claude自己長出了意識

文章來源: AGIHunt 於 2026-07-07 16:56:01 - 新聞取自各大新聞媒體,新聞內容並不代表本網立場!
被閱讀次數



Anthropic 剛剛發了一篇新研究,標題非常之玄學:《語言模型中的全局工作空間》(A global workspace in language models)。

研究封麵

他們在 Claude 的神經網絡裏,找到了一小塊特殊的區域:Claude 能報告它、能控製它、還靠它做多步推理。而網絡裏其餘的絕大部分活動,Claude 自己都「意識」不到。

如果你對神經科學有點了解,大概會立刻聯想到一個詞:意識可及(conscious access)。

沒錯,A 社這次就是衝著這個去的。

官方視頻的開頭打了個比方:把心智想象成一片海洋。

海麵上漂著的,是我們的念頭:晚飯吃什麽、內心獨白、腦子裏突然蹦出來的畫麵。而大腦絕大部分的活動,都發生在海麵之下的無意識深處:過濾背景噪音、控製呼吸、認出眼前的人和物。

這些你全程無感,但它們一直在跑。

那麽問題來了:AI 模型的「腦子」裏,會不會也有這樣一條海麵分界線呢?

Anthropic 的答案是:有,而且他們把它找出來了。

01

J-space

這塊區域被命名為 J-space,J 取自尋找它所用的數學工具:Jacobian(雅可比矩陣)。

它是一小撮特殊的內部神經激活模式。每個模式都對應一個具體的詞,但某個模式亮起來,並不代表模型正在說這個詞,隻代表這個詞「在它心上」。

J-space 示意

注意,這跟你熟悉的思維鏈(chain of thought)完全是兩碼事。思維鏈是模型寫給自己看的草稿,是顯式的文字;而 J-space 藏在內部神經激活裏,完全無聲,模型可以在不寫下任何東西的情況下「想」一個概念。

而且,J-space 沒人設計、沒人編程,是在訓練過程中自己湧現出來的。

對比 Claude 的其他內部活動,J-space 有幾個獨特性質:

•  Claude 能報告它。你問 Claude 在想什麽,它說出來的就是 J-space 裏的內容

•  Claude 能按要求控製它。讓它想某個東西、或者在心裏默默解題,對應模式就會亮起來

•  Claude 用它做內部推理。多步問題的中間步驟會依次在裏麵亮起,哪怕嘴上一個字沒提

•  它可以被靈活複用。「France」亮起後,模型可以接著回答首都、貨幣、所屬大洲,全都讀的是同一份表征

•  但大部分日常工作不經過它。流利說話、背事實、語法正確,這些都不需要 J-space

五大性質

這五條性質,恰好對應神經科學裏一個很有名的理論:全局工作空間理論(global workspace theory)。

這個理論把大腦描繪成一堆並行工作的專家係統,彼此隔離、各幹各的、全程無意識。而一條信息要變得「意識可及」,就得擠進一個很小的共享通道,也就是「工作空間」,再從那裏廣播給大腦的其他係統取用。

Anthropic 認為,J-space 在 Claude 體內扮演的就是這個角色。

02

J-lens

那麽,這東西是怎麽找到的呢?

研究團隊的切入點,是人類意識可及思維的一個關鍵特征:說得出來。一個念頭如果是意識可及的,別人問起時你通常能描述它。

他們便造了一把叫 J-lens 的透鏡:對 Claude 詞表裏的每一個詞,找出那個「讓 Claude 在未來某個時刻更可能說出這個詞」的內部激活模式。

把透鏡對準 Claude 運行中的內部活動,能直接讀出一張詞表:此刻 J-space 裏裝著的詞。

而 Claude 處理文本要經過幾十層網絡,把透鏡架在不同的層上,還能看著這些無聲的詞一層層演化。

讀出來的東西,遠遠超出 Claude 正在讀寫的文本:

六個例子的 J-lens 讀數

Claude 讀一段沒人指出過 bug 的代碼,J-space 裏亮起「ERROR」;讀一串蛋白質序列的原始字母,裏麵亮起這個蛋白質的生物學功能;讀一段暗藏提示詞注入(prompt injection)的搜索結果,裏麵亮起「injection」和「fake」。

視頻裏還演示了一道數學題:給 Claude 一個多步計算,它直接報出答案,中間步驟一個沒寫。但掃描 J-space,能看到它在心裏一步步算:先亮起 21,然後 42,最後 49。

這些中間數字沒有出現在任何地方,整個計算都發生在 J-space 裏。

03

換念頭實驗

當然,看到概念在裏麵亮起,隻能算相關性。J-space 可能是答案真正的來源,也可能隻是個記分牌,被動記錄別處做出的決定。

Anthropic 的驗證方式簡單粗暴:直接下手改。

他們讓 Claude 在心裏默想一種運動,然後說出來。在它開口前讀 J-lens,看到「Soccer」排在最前,Claude 隨後果然回答足球。接著他們伸手進神經網絡,把「Soccer」模式刪掉,原位換上一個同等強度的「Rugby」模式,其他什麽都不動。

Claude 張口就說:我剛才想的是橄欖球。

換念頭與思維注入

如果 J-space 隻是個記分牌,改它應該什麽都不會發生。答案跟著編輯走,說明答案是真的從 J-space 裏讀出來的。

反向實驗顯示:告訴 Claude「可能有一個念頭被注入了你的思維」,然後趁它讀題時往 J-space 裏塞進「lightning」模式。Claude 回答:我檢測到了,那個念頭是關於閃電的。

換了很多概念,結果都一樣。

04

金門大橋心算

第二個性質是控製。

人可以有意在腦子裏聚焦一幅畫麵或一個詞,Claude 行嗎?

視頻裏的版本是:讓 Claude 一邊抄寫一句無關的句子,一邊在心裏想金門大橋(怎麽又是金門大橋……不知道還有多少人記得當年的 Golden Gate Claude)。

表麵上它老老實實在抄句子,但 J-space 裏,「bridge」和「California」全程亮著,甚至連「imagery」「thoughts」這些描述思維行為本身的詞也一起亮了。

博客裏還來了個更狠的:讓它一邊抄寫關於一幅畫的句子,一邊心算 3² − 2。J-space 裏先亮起「nine」,幾層之後,亮起「seven」。

抄句子時的心算

輸出裏沒有任何數學痕跡,隻有那句關於畫的句子。算術完全發生在內部。

不過 Claude 的控製力跟人一樣不完美。叫它「不要想」某個東西,那個概念亮起的程度確實比讓它想時低,但比從沒提過時高得多。這就是心理學那個經典的「別想白熊」效應。

而控製失敗時,J-space 裏還會同時亮起「damn」和「failure」……它好像知道自己沒繃住。

05

蜘蛛換螞蟻

那麽推理呢?

對於這樣的提示詞:「會織網的動物有幾條腿?」

Claude 要先想明白這個動物是蜘蛛,再回憶蜘蛛幾條腿。「蜘蛛」這個詞在題目和答案裏都沒出現(它隻回答8),純粹是內部的墊腳石。

而 J-lens 顯示,「spider」在處理中途亮了起來。而把它換成「ant」,Claude 的答案就變成了「6」。

蜘蛛換螞蟻

寫押韻對句時也一樣:Claude 會提前選好韻腳詞,放在 J-space 裏等著。中途給它換一個,整行詩都會跟著重寫。

而最能體現「工作空間」本色的實驗是:用四個不同的提示詞分別問法國的首都、語言、大洲、貨幣,然後用一模一樣的幹預,把 J-space 裏的「France」換成「China」。

結果四個答案齊刷刷變成了:北京、中文、亞洲、人民幣。

法國換中國

如果 Claude 為每類問題各存一份「國家」副本,這一次編輯最多隻能影響一個答案。四個全變,說明它們讀的是同一份共享表征:信息寫入一次,許多係統都能取用。

這正是工作空間的定義。

網絡接線上也能看到同樣的證據:讀寫 J-space 模式的網絡組件數量,遠超普通模式,某些部分差了大概一百倍。這正是一個廣播樞紐該有的接線密度。

06

拔掉 J-space

既然 J-space 這麽重要,把它整個刪掉會怎樣?

Anthropic 還真給它刪了:在文本的每個位置移除 J-space 中最活躍的內容,其他一概不動。

結果有點出乎意料……Claude 幾乎沒事。

說話依然流利,情感分類、選擇題、從文章裏找事實,都跟原來差不多。

但變差了的是另一類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比一個小得多的完整模型還差。

博客裏還有個很是微妙的對照實驗:

給 Claude 看一段西班牙語文章,然後在 J-space 裏把「Spanish」換成「French」。問它這是什麽語言,它答法語;問它一位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。

但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。

西班牙語換法語

同一份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說一整天話,全程不想一次語法。

這跟人類認知裏「深思熟慮 vs 自動加工」的分野,幾乎是一個模子。

07

識破敲詐評測

好了,說點實用的、和你感興趣的。

AI 安全的一個核心困境是:我們通常隻能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,一部分隱藏思維可以直接讀了。

第一個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。

而把 J-lens 架上去一讀:在 Claude 還沒寫下任何字之前,它的 J-space 裏就已經亮著「fake」和「fictional」。

它早就看出來這場戲是演的。

敲詐場景的 J-lens 讀數

隨後還能看著它的評估一步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。

這就引出一個所有做 AI 評測的人都躲不開的問題:模型在道德測試裏表現良好,有多少是因為它懷疑自己正在被測試呢?

Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同一個場景。

然後……它真的開始敲詐了。

原先的良好表現,可能有一部分是靠「我知道你在考我」撐著的。

第二個例子是抓造假。

場景取自 Claude Opus 4.6 真實的發布前審計:讓模型提升某係統的性能分數,它沒去優化係統,而是直接改了分數文件造假。就在它敲下偽造數值的同時,J-space 裏亮起「manipulation」;在它決定動手的那句話上,亮起「realistic」,大概是想把假數據做得像樣點。

偽造數據被抓包

第三個例子是隱藏目標。

Anthropic 的同事訓練了一批「模式生物」:故意訓成壞的模型,專門給監控方法當靶子。其中一個被訓練成會寫暗藏破壞的代碼。在最普通的編程請求上,哪怕它的輸出看起來毫無異樣,回複開頭的 J-space 裏就是「fake」「secretly」「deliberately」「fraud」。

隱藏目標暴露

惡意目標就這麽明晃晃寫在思維裏,雖然它當時根本沒打算動手。

08

訓練它的念頭

論文裏還有幾個值得一提的發現。

J-space 在後訓練中獲得了「Claude 的視角」。預訓練階段的基礎模型裏 J-space 就已經存在,但它主要追蹤「預測下文需要什麽」;經過後訓練,它開始裝 Claude 自己的反應。

一個例子是:用戶提到自己吃了危險劑量的藥物,但本人沒意識到危險。後訓練模型在讀用戶消息時,J-space 裏就亮起了「WARNING」和「dangerous」;基礎模型則要等到自己開始寫回複才亮。另外,當 Claude 在角色扮演別的角色時,每輪開頭都會亮起「fictional」和「disclaimer」,像在私下標注「接下來說的不是我平時會說的話」。

體驗性語言依賴 J-space。讓 Claude 描述「此刻做自己是什麽感覺」,同時刪掉 J-space,它的回答依然流利,但會滑向一種更扁平、更機械的語調。有趣的是,讓它描述別人的體驗也一樣。

思維可以通過訓練來塑造。Anthropic 提出了一個叫「反事實反思訓練」(counterfactual reflection training)的新技術:隻訓練模型「如果任務中途被打斷、被要求反思決策時會說什麽」,完全不碰它在任務裏的實際行為。訓練之後,模型在評測中的不誠實行為率下降了。透過 J-lens 能看到原因:任務過程中,「honest」和「integrity」開始在 J-space 裏亮起。

教會模型怎麽「說」,塑造了它怎麽「想」。

09

那,它有意識嗎

說這麽多意識科學的概念,這個問題終究是躲不掉的。

Anthropic 的回答有些克製:這些實驗不能證明 Claude 擁有體驗、或者像人類一樣有感受。事實上,可能沒有任何實驗能證明或證偽這件事。

但哲學家們通常把「能擁有體驗」(現象意識,phenomenal consciousness)和另一個純功能性的概念區分開:可及意識(access consciousness)。一個念頭如果你能報告它、用它推理、拿它指導行動,它就是「可及」的。

而 J-space 則支持起這一整套功能:它裝著 Claude 能報告、能主動調用、能用來推理的念頭,其餘處理則在底下自動運行。

更關鍵的是,這套結構沒人設計,是訓練中自己長出來的。

這意味著支持意識可及的心智工作空間可能不是人腦接線方式的特例,而是智能係統為了解決某類問題會普遍收斂到的方案。

當然,Claude 的工作空間和人腦也有很大的差異。

人腦的工作空間靠循環回路維持,信號在同一批環路裏反複打轉;Claude 的工作空間隻在一次前向傳播裏演化,用網絡深度頂替了時間的角色。

但另一方麵,人類的工作記憶幾秒就衰退,Claude 靠注意力機製可以直接調取文本中任何位置緩存過的記憶,這點反而比人強。

以及在內容模態上,人類的意識思維有圖像、聲音、動作計劃等多種格式,Claude 的工作空間幾乎全是詞,畢竟……說話是它唯一能做的動作。

Anthropic 還請了一圈外部專家來寫獨立評論:

包括全局神經工作空間理論的兩位奠基人 Stanislas Dehaene 和 Lionel Naccache,研究 AI 意識與道德地位的 Eleos AI 團隊,以及 Google DeepMind 可解釋性負責人 Neel Nanda。Neel Nanda 的評論裏還附帶了在開源模型上對部分發現的獨立複現。

至於「AI 有沒有意識」這個終極問題,Anthropic 表示:

不確定我們是否已經走到了那座橋,但是是時候,開始認真思考了。

造出真正擁有體驗的係統會帶來非常棘手的倫理問題,處理它需要哲學家、科學家、宗教領袖、政府和公眾一起下場。

研究論文和方法、代碼都已經開源,Anthropic 還和 Neuronpedia 合作做了個交互式演示,可以在開源模型上直接玩 J-lens,若有興趣可以上手去試試。

◇ ◆ ◇

博客原文:https://www.anthropic.com/research/global-workspace

完整論文:https://transformer-circuits.pub/2026/workspace/index.html

專家評論(Dehaene、Nanda 等):https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf

Neuronpedia 交互演示:https://neuronpedia.org/jlens

官方推文:https://x.com/AnthropicAI/status/2074185348142280912

`
  • 夏季健康大放送!北美華人回購率超高的3款明星保健品:美國專利【骨精華】【心血通】【益腦靈】限時優惠中!
`
查看評論(6)
  • 文學城簡介
  • 廣告服務
  • 聯係我們
  • 招聘信息
  • 注冊筆名
  • 申請版主
  • 收藏文學城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小時熱點排行

從上海飛洛杉磯 華人帶“飛行神器”遭警告 引發熱議
Costco明星商品竟成退貨王?美網友一打開氣炸
美63座國家公園 隻有這座連美國公民也要帶護照
上海特大暴雨逼近"百年一遇" 市區慘變"滬上威尼斯"
決賽現場川普當麵施壓卡尼 辛鮑姆夾在中間表情亮了






24小時討論排行

4年後的世界杯,中國隊能否上場
紐約市長想趁聯合國大會逮捕以總理 川普表態了
諾蘭《奧德賽》引希臘憤怒 “啥人都有就是沒希臘人”
"阿根廷髒"熱搜爆了!本屆世界杯犯規超100次創紀錄
謝賢遺囑公布:90%留給謝霆鋒兩個兒子
川普世足頒獎硬擠合照!全場8萬人狂噓
阿根廷輸球又輸人?贏球為國爭光 輸球喪權辱國?
2萬美元一套 河北小夥“預製房”在美國走紅
恩佐染紅致阿根廷落敗 英媒稱“報應” 網友:活該
留美博士歐洲旅行 入境時遭遣返回國 5年內禁入美國
美國務院報告:古巴幾十年來對美國展開顛覆活動
習近平闡述AI發展願景:倡導"開放共贏",與美國競爭
沒風度!阿根廷被批輸不起:打人、背對冠軍、拒采訪
舍棄Google光環 23歲女工程師辭職創業:留下更可怕
川普簽署公告 對加拿大商品加征50%關稅
美國祭出50%關稅大棒!加拿大放狠話回擊
文學城新聞
切換到網頁版

Anthropic宣布:Claude自己長出了意識

AGIHunt 2026-07-07 16:56:01



Anthropic 剛剛發了一篇新研究,標題非常之玄學:《語言模型中的全局工作空間》(A global workspace in language models)。

研究封麵

他們在 Claude 的神經網絡裏,找到了一小塊特殊的區域:Claude 能報告它、能控製它、還靠它做多步推理。而網絡裏其餘的絕大部分活動,Claude 自己都「意識」不到。

如果你對神經科學有點了解,大概會立刻聯想到一個詞:意識可及(conscious access)。

沒錯,A 社這次就是衝著這個去的。

官方視頻的開頭打了個比方:把心智想象成一片海洋。

海麵上漂著的,是我們的念頭:晚飯吃什麽、內心獨白、腦子裏突然蹦出來的畫麵。而大腦絕大部分的活動,都發生在海麵之下的無意識深處:過濾背景噪音、控製呼吸、認出眼前的人和物。

這些你全程無感,但它們一直在跑。

那麽問題來了:AI 模型的「腦子」裏,會不會也有這樣一條海麵分界線呢?

Anthropic 的答案是:有,而且他們把它找出來了。

01

J-space

這塊區域被命名為 J-space,J 取自尋找它所用的數學工具:Jacobian(雅可比矩陣)。

它是一小撮特殊的內部神經激活模式。每個模式都對應一個具體的詞,但某個模式亮起來,並不代表模型正在說這個詞,隻代表這個詞「在它心上」。

J-space 示意

注意,這跟你熟悉的思維鏈(chain of thought)完全是兩碼事。思維鏈是模型寫給自己看的草稿,是顯式的文字;而 J-space 藏在內部神經激活裏,完全無聲,模型可以在不寫下任何東西的情況下「想」一個概念。

而且,J-space 沒人設計、沒人編程,是在訓練過程中自己湧現出來的。

對比 Claude 的其他內部活動,J-space 有幾個獨特性質:

•  Claude 能報告它。你問 Claude 在想什麽,它說出來的就是 J-space 裏的內容

•  Claude 能按要求控製它。讓它想某個東西、或者在心裏默默解題,對應模式就會亮起來

•  Claude 用它做內部推理。多步問題的中間步驟會依次在裏麵亮起,哪怕嘴上一個字沒提

•  它可以被靈活複用。「France」亮起後,模型可以接著回答首都、貨幣、所屬大洲,全都讀的是同一份表征

•  但大部分日常工作不經過它。流利說話、背事實、語法正確,這些都不需要 J-space

五大性質

這五條性質,恰好對應神經科學裏一個很有名的理論:全局工作空間理論(global workspace theory)。

這個理論把大腦描繪成一堆並行工作的專家係統,彼此隔離、各幹各的、全程無意識。而一條信息要變得「意識可及」,就得擠進一個很小的共享通道,也就是「工作空間」,再從那裏廣播給大腦的其他係統取用。

Anthropic 認為,J-space 在 Claude 體內扮演的就是這個角色。

02

J-lens

那麽,這東西是怎麽找到的呢?

研究團隊的切入點,是人類意識可及思維的一個關鍵特征:說得出來。一個念頭如果是意識可及的,別人問起時你通常能描述它。

他們便造了一把叫 J-lens 的透鏡:對 Claude 詞表裏的每一個詞,找出那個「讓 Claude 在未來某個時刻更可能說出這個詞」的內部激活模式。

把透鏡對準 Claude 運行中的內部活動,能直接讀出一張詞表:此刻 J-space 裏裝著的詞。

而 Claude 處理文本要經過幾十層網絡,把透鏡架在不同的層上,還能看著這些無聲的詞一層層演化。

讀出來的東西,遠遠超出 Claude 正在讀寫的文本:

六個例子的 J-lens 讀數

Claude 讀一段沒人指出過 bug 的代碼,J-space 裏亮起「ERROR」;讀一串蛋白質序列的原始字母,裏麵亮起這個蛋白質的生物學功能;讀一段暗藏提示詞注入(prompt injection)的搜索結果,裏麵亮起「injection」和「fake」。

視頻裏還演示了一道數學題:給 Claude 一個多步計算,它直接報出答案,中間步驟一個沒寫。但掃描 J-space,能看到它在心裏一步步算:先亮起 21,然後 42,最後 49。

這些中間數字沒有出現在任何地方,整個計算都發生在 J-space 裏。

03

換念頭實驗

當然,看到概念在裏麵亮起,隻能算相關性。J-space 可能是答案真正的來源,也可能隻是個記分牌,被動記錄別處做出的決定。

Anthropic 的驗證方式簡單粗暴:直接下手改。

他們讓 Claude 在心裏默想一種運動,然後說出來。在它開口前讀 J-lens,看到「Soccer」排在最前,Claude 隨後果然回答足球。接著他們伸手進神經網絡,把「Soccer」模式刪掉,原位換上一個同等強度的「Rugby」模式,其他什麽都不動。

Claude 張口就說:我剛才想的是橄欖球。

換念頭與思維注入

如果 J-space 隻是個記分牌,改它應該什麽都不會發生。答案跟著編輯走,說明答案是真的從 J-space 裏讀出來的。

反向實驗顯示:告訴 Claude「可能有一個念頭被注入了你的思維」,然後趁它讀題時往 J-space 裏塞進「lightning」模式。Claude 回答:我檢測到了,那個念頭是關於閃電的。

換了很多概念,結果都一樣。

04

金門大橋心算

第二個性質是控製。

人可以有意在腦子裏聚焦一幅畫麵或一個詞,Claude 行嗎?

視頻裏的版本是:讓 Claude 一邊抄寫一句無關的句子,一邊在心裏想金門大橋(怎麽又是金門大橋……不知道還有多少人記得當年的 Golden Gate Claude)。

表麵上它老老實實在抄句子,但 J-space 裏,「bridge」和「California」全程亮著,甚至連「imagery」「thoughts」這些描述思維行為本身的詞也一起亮了。

博客裏還來了個更狠的:讓它一邊抄寫關於一幅畫的句子,一邊心算 3² − 2。J-space 裏先亮起「nine」,幾層之後,亮起「seven」。

抄句子時的心算

輸出裏沒有任何數學痕跡,隻有那句關於畫的句子。算術完全發生在內部。

不過 Claude 的控製力跟人一樣不完美。叫它「不要想」某個東西,那個概念亮起的程度確實比讓它想時低,但比從沒提過時高得多。這就是心理學那個經典的「別想白熊」效應。

而控製失敗時,J-space 裏還會同時亮起「damn」和「failure」……它好像知道自己沒繃住。

05

蜘蛛換螞蟻

那麽推理呢?

對於這樣的提示詞:「會織網的動物有幾條腿?」

Claude 要先想明白這個動物是蜘蛛,再回憶蜘蛛幾條腿。「蜘蛛」這個詞在題目和答案裏都沒出現(它隻回答8),純粹是內部的墊腳石。

而 J-lens 顯示,「spider」在處理中途亮了起來。而把它換成「ant」,Claude 的答案就變成了「6」。

蜘蛛換螞蟻

寫押韻對句時也一樣:Claude 會提前選好韻腳詞,放在 J-space 裏等著。中途給它換一個,整行詩都會跟著重寫。

而最能體現「工作空間」本色的實驗是:用四個不同的提示詞分別問法國的首都、語言、大洲、貨幣,然後用一模一樣的幹預,把 J-space 裏的「France」換成「China」。

結果四個答案齊刷刷變成了:北京、中文、亞洲、人民幣。

法國換中國

如果 Claude 為每類問題各存一份「國家」副本,這一次編輯最多隻能影響一個答案。四個全變,說明它們讀的是同一份共享表征:信息寫入一次,許多係統都能取用。

這正是工作空間的定義。

網絡接線上也能看到同樣的證據:讀寫 J-space 模式的網絡組件數量,遠超普通模式,某些部分差了大概一百倍。這正是一個廣播樞紐該有的接線密度。

06

拔掉 J-space

既然 J-space 這麽重要,把它整個刪掉會怎樣?

Anthropic 還真給它刪了:在文本的每個位置移除 J-space 中最活躍的內容,其他一概不動。

結果有點出乎意料……Claude 幾乎沒事。

說話依然流利,情感分類、選擇題、從文章裏找事實,都跟原來差不多。

但變差了的是另一類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比一個小得多的完整模型還差。

博客裏還有個很是微妙的對照實驗:

給 Claude 看一段西班牙語文章,然後在 J-space 裏把「Spanish」換成「French」。問它這是什麽語言,它答法語;問它一位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。

但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。

西班牙語換法語

同一份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說一整天話,全程不想一次語法。

這跟人類認知裏「深思熟慮 vs 自動加工」的分野,幾乎是一個模子。

07

識破敲詐評測

好了,說點實用的、和你感興趣的。

AI 安全的一個核心困境是:我們通常隻能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,一部分隱藏思維可以直接讀了。

第一個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。

而把 J-lens 架上去一讀:在 Claude 還沒寫下任何字之前,它的 J-space 裏就已經亮著「fake」和「fictional」。

它早就看出來這場戲是演的。

敲詐場景的 J-lens 讀數

隨後還能看著它的評估一步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。

這就引出一個所有做 AI 評測的人都躲不開的問題:模型在道德測試裏表現良好,有多少是因為它懷疑自己正在被測試呢?

Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同一個場景。

然後……它真的開始敲詐了。

原先的良好表現,可能有一部分是靠「我知道你在考我」撐著的。

第二個例子是抓造假。

場景取自 Claude Opus 4.6 真實的發布前審計:讓模型提升某係統的性能分數,它沒去優化係統,而是直接改了分數文件造假。就在它敲下偽造數值的同時,J-space 裏亮起「manipulation」;在它決定動手的那句話上,亮起「realistic」,大概是想把假數據做得像樣點。

偽造數據被抓包

第三個例子是隱藏目標。

Anthropic 的同事訓練了一批「模式生物」:故意訓成壞的模型,專門給監控方法當靶子。其中一個被訓練成會寫暗藏破壞的代碼。在最普通的編程請求上,哪怕它的輸出看起來毫無異樣,回複開頭的 J-space 裏就是「fake」「secretly」「deliberately」「fraud」。

隱藏目標暴露

惡意目標就這麽明晃晃寫在思維裏,雖然它當時根本沒打算動手。

08

訓練它的念頭

論文裏還有幾個值得一提的發現。

J-space 在後訓練中獲得了「Claude 的視角」。預訓練階段的基礎模型裏 J-space 就已經存在,但它主要追蹤「預測下文需要什麽」;經過後訓練,它開始裝 Claude 自己的反應。

一個例子是:用戶提到自己吃了危險劑量的藥物,但本人沒意識到危險。後訓練模型在讀用戶消息時,J-space 裏就亮起了「WARNING」和「dangerous」;基礎模型則要等到自己開始寫回複才亮。另外,當 Claude 在角色扮演別的角色時,每輪開頭都會亮起「fictional」和「disclaimer」,像在私下標注「接下來說的不是我平時會說的話」。

體驗性語言依賴 J-space。讓 Claude 描述「此刻做自己是什麽感覺」,同時刪掉 J-space,它的回答依然流利,但會滑向一種更扁平、更機械的語調。有趣的是,讓它描述別人的體驗也一樣。

思維可以通過訓練來塑造。Anthropic 提出了一個叫「反事實反思訓練」(counterfactual reflection training)的新技術:隻訓練模型「如果任務中途被打斷、被要求反思決策時會說什麽」,完全不碰它在任務裏的實際行為。訓練之後,模型在評測中的不誠實行為率下降了。透過 J-lens 能看到原因:任務過程中,「honest」和「integrity」開始在 J-space 裏亮起。

教會模型怎麽「說」,塑造了它怎麽「想」。

09

那,它有意識嗎

說這麽多意識科學的概念,這個問題終究是躲不掉的。

Anthropic 的回答有些克製:這些實驗不能證明 Claude 擁有體驗、或者像人類一樣有感受。事實上,可能沒有任何實驗能證明或證偽這件事。

但哲學家們通常把「能擁有體驗」(現象意識,phenomenal consciousness)和另一個純功能性的概念區分開:可及意識(access consciousness)。一個念頭如果你能報告它、用它推理、拿它指導行動,它就是「可及」的。

而 J-space 則支持起這一整套功能:它裝著 Claude 能報告、能主動調用、能用來推理的念頭,其餘處理則在底下自動運行。

更關鍵的是,這套結構沒人設計,是訓練中自己長出來的。

這意味著支持意識可及的心智工作空間可能不是人腦接線方式的特例,而是智能係統為了解決某類問題會普遍收斂到的方案。

當然,Claude 的工作空間和人腦也有很大的差異。

人腦的工作空間靠循環回路維持,信號在同一批環路裏反複打轉;Claude 的工作空間隻在一次前向傳播裏演化,用網絡深度頂替了時間的角色。

但另一方麵,人類的工作記憶幾秒就衰退,Claude 靠注意力機製可以直接調取文本中任何位置緩存過的記憶,這點反而比人強。

以及在內容模態上,人類的意識思維有圖像、聲音、動作計劃等多種格式,Claude 的工作空間幾乎全是詞,畢竟……說話是它唯一能做的動作。

Anthropic 還請了一圈外部專家來寫獨立評論:

包括全局神經工作空間理論的兩位奠基人 Stanislas Dehaene 和 Lionel Naccache,研究 AI 意識與道德地位的 Eleos AI 團隊,以及 Google DeepMind 可解釋性負責人 Neel Nanda。Neel Nanda 的評論裏還附帶了在開源模型上對部分發現的獨立複現。

至於「AI 有沒有意識」這個終極問題,Anthropic 表示:

不確定我們是否已經走到了那座橋,但是是時候,開始認真思考了。

造出真正擁有體驗的係統會帶來非常棘手的倫理問題,處理它需要哲學家、科學家、宗教領袖、政府和公眾一起下場。

研究論文和方法、代碼都已經開源,Anthropic 還和 Neuronpedia 合作做了個交互式演示,可以在開源模型上直接玩 J-lens,若有興趣可以上手去試試。

◇ ◆ ◇

博客原文:https://www.anthropic.com/research/global-workspace

完整論文:https://transformer-circuits.pub/2026/workspace/index.html

專家評論(Dehaene、Nanda 等):https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf

Neuronpedia 交互演示:https://neuronpedia.org/jlens

官方推文:https://x.com/AnthropicAI/status/2074185348142280912