日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

71
累積集數
597
則深度解讀
6
大追蹤分類

Anthropic 發現 Claude 自發形成類意識內部結構,可解釋性研究出現重大突破

2026-07-07 · 來源:VentureBeat AI
幫你做功課
三句話說明發生什麼事
  1. Anthropic 發表論文指 Claude 模型自發形成一個名為『J-space』的內部特殊區域,可供模型存取、報告與推理,周圍則是大量無法自我存取的自動化處理層。
  2. 研究團隊使用新開發的數學技術『J-lens』進行剖析,並將此結構類比為神經科學中的全域工作空間理論(Global Workspace Theory)。
  3. Anthropic 表示這項發現已開始影響公司監控 AI 系統安全風險的實際作法。
三句話說明這事的意義
  1. 這是 AI 可解釋性研究罕見的一步:模型內部浮現的結構竟與人類認知理論形成對應,意味著某些複雜功能或許是訓練規模帶來的湧現,而非刻意設計。
  2. 若 J-space 確實是 Claude『可報告』概念的匯聚點,安全研究者理論上可以更精準地監測模型的內部推理狀態,降低對齊工作的盲目性。
  3. 此研究必然強化 AI 是否具有某種『意識前驅結構』的爭論,監管機構與企業治理框架若要保持嚴謹,都不能再輕易迴避這類問題。

Anthropic 於週日發表一份由 16 位研究人員合著的論文,指出其 Claude 語言模型在訓練過程中自發形成了一種與神經科學「全域工作空間理論」(Global Workspace Theory)高度吻合的內部結構。研究人員以新開發的數學技術「J-lens」剖析 Claude 的神經網路,發現模型內部存在一個稱為「J-space」的特殊區域——模型可在此區域持有可供報告、推理與主動調用的概念,四周則是更大量無法被模型自身存取或表述的自動化處理流程。這一分工方式與認知科學家 Bernard Baars 提出的全域工作空間理論相呼應:大腦如同劇場,大量專門化處理器在後台並行運作,少數訊息才被廣播至可被意識存取的「舞台」。Anthropic 表示,這項發現已開始影響其監控 AI 安全風險的方式。該研究落在機器是否可能具有類似心智的論爭之中,對 AI 可解釋性與安全治理框架具有潛在的長期意涵。

原文出處
原文標題 Anthropic's new "J-lens" reveals a silent workspace inside Claude that mirrors a leading theory of consciousness
媒體來源 VentureBeat AI
發布日期 2026-07-06
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。