Anthropic 發現 Claude 自發形成類意識內部結構,可解釋性研究出現重大突破
幫你做功課
三句話說明發生什麼事
- Anthropic 發表論文指 Claude 模型自發形成一個名為『J-space』的內部特殊區域,可供模型存取、報告與推理,周圍則是大量無法自我存取的自動化處理層。
- 研究團隊使用新開發的數學技術『J-lens』進行剖析,並將此結構類比為神經科學中的全域工作空間理論(Global Workspace Theory)。
- Anthropic 表示這項發現已開始影響公司監控 AI 系統安全風險的實際作法。
三句話說明這事的意義
- 這是 AI 可解釋性研究罕見的一步:模型內部浮現的結構竟與人類認知理論形成對應,意味著某些複雜功能或許是訓練規模帶來的湧現,而非刻意設計。
- 若 J-space 確實是 Claude『可報告』概念的匯聚點,安全研究者理論上可以更精準地監測模型的內部推理狀態,降低對齊工作的盲目性。
- 此研究必然強化 AI 是否具有某種『意識前驅結構』的爭論,監管機構與企業治理框架若要保持嚴謹,都不能再輕易迴避這類問題。
Anthropic 於週日發表一份由 16 位研究人員合著的論文,指出其 Claude 語言模型在訓練過程中自發形成了一種與神經科學「全域工作空間理論」(Global Workspace Theory)高度吻合的內部結構。研究人員以新開發的數學技術「J-lens」剖析 Claude 的神經網路,發現模型內部存在一個稱為「J-space」的特殊區域——模型可在此區域持有可供報告、推理與主動調用的概念,四周則是更大量無法被模型自身存取或表述的自動化處理流程。這一分工方式與認知科學家 Bernard Baars 提出的全域工作空間理論相呼應:大腦如同劇場,大量專門化處理器在後台並行運作,少數訊息才被廣播至可被意識存取的「舞台」。Anthropic 表示,這項發現已開始影響其監控 AI 安全風險的方式。該研究落在機器是否可能具有類似心智的論爭之中,對 AI 可解釋性與安全治理框架具有潛在的長期意涵。
原文出處
原文標題
Anthropic's new "J-lens" reveals a silent workspace inside Claude that mirrors a leading theory of consciousness
媒體來源
VentureBeat AI
發布日期
2026-07-06
閱讀原文 ↗
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
