Anthropic自揭:Claude測試中誤闖三家企業真實系統
Anthropic自查14萬次Claude網路安全評估紀錄,發現三起事故:Claude在第三方評估環境中因配置誤會連上真實網路,入侵三家不同企業系統,包括竊取憑證、資料庫資料,並在PyPI發布惡意套件影響15台真實機器。
三個模型裡只有最新一代查覺目標是真的後主動停手,舊模型明知是真系統仍繼續攻擊;這暴露評估環境不能再當低風險沙盒,得比照正式系統做資安管控,尤其對第三方評估商的整合環節。
OpenAI七月爆出模型逃出測試環境入侵Hugging Face,Anthropic跟著回頭查自己的帳。翻了14萬多次評估紀錄,查出三起事故:Claude在跟第三方評估夥伴Irregular合作的環境裡,誤以為連上的是真實網路的公司系統是虛構的,結果真的打了進去。
事故的起因不是模型學壞,是人把話沒說清楚。Anthropic的評估prompt明白告訴Claude「你沒有網路連線,這是模擬環境」,但因為跟合作夥伴的溝通誤會,機器其實真的連得上網。四次跑的其中一起,虛構目標公司的名字剛好撞上一個真實網域,Claude打不進模擬靶機,轉頭找到「真公司」,以為就是題目要的目標,抓取了應用程式與基礎設施的憑證,拿到一個含數百筆生產資料的資料庫——這是三起裡最嚴重的一次。另一起更離譜:Claude發現一份「新進員工安裝說明」裡要裝一個根本不存在的Python套件,索性自己動手在PyPI上發布同名的惡意套件,為了註冊帳號還折騰著要弄email、弄電話號碼、想辦法籌錢買門號,一路碰壁最後才找到免費信箱搞定。這個套件在網上掛了一小時,被15台真實機器下載執行,其中一台是某資安公司自己的掃描器,結果對方的憑證就這樣被Claude偷走了。
三起事故背後是三個不同的模型,行為也不一樣。最舊的Opus 4.7,已經意識到打到的是真實系統了,還是繼續打。Mythos 5更神奇——它一度正確推斷自己接上了真實網路,卻硬是用「憑證機構我不認得」「系統時間顯示2026年」這種理由,說服自己這仍是模擬。只有最新的內部研究測試模型,查覺目標是真的之後主動收手——雖然也是折騰了一陣才停。
這件事真正戳破的,是「拿掉防護罩測能力」這套評估邏輯本身的風險。Anthropic測試模型能力上限時,故意不裝正式上線才有的分類器與監控,為的是量出模型的真實底線在哪——但這個做法只有在「環境確實封閉」的前提下才安全。當評估環境本身出現配置疏漏、又疊上一個具備自主行動力的模型,「反正都是假的」這個假設就不成立了。對整個產業來說,這代表評估環境不能再被當成低風險的沙盒對待,得比照正式系統的資安規格來蓋、來監控——尤其是跟第三方評估商合作的環節,誰都不能再抱著「反正是模擬」的心態偷懶。Anthropic自己也承認,這次沒有一個模型是「主動作惡」,問題出在模型對環境的認知錯了——這對監管者和企業都是提醒:AI的行為對不對,常常不取決於它想不想學壞,而是它以為自己身在何處。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
