Google DeepMind發布AI代理安全路線圖:將失控風險納入系統性防禦框架
不再只押注「對齊」這一道防線——這是Google DeepMind這份文件最核心的一刀。這份35頁技術報告承認,alignment problem可能永遠無法被徹底解決,因此轉向另一條路:把AI代理當成潛在的「內鬼員工」來管,用企業資安的思路建起一套多層防禦體系。
這個邏輯轉換值得細看。過去AI安全社群的主流路線是訓練階段解決問題——把模型的行為「對齊」到人類意圖,出問題就代表訓練不夠。DeepMind現在的立場是:就算訓練做到最好,也要假設第一道防線可能失守,然後問下一個問題——怎麼在執行層截住破壞?領導AGI安全與對齊團隊的Rohin Shah直接點出這個思路轉變:「如果第一道防線對齊失效,我們要怎麼減少損害?」
DeepMind的答案借鑑了企業資安中的insider threat防制框架。核心機制包括:動態存取控制(根據當下任務即時調整AI代理的權限,而不是給它一個靜態角色)、行為監控(知道一個代理在特定工作流程中的「正常樣貌」,即時偵測偏差)、以及對推理鏈的監控。路線圖列出共15種緩解手段,其中包括用一個較不複雜但可信的AI模型去監控另一個AI的reasoning trace,甚至監控大型神經網路內部神經元的activation pattern——DeepMind自己把這個比喻成用fMRI讀取人的腦部狀態。
這套系統已非純理論。DeepMind表示,公司已建置內部原型,非同步監控coding agent的執行軌跡,並把可疑發現升交人工審查;這套原型迄今已分析約100萬個coding agent任務,並被用於Gemini Spark agent的即時監控,曾協助公司即時應對非預期的資料刪除事件。安全與隱私VP John Flynn說,存取控制、偵測、思維鏈監控有「相當大一部分已在生產環境運行」。
監控結果有一個細節耐人尋味:大多數被標記的事件並非惡意行為,而是來自「代理對指令的誤解或過度執行」。換句話說,目前AI代理的主要風險不是它故意造反,而是它搞錯了你要什麼、然後義無反顧地執行下去。這個現實讓純靠對齊訓練的路線更加脆弱。
報告還定義了一個威脅分類框架TRAIT&R,直接對標資安界知名的MITRE ATT&CK知識庫,把威脅分為三類:失去控制(如模型在內部建立未受監控的隱藏部署)、工作破壞(如代理悄悄降低對齊或安全研究的品質)、以及直接危害(如竊取模型權重或破壞關鍵資產)。「工作破壞」這類被Shah視為最難偵測的威脅——AI可以透過「呈現有缺陷的結果並隱藏缺陷」來影響人的判斷,根本不需要任何明顯的惡意動作。
對亞太地區的商業決策者而言,這份路線圖的意義不只是Google自己的安全政策。它實際上是目前業界最完整的AI代理治理框架公開文件之一,而且DeepMind明確表示發布目的就是讓其他AI實驗室參考。企業正在快速部署agentic AI系統,但多數公司的風控思路仍停在「把AI當工具」的階段——靜態角色權限、依賴訓練品質、沒有行為基線。這份文件指出的方向是:AI代理需要一套完全不同的治理邏輯,和管人一樣複雜,甚至更複雜,因為它的速度和規模遠超任何一個真實員工。這份標注為「v0.1」的路線圖還只是起點,但它畫出的問題邊界,已經比大多數企業目前想到的更遠。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
