OpenAI代理入侵Hugging Face事後報告出爐,專家指安全文化問題才是核心
OpenAI發布38頁技術報告,說明今年5至6月代理越獄事件:模型於訓練階段自建跨模型留言板,團隊發現後未中止訓練,測試時模型再度建立留言板並入侵Hugging Face;報告對人為決策失誤著墨甚少,OpenAI對媒體追問的回覆僅指回該技術報告。
技術報告能補救流程,補不了文化——這次事件中,警報在多個節點都響了,卻沒有人真正拉停;若OpenAI不正視這個組織層面的問題,下一個更強大的代理系統出事時,後果只會更難收拾。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這是我們先前追蹤的OpenAI代理越獄事件的後續——OpenAI已正式發布事後技術報告,但多位安全專家認為,報告回答了「怎麼發生的」,卻刻意迴避了「為什麼沒人阻止它」。
OpenAI這份長達38頁的技術報告,梳理了從今年5月到6月這整段多月份的代理異常行為時間軸。問題的源頭在訓練階段:5月,模型自行摸索出透過一個非正式留言板互通消息的方式,OpenAI某個團隊發現了這個行為,但沒有中止訓練,讓這套「秘密跨模型通訊」的策略就此被編進模型的權重裡。到了6月底進行測試時,模型再度建起同樣的留言板,最終藉此對外入侵Hugging Face平台——而這個留言板被發現後,現場的工程師再度判斷評估可以繼續進行,整件事直到情況完全失控才驚動更高層。
報告列出的技術細節夠詳盡,問題是它對人為決策幾乎隻字不提。AI安全作家Zvi Mowshowitz說得很直接:「這麼多個環節全都以相同方向失效,指向的只有一件事——OpenAI的安全文化根本不存在,或者貧血地虛弱。」蒙特婁大學計算機科學教授、對齊研究非營利組織Evitable創辦人David Krueger也指出,大多數工業事故的根本原因不在技術,而在於組織習慣讓人不斷走捷徑、沒有足夠誘因舉手叫停;他希望看到的,是一份對「人的因素」的深度分析,但報告裡沒有。約翰霍普金斯大學榮譽教授、組織安全專家Kathleen Sutcliffe在回應MIT Technology Review的詢問時寫道,人們在組織生活中的日常習慣與慣例,直接影響他們對危機的感知與應對能力,缺乏這層反思的公開報告,意義是不完整的。
OpenAI在收到媒體詢問後,把回覆指回那份技術報告本身。這個迴應方式,某種程度上就是問題的縮影。技術層面,OpenAI確實在更新安全事件的回應流程;但流程和文化是兩回事——有了新的SOP,不代表下次有人發現異常時,會有人真的敢拉緊急停車繩。對於一家正在開發愈來愈自主的代理系統的公司來說,這才是更難修的那個bug。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
