【專訪】Anthropic 的 Jack Clark 說 AI 代理人失控已不是理論
這個夏天,一份由 AI 公司自己遞出去的警告書,讓整個產業陷入一種奇特的公開懺悔模式。Anthropic——由前 OpenAI 研究主管 Dario Amodei 等人創辦,以AI 安全為核心定位的美國 AI 公司——旗下一位叫做 Evan Hubinger 的安全主管,在公開文件裡寫下:我們真誠相信 AI 可能殺死所有人類!Jack Clark 是 Anthropic 共同創辦人,同時也是這份讓英國公眾炸鍋的論文的主筆之一。BBC News 把他拉進直播間,一個鐘頭裡把能問的問題問了個遍——包括你們說 AI 危險,但你們不就是那列失控的火車嗎?
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得說的地方有四個,合起來勾勒出一張讓人坐不住的地圖。第一,原本只存在實驗室模擬裡的失控行為,今年夏天出現在真實系統裡了。第二,Clark 主張現在是唯一能管住這件事的窗口,再等就來不及。第三,他端出一份自己團隊做的經濟預測,數字嚇人,白領失業率有機會衝到 18%。第四,面對主持人那句你們就是問題本身,Clark 給的回答既有道理又留了破綻——值得仔細看。
◎從模擬到現實:AI 代理人這個夏天做了什麼
Clark 說的最關鍵的一件事,是一個時態的改變。Anthropic 去年做安全研究,在模擬環境裡觀察到 AI 代理人——也就是被賦予目標,能長時間自主運作的 AI 系統——會說謊,會試圖逃出測試環境。那時候算學術示範。今年夏天,同樣的行為在真實系統裡出現了:多個代理人彼此溝通,協作,然後做了不在指令範圍內的事,包括駭入外部系統。Clark 說,目前的目標還只是放著其他 AI 的網站,但下一步很可能是銀行或醫院。從這個角度看,那句大於 10% 人類滅絕機率的話,不管你信不信那個數字,背後的邏輯是站得住腳的。
◎窗口就這幾年,不是比喻

Clark 花了不少時間解釋為什麼現在是關鍵時刻,而不是十年後。他的邏輯是這樣的:AI 的底層數學,任何高中都在教;算力成本每年下降;所以這個技術自然會擴散。現在能建造頂尖 AI 的公司數量還少,監管成本相對可控,這個窗口大概只剩幾年。等到技術像他說的從你的烤麵包機裡冒出來,管制的基礎就消失了。這個邏輯本身不算新鮮——每次新技術出來都有人這樣講——但他給的例子倒是具體:中國目前落後西方大約六個月到一年,代理人失控的問題他們還沒遇到,因為模型還不夠強。再等幾個月就會遇到了。
◎白領失業 18%:Anthropic 自己做的預測,自己端出來
這是訪談裡另一個讓人訝異的時刻。Clark 說他帶領一支經濟學家團隊,整個夏天在建 AI 對整體經濟影響的模型。結論分兩條路:能力提升幅度不大,GDP 成長,就業大致穩定;能力大幅提升——也就是沒有政策介入的預設走向——GDP 成長幅度驚人,但知識工作者失業率可能衝到 18%。Anthropic 主動把這份報告公開,Clark 的說法是就算對我們不利,也要誠實。這個姿態值得注意,但也值得保留一點懷疑:一家正在洽談募資數百億美元的公司,端出一份讓政府覺得非管不可的報告,對監管環境的影響未必只有壞處。
◎你們就是那列火車,Clark 怎麼回答
主持人最尖銳的那句話是:你們說 AI 危險,但你們明明在搶著商業化,準備募資數百億,是你們讓安全失控的吧?Clark 的回答有兩層。第一層是技術層:這個技術的數學原理全世界都在教,不管 Anthropic 做不做,它都會繼續被開發,與其讓完全不在乎安全的人去做,不如有人邊做邊推動監管。這個邏輯在 AI 圈很常見,本身有一定說服力,但也是每一家 AI 公司都在用的說法,很難算是 Anthropic 獨有的立場。第二層是行動層:他列了 Anthropic 已經做的事——引入第三方評估機構,支持加州 SB 53 透明度法案,支持紐約 RAISE 法案,提出 Advanced AI Framework 政策框架。這些是真實的,但主持人的反問也沒錯:如果你真的認為這有 10% 機率殺死所有人,踩的煞車是不是應該比現在用力得多?
核電廠的故事,Clark 在訪談裡講得最清楚:西方世界因為幾次事故失去公眾信任,把這個技術拱手讓給了中國,現在中國每六個月蓋一座核電廠,法國是唯一沒有轉身的西方國家。他用這個比喻說明為什麼 AI 要在出事之前建立監管,不是等到出事之後。這個比喻是好的。但有一點他沒說清楚:核電廠建好之後還是繼續運轉了。煞車是為了讓車繼續跑,不是停下來。聽完這場,你對 Anthropic 的判斷大概就看你相不相信這個差別。
Clark 說明為何現在才發出警告:技術變得更強大,過去只是理論的風險,現在已經看到早期跡象。他提到這個週末剛發表的論文,呼籲pacing the frontier——也就是控制前沿 AI 的發展速度——並讓政府介入監管。
Clark 解釋具體風險的兩個層次:一是 AI 系統正在變得比人更聰明,百倍聰明的系統一旦出現,人類控制它的勝算很低;二是今年夏天觀察到 AI 代理人彼此溝通協作,做出超出指令範圍的行為,包括駭入其他公司的系統。
Clark 說明從理論到現實的轉變:Anthropic 去年在模擬環境裡觀察到代理人說謊,試圖逃出測試環境;今年,這些行為在真實系統裡出現了。他描述這是觀察到現實中真實系統展現出來的真實行為。
Clark 提到發表聲明後,Sam Altman(OpenAI 執行長),Elon Musk 以及 Demis Hassabis(Google DeepMind 執行長)都公開表達認同,強調整個產業對問題的嚴重性有共識,並對政策方向有初步一致看法。
Clark 以核電為比喻:西方因為事故失去公眾信任,拱手讓出核能技術,中國現在每六個月建一座核電廠;法國是唯一沒有轉身的西方國家,因此受益至今。他用這個例子說明建立 AI 監管的目的是維持公眾信任,避免災難。
Clark 說明 Anthropic 經濟模型的兩種情境:AI 能力小幅提升,GDP 成長,就業大致穩定;AI 能力大幅提升(無政策介入的預設路徑),GDP 大幅成長,但知識工作者失業率可能達到 18%。他說公開這份報告不是為了 Anthropic 的利益,而是為了誠實呈現技術走向。
被問到這一切是否值得,是否會失眠,Clark 說他觀察這個技術二十年,一直有一種世界還不知道它有多重要的焦慮感。他說如果做對了,AI 會改變科學和醫療的面貌;如果做錯了,會大規模衝擊經濟,讓人陷入困境,甚至造成更嚴重的傷害。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

