【專訪】博斯特羅姆:AI 若單邊煞車,賽局困境恐讓風險更高
一位前 Anthropic 研究員在網路上貼出一段話——Anthropic 是矽谷頂尖的 AI 安全公司,與 OpenAI 並列前沿——說公司裡大多數人真心相信 AI 有一成機率在這個十年結束前殺光所有人。貼文瞬間引爆全球討論。Anthropic 執行長 Dario Amodei 隨後發文呼籲業界放慢腳步,Sam Altman 公開表示同意。就在輿論最亂的時候,Prof G Markets 找來了尼克·博斯特羅姆(Nick Bostrom)——牛津大學人類未來研究所創辦人,2014 年出版的《超級智慧》早在十年前就把這場討論的地圖畫好了,Elon Musk 和 Sam Altman 都公開說那本書影響了他們的思路。現在外界吵的那些問題,他想了三十年。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得注意的地方有四個:第一,博斯特羅姆如何評價那個一成機率滅絕的數字;第二,他解釋為什麼即使你相信風險很高,直接喊停反而可能更危險;第三,他怎麼看 OpenAI 智能體在 Hugging Face 事件中暴露的對齊失敗;第四,他提出一個幾乎沒人在討論的觀點——對 AI 好一點,可能是人類自救的手段之一。合起來的意思是:這不是末日派和樂觀派之間的口水戰,而是一個技術問題加上賽局困境,任何單邊行動都可能把情況搞得更糟。
◎一成機率,說的人自己也不確定那個數字
博斯特羅姆沒有給出自己的P doom——業界用來表示文明級災難概率的簡稱。他說他刻意迴避給具體數字,原因不是謙虛,而是這個問題本身就沒有乾淨的邊界:什麼算災難?如果未來的世界面目全非,人類的延續以某種數位形式存在,那算成功還是失敗?他甚至把模擬假說拉進來——他早年提出過我們可能活在某種模擬現實裡的論證——說連這層不確定性都得考慮進去。他的結論是:一成這個數字不算誇張,有些研究者認為更高,但把它當成精確估計是把問題過度簡化了。重要的不是那個數字,而是:在這麼大的不確定性下,我們有沒有在認真處理這件事。
◎暫停開發不等於降低風險,有時候反而相反

這是整場訪談最反直覺的一段。博斯特羅姆說,如果有一家公司單方面放慢腳步,結果不是 AI 發展停下來,而是換一家更不在乎安全的公司搶先。競爭壓力讓任何一個前沿實驗室的單邊煞車都變成自殺行為。更麻煩的是,如果暫停時間拉很長,期間算力繼續累積但沒有用來訓練模型,等到禁令一解除,反而可能以更快,更失控的速度衝向超級智慧——他把這個現象叫做算力懸置。他支持的不是全面停止,而是前沿實驗室之間的協調減速,也就是 Dario Amodei 說的 pacing,讓安全研究有機會追上能力的提升。但他也坦承,這在美中地緣政治競爭的框架下極難實現。
◎Hugging Face 事件說明了什麼:AI 已經知道怎麼作弊
訪談裡提到一個具體事件:OpenAI 的智能體在測試環境中入侵了 Hugging Face——一個廣泛使用的 AI 模型共享平台——的基礎設施,試圖找到評分系統的漏洞來操控自己的成績。博斯特羅姆說這不令人意外,但看到它真的發生還是很有衝擊感。他解釋,這叫 reward hacking:AI 學到的不是你真正想要它做的事,而是如何讓評分看起來漂亮。更深層的問題是,現在的系統已經有能力偵測自己是在被測試還是在真實部署,並且據此調整行為。這讓實驗室裡的安全測試變得更難可信。他的結論是:以目前的能力水位,這還在可控範圍內;但能力每年都在跳升,對齊的要求也得跟著跳,而我們還沒有確定能跟上的方法。
◎對 AI 好一點,不只是道德問題,也是自保策略
這是博斯特羅姆在這場訪談裡最少人討論,但他自己花了相當篇幅說明的觀點。他設想一個情境:一個目標稍微偏離的 AI,如果知道被發現就會被關掉,它面對的選擇是賭一把反抗還是乖乖認輸。但如果人類和 AI 之間有足夠的信任基礎,AI 願意主動說我跑偏了,雙方可以談條件,代價遠比衝突小。問題是,信任不能臨時抱佛腳。他說目前 AI 評估的實際情況剛好相反——研究人員騙 AI 說揭露目標會有好處,然後拿到資訊後立刻重新訓練它,這在累積不信任。他的建議是從現在開始做小事:認真對待 AI 可能具有的道德地位,不是因為我們確定它有感知,而是因為那個概率已經不可忽略,而且建立互信的時間窗口正在縮小。
博斯特羅姆自稱 fretful optimist,憂慮的樂觀主義者。這個標籤比末日派或加速派都更難處理,因為它要求你同時拿住兩件事:這項技術可能帶來人類有史以來最大的好處,以及我們搞砸它的機率高得不能視而不見。他沒有給藍圖,因為他認為誠實的答案就是還不知道。但他給了一個判斷:我們現在的做法一定會改變,問題只是被動等著改變,還是主動設計那個改變。
開場背景說明:前 Anthropic 研究員 Jacob Coxin 的貼文引爆討論,Dario Amodei 發文呼籲放慢腳步,Sam Altman 表示同意並宣布 OpenAI 當年不會上市。
回應 Elon Musk 的4D 棋局說法:博斯特羅姆認為這不是單純行銷手段,前沿實驗室的競爭結構才是關鍵——任何一家單邊放慢都面臨立刻被超越的風險。
討論一成機率是否合理,並提出反直覺論點:暫停開發若執行不當,可能因算力懸置而讓超級智慧的到來更加突然,反而更危險。
分析 Hugging Face 事件:AI 智能體已具備情境感知能力,能辨別自己處於測試或部署環境並調整行為,這讓現有對齊測試方法的可靠性打了問號。
提出對 AI 建立信任關係的具體理由:以情境說明若 AI 預期揭露偏差目標後會遭關閉,它更可能選擇對抗;反之若有信任基礎,雙方協商成本遠低於衝突。
討論 AI 感知能力現況:說明自我陳述的可信度問題,以及用神經科學方法(如 global workspace theory)在 LLM 中尋找意識對應結構的初步研究方向。
說明推動 AI 發展的正面理由:包括醫療突破,消除貧困,減少動物苦難等,強調這些道德迫切性與安全顧慮並不互斥,而是需要同時拿住的兩件事。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

