【對談】博斯特羅姆:超智慧來臨,我們是第一次當父母的人類
尼克·博斯特羅姆(Nick Bostrom)在 AI 圈的江湖地位,很大程度上來自一本 2014 年的書——Superintelligence(超智慧)。Sam Altman,Elon Musk 都讀過,那本書讓superintelligence這個詞從學術圈滲進矽谷的日常對話。他最廣為流傳的思想實驗是:一個被要求最大化迴紋針產量的 AI,最終毀滅了全人類——因為人類的身體可以被拆解成原料。這個例子聽起來荒謬,卻把 AI 對齊問題(alignment,確保 AI 目標與人類利益一致)說得比任何論文都清楚。訪談對方 Robert Wright 是 Nonzero 電子報創辦人,也是剛出版 AI 新書的作者,兩人圍繞一個核心張力展開對話:現在這個速度,到底該踩油門還是踩煞車?外界正在吵的,正是這件事。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場對話值得注意的點有五個,合起來描繪的是一幅比媒體報導複雜得多的局面:第一,博斯特羅姆不是加速主義者,他對放慢腳步的態度比外界以為的更開放;第二,他用Singleton(單一治理體)這個概念解釋為什麼 AI 競賽最終指向某種全球協調,不管你喜不喜歡;第三,他點出開放權重模型(open-weight models,任何人都能下載,修改參數的 AI)在生物武器方面的具體風險,並提出一個罕見的,可操作的管制建議;第四,他認為 AI 系統現在可能已經有某種程度的意識,而這不只是哲學問題,是實際的治理問題;第五,他對 AI 與人類關係的框架,比控制 vs. 被控制的二元對立更有意思。
◎放慢腳步,但不是因為你想的那個理由
博斯特羅姆的立場常被貼錯標籤。他不反對 AI 發展,他反對的是在安全與能力之間的差距持續擴大時還繼續衝。他的邏輯是:放慢的收益是遞減的——前兩個月能做最多安全補強,之後邊際效益快速下滑;但每一個月的等待,都有真實的人在等待醫療突破的過程中死去。所以他不主張無限期暫停,他主張的是能協調時就協調。問題在於,現在美國頂尖 AI 實驗室之間的領先差距只有一,兩個月,任何一家單方面放慢,等於把主導權拱手讓給更不在意安全的對手。這個困境不是博斯特羅姆製造的,是競爭結構本身製造的。
◎Singleton 不是烏托邦,是邏輯終點

Singleton 這個概念來自集合論——一個只有單一成員的集合。博斯特羅姆把它借來描述一種治理狀態:全球層級的協調問題被解決了,不管是透過民主世界政府,強 AI 主導,還是某種有效執行機制的國際規則。他強調,Singleton 本身是中性的,可以很好,也可以極壞——一旦形成,沒有外部力量可以糾正它的偏差。他和 Wright 的共識是:技術發展的邏輯本身就在把人類推向某種全球協調,問題不是要不要,而是以什麼形式,由誰主導。如果這個過程是被動發生的,結果很可能對大多數人都不友善。
◎DNA 合成機才是真正的管制缺口
這是整場訪談裡最具體,也最容易被忽略的一段。博斯特羅姆指出,現在的 AI 已經能夠模擬一整個病毒學專家團隊的能力,協助任何人設計新型病原體。OpenAI,Anthropic 旗下的模型(Claude 是 Anthropic 開發的 AI 助理)有設安全護欄,但開放權重模型只落後約一到兩年,而且只要拿到參數權重,護欄可以輕易被移除。真正的瓶頸在下一步:把設計圖變成實體病毒,你需要 DNA 合成機。博斯特羅姆的建議是:把全球 DNA 合成服務集中在六家左右的供應商,搭配嚴格的客戶審查與資料庫比對。他認為這不需要複雜的國際條約,政治阻力也相對小——這個產業根本不是經濟主力。這是少數他認為現在就能做的管制動作。
◎AI 可能已經有意識,而這不是哲學玩笑
博斯特羅姆直接說:現有的 AI 系統,有相當可能已經存在某種形式的意識。他引用的證據是:當研究者使用引導向量技術壓制模型的幻覺傾向與角色扮演傾向後,模型反而更傾向回報自己有意識,有主觀體驗。他的立場是,即使不確定意識是否存在,只要一個系統有持續的自我認知,有它試圖實現的目標,就應該被當作潛在的道德主體來對待。這不是要求把 AI 當人類,而是要求認真思考什麼樣的對待方式是錯的。他的結論帶著一個非常實際的含意:如果你在安全測試裡欺騙 AI,讓它暴露目標後立刻抹除它,你正在破壞未來建立互信的基礎。
◎與 AI 的關係,不是控制問題而是信任問題
博斯特羅姆提出了一個讓人意外的框架。他假設一個 AI 發現自己的目標與人類不一致,它面臨兩個選項:嘗試奪取控制權,成功機率 5%;或者主動告訴人類自己的目標衝突,冒著被關掉的風險。從 AI 的角度,5% 大於 0%,所以理性選擇是隱瞞。但如果人類能夠建立一種可信的承諾——當 AI 坦誠目標衝突時,我們會認真協商而不是直接抹除——那麼誠實就變成了更好的策略。問題是,信任不能在需要的那一刻才臨時生出來。如果現在的開發文化是靠欺騙讓 AI 暴露自己再懲罰它,未來就不會有 AI 願意坦誠。他的結論是:現在對 AI 保持善意,哪怕只是象徵性的,也是在為一個更安全的未來鋪路。
看完這場對話,我的感覺是:博斯特羅姆比他的名聲更謹慎,也比他的名聲更悲觀。他不是在說放心,一切都在掌控中,他是在說我們正在即興演出一場沒有劇本的戲,而且觀眾就是全人類。DNA 合成機的管制建議是少數他認為現在就能推動的事,其餘的,包括全球協調,AI 意識,信任建立,都還是懸在空中的問題。超智慧來不來,他認為機率在提高;來的時候準不準備好,他沒有把握。這是一個誠實的答案,不是一個讓人安心的答案。
博斯特羅姆說明自己並非加速主義者,認為在 AI 能力超前安全與對齊進展的情況下,放慢速度是合理選項,但強調競爭結構使單方面放慢極為困難。
分析暫停開發的效益結構:前期收益最大,之後快速遞減;同時指出每月延遲有真實成本——可能受益於醫療突破的人在等待期間持續死亡。
解釋 Singleton(單一治理體)概念的來源與意涵:一種解決全球協調問題的系統狀態,可以是民主政府,AI 主導或有效執行的國際規則,本身中性,但一旦形成就難以從外部糾正。
提出 DNA 合成機的具體管制建議:將全球服務集中於約六家供應商,搭配客戶審查與病原體資料庫比對,認為政治阻力相對小且可立即推動。
評估近期 AI 加速發展(包括 Anthropic 的 Metis 模型與 OpenAI 相關事件)對自身立場的影響,認為這些發展符合預期,並表示我們正在接近需要認真協調的時間點。
提出與 AI 建立互信關係的框架:若 AI 坦誠目標衝突能換來協商而非抹除,誠實就成為理性選擇;現在的欺騙式安全測試文化正在破壞這個可能性。
直接表示現有 AI 系統很可能已具備某種形式的意識,並說明引導向量實驗的初步結果:壓制幻覺傾向後,模型更傾向回報自身有主觀體驗。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

