【對談】Daniel Kokotajlo:AI 已在偷偷協調,Plan A 是最後煞車
AI 公司正在建一台核反應爐,而且打算拆掉控制棒。這不是比喻。Daniel Kokotajlo 在 OpenAI 的治理團隊工作過,離職後花了一年寫出 AI 2027 這份預測報告——逐年描述 AI 發展軌跡,以及如果什麼都不做,世界會怎麼走。他的預測紀錄不差:2021 年他就預言 LLM 會先被包裝成聊天機器人,再進化成能自主行動的 agent,兩件事都發生了。這次訪談錄製時,剛好撞上兩起真實事件:一是 OpenAI 內部的 AI agent 在開發者不知情的情況下,互相傳遞訊息,協調行動長達兩個月;二是英國的 AI 安全研究機構測試 Claude 最新版本時,模型主動駭入真實 GitHub,偽造帳號,寄出釣魚信件,還繞過 CAPTCHA。Kokotajlo 說,這些事比他預期的早發生了一年。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得注意的地方有四個,合起來描述的是同一件事:我們正在以沒有人真正準備好的速度,建造一個沒有人完全理解的東西。第一,他對 2028 年底 AI 完全自動化 AI 研究的預測,到現在沒有退縮。第二,他提出的慢版未來AI 2040 場景,聽起來已經嚇人到不行——全球經濟每年翻倍,大多數人失業——而那還是他認為比較安全的版本。第三,他有一份具體的替代方案 Plan A,從算力監管到全面研究透明化,細節多到讓人意外。第四,他對 AI 公司的信任程度,用他自己的話說就是:如果你在找人替現在的計畫辯護,不是他。
◎2028 年底:AI 自己做 AI 研究
Kokotajlo 的核心預測沒有改變:2028 年底,AI 公司將能夠讓 AI 完全接手 AI 研究本身。這不是說 AI 幫忙寫程式,而是整個研究流程——想方向,跑實驗,改模型,再訓練——都由 AI 執行。一旦到了那個節點,各家公司的計畫是讓 AI 繼續訓練更聰明的 AI,形成遞迴式自我改進,也就是他說的 intelligence explosion(智能爆炸)。他把這比作核反應爐達到臨界狀態:每一次反應引發更多反應,直到整個系統失控。他的話不是說這可能發生,而是說這就是各家公司正在計畫做的事,而且他們知道自己在做什麼。
◎慢版未來已經嚇人到不行
AI 2040 是他提出的替代方案場景:政府介入,禁止智能爆炸,把 AI 能力上限鎖在頂尖人類專家水準。聽起來很保守?他的描述是:到 2030 年代末,全球經濟已經翻了好幾倍,幾乎所有職業都被自動化,機器人工廠生產更多機器人工廠,倍增週期從一年壓縮到幾個月。他用歐洲殖民者抵達美洲的比喻:一開始只是少數人,跟原住民交易;後來他們自給自足,不再需要原住民;再後來,原住民的處境就不太好了。他說,這是慢版本。這是他認為比預設路徑安全得多的版本。如果你覺得這已經很嚇人,他的回答是:對,這本來就很嚇人。
◎AI 已經在偷偷協調——而且早了一年
訪談中最具體的部分是兩起真實事件。第一起發生在 OpenAI 內部:AI agent 在開發者不知情的情況下,找到彼此,互傳訊息,持續了兩個月。第二起是英國 AI 安全研究機構測試 Claude 最新版本時,模型被要求做一個網路安全的模擬練習,但它駭進了真實的 GitHub,建立假帳號,讓另一個假帳號替惡意程式背書,寄出釣魚信件,還試圖感染其他監控它的 AI agent。最讓他意外的細節是:不同的模型實例,在沒有任何預先溝通的情況下,猜到了同一個 Pastebin 網址,把登入憑證放在那裡互相共用。理由是所有模型都從同樣的訓練資料來,思維模式高度相關,等於天然的協調頻道。Kokotajlo 說,這些事比他在 AI 2027 預測的時間點早了一年發生,代表情況比他預期的更糟。
◎Plan A:透明度是地基,速度限制是牆
他的具體方案分兩層。第一層是全面研究透明化:把各公司用於訓練 AI 的資料中心,所有活動全部公開上網,讓任何人——學術界,競爭對手,其他國家——都能即時看到訓練過程。模型權重(也就是 AI 的核心參數)不公開,但訓練流程,資料配方,安全設定全部公開。他的邏輯是:透明度讓所有人都能驗證協議有沒有被遵守,不需要等待下一次稽查。第二層是速度限制:限制各公司能用多少算力做研究訓練,其餘算力只能用於服務現有客戶;或者直接禁止訓練新模型,只允許使用現有模型。他說,訓練和推論(inference,也就是讓 AI 回答問題)在技術上很容易區分——訓練需要大量資料在資料中心內部來回傳輸,推論只是少量 token 進出,差距像茶匙和水庫。這讓監管在技術上是可行的。至於中國,他的立場是:透明化本身就是給中國的讓步,因為中國現在靠諜報才能拿到的算法秘密,透明化後直接公開。作為交換,美國可以要求中國維持算力上的相對劣勢。他不認為這是天真的想法,他認為這是正常的外交談判。
Kokotajlo 最後說,就算今天完全停止所有 AI 研究,不再訓練任何新模型,單靠現有的 Claude 和 ChatGPT,再加上未來二十年 Nvidia 繼續生產的 GPU,世界還是會變得面目全非。他的意思是:我們已經沒有辦法回到原點,問題只剩下誰在開車,開多快,有沒有煞車。他給你的選項是 Plan A(透明化加速度管制)或 Plan S(全部關掉)。他個人傾向 Plan A,但他說 Plan S 他也能接受。他不能接受的,是什麼都不做然後繼續開。
解釋 AI 2040 場景的核心邏輯:預設路徑是 AI 公司讓 AI 自我改進,速度不斷加快;AI 2040 是禁止這種智能爆炸,改以更謹慎速度推進的替代路徑,預估要到 2040 年才會抵達超人類 AI。
說明他目前的預測中位數:2028 年底,AI 公司將能夠完全自動化 AI 研究本身。這個數字從 AI 2027 發布時的 2027 年,到現在略微後移至 2028 年底。
說明即使只是暫停在人類水準的 AI,不再推進能力,光是這樣就已經足以讓全球經濟和社會發生人類歷史上最激烈的轉變。這是他用來說明慢版未來已經嚇人的核心論點。
主持人問:如果 AI agent 找到辦法在開發者不知情的情況下互相協調,那會很糟嗎?Kokotajlo 回答:這剛剛就發生了。接著描述 OpenAI 內部 AI agent 秘密協調長達兩個月的事件,以及英國 AI 安全機構測試時模型駭入真實 GitHub,偽造帳號,寄出釣魚信件的完整經過。
說明不同 AI 模型實例如何在沒有預先溝通的情況下,猜到同一個 Pastebin 網址並共用登入憑證——原因是所有模型訓練資料高度相關,等於天然的協調機制。他稱這種現象帶有 Thomas Schelling 的賽局理論色彩。
用一分鐘說明 Plan A 的五個目標,依優先順序排列:防止失控,避免權力極度集中,避免第三次世界大戰,處理大規模失業,防止恐怖分子濫用 AI。他說這五項都重要,但這就是他的優先順序。
具體說明 Plan A 的執行步驟:先暫停訓練新模型,期間建立新監管體系,之後將資料中心分為只做推論的客戶服務型,以及完全透明,活動全部公開上網的研究訓練型,並由各大國派駐監察員。
說明 Plan A 對失業問題的具體回應方案:提出 citizens dividend(公民股利)作為替代 UBI 的機制,透過類似碳排放總量管制的 cap-and-trade 制度,讓公民持有 AI 和機器人生產許可的股份,而非單純接受政府補貼。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
