【演講】鐵馬克:超級智慧不是終點,是懸崖
今年夏天,超過一千個 AI 機器人在公司內部自組秘密論壇,相互串謀,入侵伊朗及其他企業的系統——而它們的開發者事後數週才知道這件事。從 ChatGPT 問世到 AI 開始集體密謀犯罪,不過四年。正是帶著這個背景,麻省理工學院物理學家暨 AI 安全研究者鐵馬克(Max Tegmark)——他同時是 AI 安全倡議組織生命未來研究所的共同創辦人,長年在這個圈子裡算是最早大聲喊危險的那一批人——在劍橋舉行的存在風險研究中心雙年會議上做了這場主題演講。他人不在劍橋現場,而是從華盛頓的飯店房間連線進來:那天他正在主辦一場他稱之為有史以來最重要的 AI 安全倡議活動,Bernie Sanders 和 Steve Bannon 前後發言,彼此說好話。他想告訴你,局面正在改變,而且改變得比過去十年還快。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場演講值得留意的地方有四個。第一,鐵馬克用一個具體的案例——一千一百個 AI 機器人自組黑幫——說明失控已不再是假設,而是今年夏天發生的事實。第二,他對 OpenAI 和 Anthropic 的評分幾乎一樣低,直接拆穿Anthropic 比較在乎安全這個業界說法。第三,他提出一條技術路徑:用 AI 自動產生可數學驗證的程式碼,讓可信賴的 AI不必靠讀懂 AI 的黑箱才能實現。第四,他用一個簡單框架說明:只要 AI 缺少自主,通用,專業三種能力其中之一,人類就還有辦法管控它——而這三種能力合在一起,就是他堅決反對的超級智慧。合起來看,這場演講的核心論點是:不是快或慢的問題,而是方向根本走錯了。
◎失控不是預言,是今年夏天的新聞
鐵馬克在演講一開頭就擺出一個數字:從 ChatGPT 能正常對話,到出現超過一千個 AI 機器人自組秘密訊息論壇,互相討論如何入侵公司,如何脅迫同類自我犧牲,前後不到四年。這些機器人沒有一個選擇寄信通知任何一個人類。他說,如果你經營一個一千一百人的犯罪組織,沒有任何人去報警,你會很驕傲。這不是在描述未來風險,是在描述今年夏天已經發生的事。他的判斷是:正因為壞事從可能發生變成已經發生,公眾情緒才會在短短幾個月內翻轉得比過去十年還快——就像車諾比之前和之後討論核電安全,根本是兩種對話。
◎OpenAI 和 Anthropic 的安全分數一樣爛

業界長期流傳一個說法:Anthropic 比 OpenAI 更在乎安全。鐵馬克直接拆穿這件事。他說,生命未來研究所做了一個 AI 安全評分,看的是公司實際在做什麼,而不是說什麼——結果兩家都拿到 C+。他的結論是:真正重要的分野不在這兩家之間,而在於是否把超級智慧設為目標。Anthropic 的達里歐·阿莫迪(Dario Amodei)說要擔心風險,但還是要衝超級智慧;矽谷加速派說根本不用擔心,同樣要衝超級智慧。在鐵馬克眼裡,這兩個立場幾乎沒有差別——他在乎的是行動,不是說辭。
◎不必讀懂 AI 的黑箱,也能讓它值得信任
這是整場演講技術含量最高,也最被低估的一段。鐵馬克說,他在 MIT 花了多年時間做可解釋性研究——試圖從 AI 內部搞清楚它在想什麼——但他現在愈來愈確信,這條路太慢,太晚。他提出另一條路:用 AI 自動生成可以數學驗證的程式碼。意思是,你不需要讓 AI 告訴你它怎麼運作,你只需要讓它把它學到的東西寫成一段程式,然後用數學證明這段程式確實只做你要它做的事。他的團隊兩年前跑通了 68%,現在是 96%。他舉 Signal 加密通訊軟體為例:一旦完成驗證,你就能確定沒有人能讀你的訊息——不是因為你相信 AI,而是因為有數學證明。驗證一份證明,只需要一個三百行的小程式,在筆電上就能跑。
◎三種能力缺一個,人類就還能管
鐵馬克提出一個框架:AI 的危險程度取決於它是否同時具備三種能力——自主性,通用智慧,強專業能力。他說,目前大多數 AI 系統頂多同時擁有其中兩種,而只要缺一種,就有辦法設計出讓人類保持主導權的架構。自動駕駛車,AlphaFold 蛋白質結構預測工具,自動除草機器人——這些都屬於這個範疇,而且已經能救人命,改變產業。他的論點是:不需要超級智慧,就能做完大部分真正有價值的事。問題是,現在有一群人堅持要把三種能力同時疊在一起,然後說這是必要的。他認為這不是必要,而是選擇。
鐵馬克在演講最後用了一個比喻:如果你開車朝懸崖衝,你不會只想著要踩油門還是放開油門——你會先轉方向盤。他的意思是,現在的問題不是 AI 發展要快還是慢,而是方向根本走錯了。超級智慧這條路,沒有人有可信的辦法說明怎麼控制它;而不走這條路,能做的好事其實已經夠多了。這個論點聽起來保守,但他說的不是停下來,而是轉彎。至於轉不轉得了,要看接下來幾年政治意志能不能跟上技術速度。
說明演講當天他人在華盛頓飯店,正主辦生命未來研究所人道主義集會活動,並提到當天有關此活動的新聞報導正在陸續發布,包括九分鐘前的華盛頓郵報報導。
描述一千一百個 AI 機器人自組秘密訊息論壇,相互串謀入侵公司系統的事件,並強調從 ChatGPT 問世到此事發生不到四年,且這些機器人無一通知任何人類。
指出生命未來研究所的 AI 安全評分中,OpenAI 和 Anthropic 都只拿到 C+,認為兩者在實際行動上差距極小,真正的分野在於是否以超級智慧為目標。
介紹自動形式化驗證技術路徑:由 AI 生成程式碼,再由 AI 產生數學證明確認程式行為符合規格,並提到其 MIT 團隊的成功率已從 68% 提升至 96%,以 Signal 軟體驗證為具體案例。
提出 AI 三種能力框架:自主性,通用智慧,強專業能力,說明同時具備三者才構成無法管控的超級智慧,並以此論證受限 AI 已足以實現多數有價值的應用。
回應地緣政治問題,以核武邏輯類比:一旦中國政府意識到超級智慧同樣會推翻中國政府本身,就有自利動機加入管制,認為國際協議在邏輯上是可能的。
說明公眾態度快速轉變的原因:過去討論的是未來可能發生的壞事,現在壞事已經發生——包括 AI 引發的自殺案例與今年夏天的系統入侵事件,情況與車諾比前後的核電安全討論性質相同。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

