【專訪】Ghahramani:AI 最危險的缺陷不是算錯,而是錯得太篤定
AI 現在最大的問題不是不夠聰明,而是太有把握。你問 ChatGPT 一個問題,它給你一個答案,語氣篤定,哪怕它根本不知道自己在說什麼。這個毛病,Zoubin Ghahramani 三十年前就看到了。他是劍橋大學教授,同時擔任 Google DeepMind(Google 旗下整合了 DeepMind 與 Google Brain 的 AI 研究部門)前沿 AI 共同負責人,職業生涯從 1980 年代末的神經網路早期就已入場。他這次接受 Google DeepMind 官方 podcast 訪問,談的是一個在 AI 圈正在激烈交鋒的問題:光靠堆更多資料,更多算力,AI 能到哪裡?還是說,我們根本需要換一種思路?
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得說的地方有四個,合起來指向同一件事:現在的 AI 主流路線在某些關鍵場景上有結構性缺陷,而修補它的方法,數學上早就有了,只是過去算不起來。第一,Ghahramani 解釋了為什麼 AI 的過度自信不只是體驗問題,而是安全問題。第二,他用天氣預報和蛋白質結構預測說明「加入不確定性反而讓預測更準」這個反直覺結論。第三,他點出現在的大型語言模型在表達信心這件事上本質上是在演戲。第四,他提出幾個他認為 AI 下一步真正需要突破的方向,包括持續學習和能源效率。
◎過度自信是功能缺陷,不是風格問題
你推翻 ChatGPT 的答案有多容易?說一句「我覺得你說錯了」,它可能馬上道歉認錯。Ghahramani 說這不是謙遜,這是沒有立場。一個真正理解自己知道什麼,不知道什麼的系統,不會因為你語氣強硬就改口。它會告訴你它有多確定,然後站在那裡。現在的大型語言模型做不到,因為它們的訓練目標是預測下一個字,不是表達信念的強度。遇到高風險場景——自駕車突然碰上冰雹加馬匹,醫療 AI 協助判斷治療方案——這個缺陷就不只是讓人不爽,而是真的危險。
◎加入不確定性,預測反而更準
聽起來像悖論,但 Google DeepMind 的天氣預報模型 GenCast 就是這樣運作的。它不給你一條颶風路徑,它給你一整個路徑分布——把模型跑很多次,產生一組預測集合,隨著新的感測器資料進來不斷更新。結果是:15 天預報,8 分鐘跑完,比傳統超級電腦跑幾小時還準。AlphaFold(Google DeepMind 的蛋白質結構預測模型,協助加速藥物研發)也是同樣邏輯,預測結果用顏色標示模型對各部位的確信程度。承認你不確定,然後把不確定性量化進去,比假裝你知道答案更有用。這對做生意的人應該不陌生。
◎大型語言模型的信心,本質上是在模仿
Ghahramani 用了一個很直白的詞:faking it。現在的語言模型在表達確信程度時,靠的是它在訓練資料裡看過多少次類似的說法,不是真的在計算自己有多確定。他的比喻是:你不想要一個靠背題背出來的計算機,你想要一個真的會算的計算機。他的學生提出的 semantic entropy(語意熵)概念——透過觀察模型在產生答案前,對各種可能答案的機率分布是集中還是分散,來估計它的確信程度——是一個方向,但 Ghahramani 自己也說,這還是在用資料分布來推算,不是真正讓模型理解自己的知識邊界。
◎Scale 派 vs. 架構派,他選哪邊
AI 圈現在有兩種聲音:一種說繼續堆資料堆算力,問題會自己解決;另一種說不行,需要新的架構。Ghahramani 明確站第二邊,但他不否認第一派的成績。他點出幾個他認為真正需要突破的方向:持續學習(現在的模型訓練完就凍結,不像人類一直在更新,而貝葉斯更新在理論上可以解決這個問題);能源效率(人腦耗電大約幾瓦,相當於一顆節能燈泡,大型語言模型的訓練耗電則差了幾個數量級);以及資料效率(現在的模型需要的訓練資料量,比人類學同樣東西多太多)。這些問題堆算力不會自動消失。
Ghahramani 花了三十年推一個在 AI 圈長期被視為太慢,算不起來的想法。現在算力夠了,他說可以重新試試看。這不是在說現在的 AI 沒用——他自己也說,幾十億人每天在用,成績擺在那裡。但他更想說的是:當 AI 開始進入醫療診斷,自駕車這類不能犯錯的場景,一個知道自己不知道的系統,比一個永遠篤定的系統更值得信任。這個道理,對人也一樣。
開場直接定義核心論點:智慧系統必須能夠表示不確定性,更新不確定性,並在不確定性下做決策,這是智慧的根本要件。
用自駕車遭遇冰雹加馬匹的例子,說明長尾情境(訓練資料中罕見的場景)對 AI 系統的挑戰,以及系統需要能感知自身不確定性並據此放慢或停止行動。
介紹 adversarial example(對抗樣本)現象:只修改幾個像素,神經網路會以 99% 信心把校車判定為獵豹,說明正確率與信心校準是兩件不同的事。
以偵探故事為例,完整解釋貝葉斯推論的運作邏輯:先驗信念,觀察證據,更新後驗信念,並說明這也是學習的正式數學模型。
介紹 GenCast 天氣預報模型:15 天預報,8 分鐘完成;透過產生預測集合並隨新感測資料更新,實現對颶風路徑的機率分布預測,說明加入不確定性使預測更準確。
列出他認為 AI 真正需要突破的三個方向:持續學習(避免災難性遺忘),能源效率(人腦約幾瓦 vs. 大型模型訓練耗電差距懸殊),資料效率,並說明貝葉斯更新在理論上如何處理持續學習問題。
坦承貝葉斯方法的代價:計算上屬於 NP 完全或 NP 困難問題,過去根本跑不動;但他認為現在的算力與近似演算法讓重新嘗試變得可行。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
