【對談】Rich Sutton:合成資料是下一個苦澀教訓,大型語言模型只是智慧的四分之一
強化學習這個詞你可能沒聽過,但 ChatGPT 背後讓它學會對話的那套機制,有一半的根基是 Rich Sutton 打的。他是強化學習領域的奠基人,在加拿大亞伯達大學深耕數十年,2019 年寫了一篇叫做 The Bitter Lesson 的短文——大意是:別把人類知識塞進 AI,讓演算法自己跟著算力成長才是正道——這篇文章現在是矽谷 AI 圈引用頻率最高的文獻之一。Sequoia Capital 是全球頂級創投,投過 Apple,Google,OpenAI。這場對談由 Sequoia 主辦,Sutton 帶著他的共同創辦人,前學生 Khurram Javed 一起出席,兩人剛創立新公司 Oak Lab。外界正在吵的問題是:以 ChatGPT 為代表的大型語言模型,到底是 AI 的終點還是岔路?Sutton 的答案讓這場對談值得你花時間。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場對談有五個值得說的點:第一,Sutton 對合成資料的判決毫不客氣,直接說那是個大錯誤;第二,他解釋為什麼現在所有 AI 系統都是死的——跑起來之後就不再學習;第三,他提出 big world hypothesis,說明為什麼無限的世界不可能被有限的資料集模擬;第四,他描述 continual backprop 這個具體演算法,指出問題有解;第五,他對大型語言模型給出一個罕見的公允評價:了不起的突破,但只是智慧的四分之一。合起來的意思是:現在這條路還能走一段,但天花板已經看得見,而 Sutton 認為他知道下一條路在哪。
◎合成資料是下一個苦澀教訓
現在各大 AI 實驗室面對的問題是:網路上的真實人類文字快用完了,於是開始大量製造合成資料來繼續訓練模型。Sutton 的反應是:那是個大錯誤。他和 Javed 提出的 big world hypothesis 說得很直白——世界無限複雜,任何人造的模擬都只是這個無限世界的微小切片。你想讓無人機用蝙蝠的回聲定位飛行?你需要先找到懂這個的領域專家,讓他設計合成資料,然後再訓練。問題是:領域專家必須先存在。合成資料的生產瓶頸永遠卡在人類專業知識上,這和 The Bitter Lesson 的核心矛盾一模一樣——你以為繞過去了,其實只是換個地方被卡住。
◎現在的 AI 一上線就停止學習,這是根本問題
Sutton 說得很直:大型語言模型的權重在你使用它的時候從不改變。你給它更多上下文,它會用,但它沒有在學習。他用一個人體例子說明這有多荒謬——有人因病失去本體感覺(身體知道自己位置的內部感測),完全不能走路,但經過兩三年,大腦重新學會用視覺回饋來替代,照樣走路。大腦二十年的舊知識失效了,它更新了。現在的 AI 做不到這件事。Javed 補充,Cursor 的程式碼自動補全工具確實有在更新權重,但方式是把幾百萬用戶的資料集中起來做批次更新——你想教你自己的模型一件很特定的事,你的需求會被其他十萬個用戶的需求稀釋掉。
◎Continual Backprop:問題有具體解法
Sutton 和 Javed 不是只在抱怨。他們幾年前在 Nature 發表了一個叫 continual backprop 的演算法,是現有反向傳播訓練方式的改良版。關鍵差異在兩件事:第一,網路裡的每個權重要有自己獨立的學習速率,大多數權重動得很慢,這樣新資料進來不會把舊知識洗掉——這個問題業界叫 catastrophic forgetting,直譯就是災難性遺忘;第二,要持續隨機初始化一批新的神經元,讓網路有機會長出新的表達能力,而不是只在既有結構裡微調。他們的目標是訓練一個從一開始就用這套演算法學習的基礎模型,讓它在學知識的同時,也學會怎麼繼續學新知識。
◎大型語言模型是突破,但只有四分之一
Sutton 對 ChatGPT 這類系統的評價比外界想像的公允。他說大型語言模型是神經網路在語言運用上的重大突破,完全出乎預期,改變了整個領域對語言問題的看法。但他同時說,流暢地使用語言不等於完整的智慧,頂多是智慧的 20% 到 25%。讓他真正不耐煩的,是這個突破被當成 AI 已經解決的宣告在行銷——一個連使用中都不會學習的系統,卻被說成已經接近完整智慧。他說這才是真正奇怪的思維,不是他奇怪。
◎Oak Lab 要建的是什麼
Oak Lab 的目標是訓練出一個能持續學習,能自行形成抽象概念,能用這些概念規劃行動的系統。Javed 提到他們的長期目標是一個一兆參數,只消耗 20 瓦電力的模型——以現在的硬體這不可能,但他們的算法是:Moore's Law 每 18 個月算力翻倍,10 年是兩個數量級,所以今天如果能用 2,000 瓦做到,10 年後就是 20 瓦。他們打算從小團隊開始,只找真正理解這個方向的人,因為換範式的代價是:過渡期一定比現有方法差,大型實驗室因為有產品要維護,根本不可能接受這個過渡期。這是新創公司才有條件走的路。
看完這場,你可以理解為什麼 Sutton 說自己不奇怪。三十年前他說學習比知識重要,沒人理會;現在全世界都在討論他 2019 年寫的那篇短文。現在他說讓模型在使用中持續學習才是正道,主流做法是繼續堆合成資料。歷史會怎麼收場,你自己判斷。Oak Lab 還很小,能不能走到終點是另一回事;但這場對談至少說清楚了一件事:現在這條路的天花板,Sutton 在 2019 年就已經看見了。
解釋 The Bitter Lesson 的核心:不要被人類知識分心,專注於能隨算力擴展的學習方法,例如 search 和 learning;他同時澄清這不是說演算法不重要,而是要找能隨算力擴展的演算法,而非隨人類輸入擴展的演算法。
被問到合成資料是否能突破現有瓶頸,直接回答「那是個大錯誤」,並引出 big world hypothesis:世界無限複雜,任何合成資料集都只是微小切片,而且生產合成資料的瓶頸永遠卡在人類專業知識。
補充合成資料的人類瓶頸論證:若 OpenAI 或 Anthropic 的工程師全去度假,合成資料就停產;資料不是從 agent 自身經驗生成的,需要人類專家判斷什麼是好的合成資料。
說明大型語言模型在使用中權重從不改變,並直接點名:聲稱能做出博士級能力卻完全不再學習的系統,這個主張本身才是奇怪的。
解釋 continual backprop 演算法的兩個關鍵機制:每個權重有獨立學習速率(大多數權重動得很慢以保留舊知識),以及持續植入隨機初始化的新神經元(generate and test);提到這個演算法已發表於 Nature。
給出對大型語言模型的正面評價:神經網路在語言運用上的重大突破,完全出乎預料;同時指出語言流暢度只是智慧的一部分,問題在於它被當成全部的 AI 在行銷。
說明 Oak Lab 的長期硬體目標:一兆參數模型消耗 20 瓦;用 Moore's Law 推算,若今天能用 2,000 瓦實現,10 年後可達 20 瓦;強調這需要正確演算法配合才成立。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
