【專訪】Stefano Ermon:推論效率才是 AI 下一場架構戰的主戰場
AI 圈現在最熱的辯論不是誰的模型最聰明,而是誰的模型最快,最省錢。Stefano Ermon 是史丹佛大學教授,也是 diffusion model(擴散模型,一種從雜訊中逐步生成內容的 AI 架構)這個技術路線的奠基人之一——你手機裡看到的 AI 生成圖片,短影音,背後幾乎都是他這個方向的後代。他現在創辦了 Inception,要把同樣的技術邏輯搬進語言模型,正面挑戰 OpenAI 這些大廠。這場訪談的核心問題很簡單:現在這個時間點,一個五十人的新創,憑什麼跟算力無限的大廠搶生意?
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得注意的地方有四個。第一,Ermon 提出了一個結構性論點:現在的主流語言模型在推論時天生低效,而 diffusion 架構從底層解決這個問題。第二,他用 2017 年 RNN 被 Transformer 取代的歷史來類比,暗示下一次架構革命已經在路上。第三,Inception 的 Mercury 模型已經在跑真實客戶,速度對標大廠快速版,這不是 demo。第四,他對學術研究還能不能出真東西給了一個很有說服力的答案。合起來看,這場訪談的底層主張是:AI 競爭的下一個戰場是效率,不是參數量。
◎推論效率不是加分題,是下一場架構革命的引爆點
Ermon 的核心論點要從 2017 年講起。那年 AI 圈把 RNN 換成 Transformer,理由很直接:RNN 每次只能處理一個字,訓練太慢;Transformer 可以同時處理很多字,訓練效率大幅提升。但問題來了——Transformer 訓練時是平行的,推論(也就是模型真正在回答你問題的時候)卻還是一個字一個字吐,完全是循序的老路。這種工作模式對 GPU 非常不友善:GPU 最擅長大量平行運算,但循序吐字讓它大部分時間都在搬記憶體,等下一個字,算力嚴重浪費。Ermon 說,diffusion 架構在推論時是同時輸出很多字,工作模式和訓練時一樣平行,天然適合 GPU。他的結論是:就像 RNN 到 Transformer 是訓練端的效率革命,diffusion 是推論端的效率革命,而且時機已到——因為現在 AI 應用的成本瓶頸正在從訓練移向推論。
◎Mercury 跑速對標大廠快速版,不是論文,是生產環境

Inception 的語言模型產品叫 Mercury。Ermon 說,Mercury 在評測基準上的品質已經對標 OpenAI 的 mini,nano,Anthropic 的 haiku,flash 這類速度優化版本,但速度更快。更重要的是,這不是實驗室數字——Mercury 已經在跑真實客戶的生產流量。他舉了語音 AI 公司 Open Call 當例子:語音應用的延遲要求極高,這家公司之前要靠 Cerebras 的特製晶片才能壓住延遲,換成 Mercury 之後,用標準 Nvidia GPU 就能達到同等速度,還更便宜,供貨更穩定。這個案例說明的不只是速度,而是軟體層面的效率增益可以部分取代硬體層面的暴力解法——對需要大量推論的應用來說,這是實實在在的成本差距。
◎20 到 30% 的工作量,就是 Inception 現在要搶的市場
有人會問:速度再快,如果模型沒有頂尖大廠聰明,誰要用?Ermon 的回答是:不是所有工作都需要最聰明的模型,需要的是夠快的模型。他說他估算過 Open Router(一個彙整各家 AI 模型使用情況的平台)的數據,認為大概有 20 到 30% 的應用場景對延遲極度敏感——語音助理,即時客服,程式碼補全這類。在這些場景裡,在固定的延遲預算內品質最高的模型,就是贏家。這 20 到 30% 是他說的下限,不是天花板。而且他補充,diffusion 模型在資料效率上可能也有優勢——因為訓練時同一筆資料會被加上不同程度的雜訊反覆學習,等於自動做了資料擴增。如果這個特性在大規模訓練下也成立,那在資料稀缺的專業領域,diffusion 可能還有額外的牌可以打。
◎學術界還能出真東西嗎?他的履歷就是答案
主持人問了一個很現實的問題:大廠算力無限,學術界還能做出有影響力的東西嗎?Ermon 沒有講大道理,直接列清單。他的實驗室出了 diffusion model 的基礎理論,後來變成 Stable Diffusion,Midjourney 的底層。他參與指導了 Flash Attention——一種讓 Transformer 記憶體使用效率大幅提升的技術,現在幾乎所有大型語言模型訓練都在用。他的實驗室還做出了 DPO(Direct Preference Optimization),一種讓語言模型對齊人類偏好的訓練方法,目前被廣泛用於各家模型的後訓練流程。這三個東西都是從學術圈的小預算實驗室出來的,後來全部變成了工業標準。他的論點是:學術界的優勢是可以押冷門,押長線,不用對季度業績負責——這種自由度在一個還沒有人知道最佳解的領域裡,是真正的競爭優勢。
Ermon 這場訪談讓我想到一件事:每次有人說某個架構已經定案,格局已定,通常是那個架構正要被換掉的前夕。RNN 的人也這樣說過。Inception 現在的規模不大,但它押的那個賭——推論效率才是下一個主戰場——在算力成本持續上升的現實下,方向感覺是對的。至於五十個人能不能在大廠追上來之前跑得夠遠,那是另一個問題,也是值得持續觀察的問題。
說明 diffusion model 的核心概念:從純雜訊開始,逐步去雜訊直到生成乾淨內容,而非傳統的逐字逐像素生成。
描述 2024 年的關鍵論文:在 GPT-2 規模下,diffusion 語言模型首次達到與 autoregressive 模型相同的品質(perplexity 相當),但生成速度快 10 倍。
以 2017 年 RNN 到 Transformer 的轉換為類比,論證 diffusion 是推論端的下一次架構革命:autoregressive 模型推論天生循序,不適合 GPU 平行運算,diffusion 模型則相反。
談速度優勢在哪些場景已有實際需求,並提到客戶 Open Call:該公司原本需要 Cerebras 特製晶片才能達到語音應用所需的低延遲,改用 Mercury 後在標準 Nvidia GPU 上達到同等速度。
解釋 diffusion 模型在可控性上的結構優勢:autoregressive 模型必須等到輸出完整才能評分,diffusion 模型在生成過程中就可以持續引導輸出方向,更容易整合外部限制條件。
估算市場規模:根據 Open Router 的使用分布,他認為約 20 到 30% 的 AI 應用場景對延遲極度敏感,是 diffusion 語言模型當前可以直接切入的市場下限。
列舉三個從其學術實驗室出發後成為工業標準的成果:diffusion model 基礎理論,Flash Attention,DPO,用以回應外界對學術研究影響力的質疑。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

