【專訪】Lambert 與 Raschka:架構沒變,下一個突破卡在工具使用
算力正在以十億美元為單位堆疊,各家模型每隔幾個月就宣稱重寫規則。就在這個節骨眼上,Lex Fridman——以長達數小時深度技術訪談著稱的 podcast 主持人——找來了兩位在 AI 圈同時身兼研究員,工程師與教育者角色的人坐下來算總帳:Nathan Lambert,Allen Institute for AI 的後訓練負責人,也是強化學習從人類回饋訓練領域的專書作者;Sebastian Raschka,機器學習研究者,著有《從零開始建構大型語言模型》系列實作書。這場對話錄於 2026 年 2 月,外界正在爭論的問題很直接:中美誰在贏?模型還在進步嗎?下一個突破在哪裡?兩人沒有給你一個乾淨的答案,但他們給了你一張地圖。
這場訪談值得拆開來看的點有五個,合起來指向同一個結論:AI 的進步遠比外界宣傳的更加雜亂,昂貴,也更依賴人的判斷。第一,中美競爭沒有贏家,只有不斷的技術輪替。第二,模型架構幾乎沒變,真正的進步發生在訓練流程與資料品質。第三,RLVR 是 2025 年最重要的訓練突破,但它的天花板正在逼近。第四,開源模型的地緣政治意義被嚴重低估。第五,AGI 的時間表討論幾乎全是噪音,真正的問題是工具使用能不能突破。
◎沒有贏家,只有最新的那個模型
Raschka 的判斷很清楚:2026 年不會有任何一家公司獨佔技術。研究員在各實驗室之間流動,想法跟著人走,所以真正的護城河不是演算法,是預算與算力。Lambert 補充了更細的觀察:Claude Opus 4.5 在代碼領域的口碑正在爆炸性成長,Gemini 3 在發布當下被捧為谷歌翻身之作,但幾個月後討論聲量就被前者壓過。這個循環他們兩人都親身體驗過——你用某個模型,它在某個任務上讓你驚豔,你就黏住了,直到它做了一件蠢事,你才換。這不是理性決策,是肌肉記憶。問題不是哪個模型最強,而是這種輪替會不會永遠持續下去。兩人的答案是:至少在 2026 年,會。
◎架構沒變,但訓練流程徹底重寫了
Raschka 做了一件很有價值的事:他把 GPT-2 到今天所有主流模型的架構差異列出來,結論是——差異小得驚人。Mixture of Experts 是把一個大型全連接層拆成多個專家網路,依輸入動態選用,讓模型在不增加每次計算量的前提下塞入更多知識;注意力機制有幾種變體在壓縮記憶體佔用。但這些都是調旋鈕,不是換引擎。真正讓模型能力跳躍的,是訓練流程從預訓練單階段演化成預訓練,中期訓練,後訓練三段,以及資料品質的精煉——包括把雜亂的網路文本重新格式化成高品質合成資料。Lambert 補充了系統層面:從 FP16 到 FP8 再到 FP4 的數值精度壓縮,讓同樣的硬體每秒能跑更多矩陣運算,實驗迭代速度因此大幅加快。看起來像架構革命的東西,其實是工程積累。
◎RLVR 是 2025 最重要的突破,但低懸果實快摘完了
RLVR——以可驗證獎勵進行強化學習——的核心思路是:給模型一道有標準答案的題目,讓它反覆嘗試,用對錯當作獎勵訊號。DeepSeek R1 把這件事做到了可以量化的規模突破,讓模型學會在回答前先想——生成大量中間步驟,自我糾錯,再給出答案。Lambert 和 Raschka 都強調,這個訓練方式同時解鎖了推理時間擴展:讓模型在回答時多花算力生成更長的思考過程,等於用推理成本換取準確率。這是 2025 年用戶感受到模型能力跳躍的最主要原因。但兩人也說清楚了邊界:RLHF——從人類偏好回饋學習——是幫模型收尾,調整語氣與格式的工具,無法無限擴展;RLVR 雖然可以持續投入算力換取進步,但可驗證的題目域——數學,代碼——正在被模型解盡,研究重心必須移向更難定義正確答案的科學域與開放問題。Lambert 的預言藏在這裡:他預期 2026 年內會出現 $2,000 美元月訂閱方案,背後是更大的模型,更長的推理鏈;若這個定價在 2027 年底前尚未出現,代表推理時間擴展的邊際價值已提前見頂,值得對帳。
◎開源模型是地緣政治問題,不只是技術問題
Lambert 發起的 ATOM 計畫——美國真正開源模型倡議——背後的邏輯很直接:中國的開源模型正在全球累積使用量與影響力,因為美國企業基於安全疑慮不會付費訂閱中國的 API,但開源模型可以繞過這個障礙。DeepSeek 帶起的不只是一個模型,而是一整個中國開源模型生態,包括 Kimi,MiniMax,Z.ai 等後繼者。Lambert 指出,這些公司很清楚自己的處境:他們無法向美國企業直接賣 API,所以開源是進入市場的唯一途徑。Raschka 補充了另一個維度:開源模型的授權條款通常比 Meta 的 Llama 或 Google 的 Gemma 更寬鬆,沒有用戶數上限的限制。對台灣的企業而言,這個趨勢的實際意義是:未來幾年在地端部署 AI,客製化行業模型的成本會持續下降,而選擇哪個來源的模型,本身就是一個需要主動判斷的決策。
◎工具使用才是真正的瓶頸,不是 AGI 的哲學定義
兩人在討論工具使用時並未聚焦於 AGI 時間表的爭論,而是直接切入更具體的問題。真正值得追蹤的問題更具體——LLM 什麼時候能可靠地使用外部工具?工具使用指的是模型主動呼叫計算機,執行網頁搜尋,操作代碼環境,而不是從訓練資料中背答案。Raschka 認為這是解決幻覺問題最直接的路徑。Lambert 則點出了現實落差:工具使用的能力雖已在 gpt-oss-120b 等模型中初步實現,但開源生態對工具呼叫模式的採用仍然有限,信任與安全顧慮是主要障礙。兩人的判斷是:工具使用的突破,比任何 AGI 時間表的爭論,更能直接決定 AI 對經濟的實際影響。Raschka 也提到了遞迴語言模型的概念——把長任務拆解成子任務,讓多個 LLM 實例協作——作為近期最值得觀察的架構方向之一。
看完這場訪談,我的結論是:外界對 AI 進步速度的敘述,和實際發生的事情之間,有一條很深的溝。模型在進步,但進步的來源是資料品質,訓練流程與系統工程的積累,不是每隔幾個月就出現的歷史性突破。Lambert 和 Raschka 兩人都是真正在訓練模型的人,他們的口氣裡沒有末日論,也沒有烏托邦。他們說的是:現在最有價值的能力,是知道這個工具在哪裡有用,在哪裡會出錯。這對你來說,比任何 AGI 時間表都更值得花時間弄清楚。
Raschka 提出 2026 年不會有任何公司獨佔技術的判斷,認為差異化因素將是預算與硬體資源,而非演算法本身的獨佔性。
Lambert 描述 Claude Opus 4.5 的市場口碑爆發,以及 Gemini 3 發布後聲量被快速壓過的現象;同時指出 DeepSeek 在中國引發的開源模型生態擴張,包括 Kimi,MiniMax,Z.ai 等後繼者正在搶佔中國開源模型的領先地位。
Raschka 逐一比較 DeepSeek,Qwen 等主流開源模型的架構差異,說明 Mixture of Experts,Multi-head Latent Attention,Group Query Attention 等技術名詞的實際含義,並指出從 GPT-2 到今日主流模型的架構相似程度超乎預期。
Lambert 說明三種擴展維度——預訓練擴展,強化學習訓練擴展,推理時間擴展——並指出 RLVR 的低懸果實在 2025 年已大量被摘取,下一個步函數尚不明確。
Lambert 說明 RLVR 的運作機制:讓模型對可驗證問題反覆嘗試,以正確率作為強化學習的獎勵訊號;並提到他所在的 AI2 團隊在 Tulu 3 論文中率先使用 RLVR 這個術語。
Lambert 介紹 ATOM 計畫(American Truly Open Models)的背景與動機,說明中國開源模型正在全球累積影響力,以及 AI2 獲得 NSF 史上最大 CS 補助金(1 億美元,為期四年)的進展。
兩人討論 AGI 與 ASI 的定義分歧,Lambert 指出電腦操控功能(computer use)在 2025 年各家實驗室的實際表現均不理想,認為工具使用的可靠性比 AGI 時間表更值得追蹤。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
