Meta 研究發現:用訓練框架讓 8B 小模型追平 Claude Opus 4.5,推理成本有望大幅壓縮
Meta AI 與伊利諾大學研究人員提出 EvoHarness-RL 框架,以 Qwen3-8B(80 億參數)為基底模型訓練後,在 ALFWorld 多步驟任務基準達到 96.9% 成功率,追平 Claude Opus 4.5 的 96.4%;未訓練的 GPT-4.1 與 GPT-5 只加上 BPE 狀態介面後,成功率分別提升 22.1 與 25.7 個百分點。
一個 8B 小模型靠訓練方法追平旗艦大模型,代表 AI 代理的長時任務成本結構可能被打破——企業不一定要持續付前沿 API 費才能跑複雜工作流,但這仍是論文階段結論,能否落地生產還需驗證。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這不是更大的模型打敗更小的模型,是一個訓練方法讓小模型打平了大模型。
Meta AI 與伊利諾大學香檳分校的研究人員提出 EvoHarness-RL 框架,核心思路是:與其讓開發者手寫一大堆規則告訴 AI 代理「步驟一做什麼、步驟二做什麼」,不如訓練模型自己學會什麼時候要查外部狀態、什麼時候不值得查。實驗基底是 Qwen3-8B,一個標準的 80 億參數小模型。訓練完之後,這個小模型在 ALFWorld 多步驟任務基準上拿到 96.9% 的平均成功率,幾乎完全追上 Claude Opus 4.5 的 96.4%,同時超越了 SkillRL(89.9%)與 SkillOS(80.2%)等現有可訓練框架。
EvoHarness-RL 的運作邏輯分兩層。第一層是「統一狀態介面」——把 AI 代理在長時間任務中需要管理的各種外部資訊,壓縮成三個功能區塊:Belief(當前環境是什麼狀況)、Progress(哪些子目標完成了、哪些還沒)、Experience(過去跑過的流程裡有什麼可以重用)。AI 用四個簡單的 meta-action(track、commit、recall、note)來操作這個統一介面,不再需要針對每個應用場景去寫複雜的 domain-specific API。第二層是「成本意識強化學習」——因為每次查詢外部狀態都要燒 token 和算力,訓練讓模型學會判斷什麼時候查才划算、什麼時候靠自己內化的知識直接走。研究人員觀察到一個有趣的行為:訓練越深入,模型對外部工具的依賴反而越少——它把熟悉的流程直接燒進參數,只在遇到陌生情況時才拉回來查外部狀態。這個現象被稱為「harness annealing」。
值得注意的是,這個框架不是只有訓練過的小模型受益。研究人員另外測試了未訓練、直接開箱使用的前沿大模型——只是加上 BPE 狀態介面當 prompt 層,GPT-4.1 的成功率就提升了 22.1 個百分點,GPT-5 提升了 25.7 個百分點。換句話說,這個狀態管理架構本身就有用,不依賴訓練也能發揮效果。
對企業端的意涵直接而具體。現在要用 AI 跑複雜的長時任務——資料庫遷移、合規稽核、多步驟程式碼重構——標準作法是砸前沿大模型的錢,因為小模型在長時間任務裡容易失憶、跳步、重複犯錯。EvoHarness-RL 如果能夠複製到生產環境,就代表一個 8B 的開源小模型可以做到以前要付旗艦模型 API 費的事。推理成本的差距在目前市場上動輒超過十倍。研究人員也直接點出一條混合架構路線:用前沿大模型生成高品質的狀態整合訓練資料,再把開源小模型微調成能處理日常狀態管理的執行引擎,前者只需要在整合階段出現,主執行迴圈由小模型扛。這條路徑技術上已有先例,但 EvoHarness-RL 把它系統化了。
目前這還是一篇 arXiv 論文,基準測試環境 ALFWorld 是文字型模擬情境,距離真實生產系統的複雜度有落差。但方向是清楚的:大模型的能力天花板,未必要靠大模型自己來觸及。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
