MiniCPM5-2B 以 25 億參數勝出更大對手,小型模型正在重塑推論成本結構
OpenBMB 於 2026 年 9 月釋出 MiniCPM5-2B,約 25 億參數,原生上下文窗口 131,072 tokens;在自家設計的 34 項基準中得分 53.9,高於比較組最強的 Qwen3.5-4B(51.1)。同週 Ornith-1.5-9B(90 億參數)在 SWE-Bench Verified 拿下 70.6,Liquid AI 推出 2.8 億參數草稿模型用於投機解碼,Supersonic Labs 發布 1.44 億參數的 Julia 1。
小模型每次刷新基準,就讓前沿 API 的高價格多一分難以自辯:跑在自有硬體上的 25 億參數開源模型邊際成本近乎零,相比 Grok 4.7 每百萬 token 最高 6 美元,差距已大到影響企業採購邏輯。混用小模型處理高頻任務、前沿模型只做最硬的活,正從架構選項變成標準實踐,但自評基準未經第三方驗證是使用前必須確認的前提。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
OpenBMB 在 9 月釋出 MiniCPM5-2B,這是一個僅有約 25 億參數的開源語言模型,卻在自家設計的 34 項基準測試中拿下 53.9 分,擊敗同一比較組內最強的 Qwen3.5-4B(51.1 分)——後者參數量約為前者的 1.6 倍。同一週內,Ornith AI 的 Ornith-1.5-9B 在 SWE-Bench Verified 拿下 70.6 分,接近四倍體積對手的推理表現;Liquid AI 推出 2.8 億參數的 LFM2.5-VL-3B-DSpark 草稿模型,以投機解碼降低延遲;Supersonic Labs 的 Julia 1 更壓縮至 1.44 億參數。這不是單一亮點,而是同一個 48 小時窗口內密集出現的多個效率優先押注。
數字背後的真正問題是:2.8 分的差距究竟值多少錢?MiniCPM5-2B 贏在記憶體佔用只有對手的六成、推論更快、可以跑在消費級 GPU 甚至筆記型電腦上,不需要伺服器機架。相比之下,xAI 的 Grok 4.7 每百萬輸入 token 要 2 美元、每百萬輸出 6 美元,而一個下載完成、硬體已備妥的 25 億參數開源模型,邊際成本幾乎是零。這個對比讓「多花十倍錢跑前沿模型」的理由,每一次小模型基準刷新都更難自圓其說。DeepSeek 已對 V4.1-Flash 下殺七成輸出價,Abacus.AI 宣稱用小型開源模型跑代理任務成本可壓低至前沿模型的百分之一,都是同一個壓力的具體呈現。

小模型為何突然趕上來?三股趨勢在同一時間點收束:大模型蒸餾技術成熟,讓小模型從大型教師模型吸收能力、不需要搬移參數量;訓練資料的清洗與篩選邏輯取代了單純堆量;架構設計愈來愈聚焦「每個參數能推多遠」而非「總參數有多少」。這一輪效率優化的輪迴並不陌生——從 2024 年 Llama、Mistral、Phi 系列讓 70 億到 130 億參數模型進入過去 300 億參數才有的表現帶,到現在 MiniCPM5-2B 把天花板再往下壓,都是同一個模式在跑。文章估計,達到同等基準分數所需的參數量大約每十八個月折半,若趨勢延續,今天 9 億參數的旗艦編碼模型,明年就可能只是 5 億參數模型的起跑線。
對企業經營者而言,最直接的決策意涵是:「每個任務都送到前沿 API」的採購邏輯正在失效。現實的架構已在往另一個方向走——用小型開源模型處理日常編碼、分類、路由等高頻任務,前沿模型保留給少數需要最高推理品質的場合。但有一件事值得放進決策清單:這週的所有基準數字都來自釋出模型的各家實驗室自己的比較組,而且比較組可以選有利於自家模型的對手。Supersonic Labs 主動揭露 Julia 1 在 Banking77 分類測試輸給基準線,這種誠實算少見。新模型進入生產系統之前,等第三方獨立排行榜的驗證,不是謹慎過頭,是基本程序。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

