Fastino 推出 340M 參數 CPU 決策模型 GLiNER2.5-Decide,Apache 2.0 授權、可離線部署
Fastino Labs 於 9 月 24 日發布 GLiNER2.5-Decide,340M 參數、encoder 架構、Apache 2.0 授權,已上架 Hugging Face。模型接受文字加自訂規則輸入,輸出帶信心分數的結構化決策,不生成自由文字。在 48 核 Intel Xeon Platinum 8581C 上 p50 延遲 167.3ms,Nvidia T4/L4 約 43ms;支援氣隙環境部署,無需連外部 API。
GPU 塞車、記憶體漲七倍的年份,一個跑在普通 CPU 上、授權無上限、可離線的決策模型,直接省掉 GPU 採購、資料出境、廠商鎖定三道企業關卡。它不打算取代大模型,但那些默認路由給大模型的高量低複雜分類工作,Fastino 正在搶著接走。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
GPU 塞車、記憶體漲價——Fastino Labs 選在這個時間點推出 GLiNER2.5-Decide,不是沒有道理的。
這個模型只有 340M 參數,跑的是 encoder 架構,不生成文字,只做一件事:把一段文字加上開發者自訂的問題或規則丟進去,吐出帶有信心分數的結構化決策。「這張支援工單有沒有提到退款要求?」「這條合約條款有沒有便利終止權?」這類問題,GLiNER2.5-Decide 的答案是 yes/no 加一個機率值,不是一段生成的散文。

關鍵數字只有一個,但它說明了一切:在 48 核心 Intel Xeon Platinum 8581C 上,p50 延遲 167.3 毫秒,不需要 GPU。換上 Nvidia T4 或 L4,數字掉到 43 毫秒出頭——CPU 比 GPU 慢三到四倍,但對批次文件審查、非同步工單分類這類場景,167 毫秒已經夠用,而那台 Xeon 是多數企業機房裡本來就有的設備。Intel CEO 今年說記憶體成本已漲了七倍、2028 年前不會緩解;Fastino 的回應是:那就讓你用已經擁有的硬體跑 AI。
架構選擇決定了它的定位。Decoder 型大語言模型是逐 token 生成文字,天生帶有隨機性,同樣的 prompt 不同次跑可能給出不同答案——這在合規篩選、內容審核、路由邏輯這類場景是真實的風險。Encoder 模型一次讀完整段輸入、映射到固定輸出,Fastino 稱之為「確定性分類」。這不是行銷用語,是架構上的真實差異:同樣的輸入進去,同樣的答案出來,每次都一樣。
授權條款是另一個值得注意的地方。GLiNER2.5-Decide 採 Apache 2.0,沒有營收上限、沒有使用量封頂、沒有強制回饋原始碼的義務。今年市面上出現過一些開放權重模型,條款裡藏著「部署規模超過某門檻就觸發收益分成」的條款;Fastino 這次沒有。加上 Fastino 聲稱支援氣隙(air-gapped)環境部署——完全不需要連外部 API——讓這個模型對政府與受監管產業的採購障礙少了好幾道:法律審查授權條款、資料落地合規、廠商鎖定,這三個通常拖慢企業 AI 導入的問題,一次繞掉。
這個模型的血統來自開源 GLiNER 專案,原本是做零樣本命名實體辨識用的——不需要提前訓練特定類別,只要在推論時描述你想辨識的實體類型就能使用。GLiNER2.5-Decide 把這個「描述你要什麼、拿到結構化答案」的邏輯從標記實體擴展到完整決策,是同一條技術路線上更大的一步。
有一個細節值得留意:Fastino 自己的公告和 Hugging Face 模型卡寫的是 340M 參數,但公司模型列表頁顯示的是 355M,差了約 4%,至今沒有公開解釋。這在平常可能只是四捨五入問題,但在一個參數數字被仔細檢視的年份,這種首頁數字對不上的情況,大型企業買家不會輕易放過。
GLiNER2.5-Decide 不打算取代 GPT 或 Claude——這場仗它根本不參加。它瞄準的是那一大塊「其實不需要大模型、但目前默認路由給大模型」的高量、低複雜度決策工作:工單分類、發票欄位擷取、內容審核初篩。這些工作量大、重複性高、要求的是快和穩,不是創意。用一個 340M 的 CPU 模型先過濾、只把真正複雜的請求升交給貴的大模型,這條「預篩路由」邏輯本身不是新的,AWS AgentCore 今年就在代理管線裡做類似的事。Fastino 做的是讓這條路線可以不靠 GPU 跑起來。
GPU 還在塞,這類「夠用就好」的小型決策模型還會繼續冒出來。Fastino 有沒有辦法在那一波裡站穩,要看的不是 benchmark,而是參數數字的矛盾能不能解清楚、以及企業管線整合夠不夠順。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

