Google 發布 Gemini 3.8 Flash:單價不變但實際帳單可能更高,代理任務是核心賭注
Google 本週發布 Gemini 3.8 Flash,定價與 3.7 Flash 相同(輸入每百萬 token $0.75、輸出 $3.75),但因單次任務輸出 token 量增 30%,Artificial Analysis 測算實際任務成本約貴 40%。新模型在 DeepSWE v1.1 軟體工程基準上超越 Anthropic Fable 5,並同步推出僅限政府與受信任夥伴使用的 Gemini 3.8 Flash Cyber。
「單價不變、帳單更貴」是代理時代的新常態——模型廠商把成本壓力轉嫁給任務複雜度,企業採購 AI 服務必須從按 token 報價改成按任務總成本估算,否則預算很容易失控。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
Gemini 3.7 Flash 才上線幾週,Google 就推出 3.8 Flash,更新節奏之快值得注意。
這次的核心賣點只有一個字:「更努力」。Google 說 3.8 Flash 在複雜任務上會執行更多推理步驟、反覆呼叫工具,劍指代理(agentic)場景。帳面單價維持 3.7 Flash 同級,每百萬輸入 token $0.75、輸出 $3.75——但 Google 自己警告,模型可能用更多 token 來衝效能,尤其在高努力設定下。市場研究機構 Artificial Analysis 的實測也印證了這點:儘管每 token 單價不變,3.8 Flash 的實際任務成本比 3.7 Flash 高出約 40%,原因是單次任務輸出 token 量增加 30%,加上代理評估中的對話輪次變多。換句話說,「價格不變」是行銷語言,實際帳單要自己算。
效能數字方面,3.8 Flash 在軟體工程基準 DeepSWE v1.1 上超越 Anthropic 剛升級的 Fable 5,也在 Vals Finance Agent V2 和 Harvey 法律代理基準測試中壓過競品。Aigora.ai 執行長 John Ennis 的評語更直接:「Opus 5 等級的編程品質,但成本只是一個零頭,速度還更快。」這類來自第三方的強烈說法,在前沿模型競爭中已成常見的打法,仍需等更多獨立基準數據驗證。
與此同時,Google 同步推出 Gemini 3.8 Flash Cyber,僅開放給政府與「受信任夥伴」,透過新設的 Fairwind 計畫管道,目前有 650 名成員,包括資安廠商 CrowdStrike 及網路安全組織 Center for Internet Security。Flash Cyber 搭配 Google 的 CodeMender 代理,主打自主找出並修補漏洞。這個架構幾乎是 OpenAI 本週公告的 Astra 網安部署模式的翻版——前沿攻防能力開放,但限定在受管控的聯盟框架內,而非對所有人開放。這不是偶然,而是整個 AI 產業目前應對監管壓力的標準動作。
更大的背景是:Anthropic 本週也剛更新 Fable 5.1,大幅降低快取成本,劍指高頻代理任務;Google 隔沒幾天就推出 3.8 Flash,強調代理場景優勢——兩家都在搶同一塊市場,差距已縮窄到基準分數個位數的層級。對使用這類模型跑自動化工作流程的企業來說,真正的問題不是單 token 單價,而是整個工作任務跑完要燒多少錢。3.8 Flash 的答案是:比上一代貴 40%,但如果效能真的跟得上,未必不划算——就看實際落地的 ROI 怎麼算。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
