Google三週內再推新模型:Gemini 3.7 Flash主打編碼與Agent降價一半
Google於Gemini 3.6 Flash發布三週後推出Gemini 3.7 Flash,主打程式碼除錯、網頁開發與知識密集工作;多項benchmark分數明顯提升,定價為每百萬輸入token 0.75美元、輸出3.75美元,是前代價格的一半,即日起適用於Gemini API與Spark個人助理。
三週迭代一次、價格砍半但性能提升,說明Google正把agent市場的成本瓶頸(重試多、需人工盯)當主戰場打;已布建Gemini生態的企業省成本,但迭代太快也意味著workflow要不斷重新驗證。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
Google DeepMind距離上一代Gemini 3.6 Flash發布僅三週,就推出Gemini 3.7 Flash,定位是「編碼與agent最強工作型模型」。這速度本身就是訊號:模型迭代週期正在被壓縮到以「週」計算,而不是過去的季度或半年。
數字說話。編碼上,FrontierCode 1.1 Main從34.4%衝到43.6%,DeepSWE v1.1從49.0%到65.3%;網頁開發在WebDev Arena的Elo從1538升到1588;處理複雜文件的GDP.pdf benchmark從22.0%翻倍到34.0%;完成真實商業流程的AutomationBench從17.0%跳到30.4%。這些不是零頭升級,是接近腰斬式的錯誤率改善。更關鍵的是價格:每百萬輸入token 0.75美元、輸出3.75美元,是上一代的一半。性能漲、價格砍半,這組合才是重點,不是單一benchmark分數。
這代表什麼?Agent這門生意最大的成本瓶頸從來不是模型聰不聰明,是跑起來太貴、太多次重試。Google這次強調的「更少manual oversight、更少retries」,直接打的就是這個痛點——模型思考更仔細、規劃更多步、執行更有紀律,意味著企業跑agent工作流不用一直人工介入收拾殘局。這對想把AI agent推向生產環境的公司,是實質的單位經濟改善,不是行銷詞彙。
放進競爭格局看,這是Google在用「快、便宜、可堆量」的打法纏鬥Anthropic與OpenAI在coding agent市場的地盤。三週一迭代的節奏,配合腰斬式定價,等於是把價格戰和技術戰同時打。對已經把agent工作流建在Gemini生態上的開發者與企業客戶,這是白撿的成本下降;對還在猶豫要不要重壓某個模型供應商的企業,這種迭代速度反而是風險——你今天調校好的prompt和workflow,可能三週後又要重新驗證一遍。Gemini Spark同步升級到3.7 Flash,支援Google Workspace的多技能工作流,說明Google也在把這套能力往一般知識工作者滲透,不只是留給開發者。
模型變便宜變強是好事,但迭代速度本身正在變成一種新的營運成本——誰跟不上這個節奏,誰就要付出重複驗證與遷移的隱性代價。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
