Google 發布 Gemini 4 Argon:18 項基準中領先或並列 13 項,但尚未全面開放
Google 發布 Gemini 4 Argon,在自家揭露的 18 項基準中,Argon 領先 12 項、並列 1 項;GPT-6 Astra 領先 3 項、Claude Opus 5.5 領先 2 項。上市初期定價每百萬 input $2、output $10,優惠期後升至 $4 / $20;支援 100 萬 output tokens。目前限 Fairwind Program 受信任網路安全防禦者使用,廣泛開放時間未定,將優先向付費 API 客戶與 Google AI Ultra 訂閱者開放。
Argon 以五分之一 GPT-6 Astra 的價格,在多數基準上取得領先,直接壓縮 OpenAI 的定價空間;但 GPT-6 Astra 在前沿程式工程、科學終端任務仍領先逾 10 個百分點,企業採購還是得按工作負載選模型,不是誰贏基準就通吃。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
Google 發布了新一代旗艦模型 Gemini 4 Argon,在 18 項公開基準測試中,Argon 在 12 項領先、1 項與 GPT-6 Astra 並列,總計在 13 項取得最高分;GPT-6 Astra 領先 3 項、Claude Opus 5.5 領先 2 項。這是 Google 自 2025 年 11 月 Gemini 3 系列之後,首次發布新旗艦模型。
具體數字最能說明 Argon 的定位。在法律代理基準 Harvey’s Legal Agent Benchmark,Argon 得分 19.6%,GPT-6 Astra 為 5.4%、Claude Opus 5.5 為 3.8%,領先幅度懸殊。在 Zapier 的端到端業務自動化基準 AutomationBench,Argon 得 51.3%,對手分別為 42.5% 與 41.4%。在長影片理解 LVBench,Argon 以 91.7% 對 GPT-6 Astra 的 87.5% 與 Claude Opus 5.5 的 83.7%。輸出長度也是亮點:Argon 支援最多 100 萬 output tokens,相較前代上限 6.4 萬 tokens,對於需要長時間維持工作鏈的代理任務(代碼審計、法律審閱、系統遷移)意義明顯。定價方面,上市初期每百萬 input tokens 定價 2 美元、output 10 美元,是 GPT-6 Astra(input $10、output $50)的五分之一,與 Claude Opus 5.5($4 / $20)相比也便宜一半;優惠期結束後,Argon 將升至 $4 / $20,與 Claude Opus 5.5 持平,仍低於 GPT-6 Astra。

但這場勝利並不乾淨。GPT-6 Astra 在 FrontierSWE v2(65.5% vs 55.0%)與 Terminal-Bench Science 0.1(68.1% vs 57.6%)均領先超過 10 個百分點;Claude Opus 5.5 在 Terminal-bench 4.0(66.4% vs 57.4%)和 PostTrainBench(49.3% vs 45.3%)同樣保有優勢。換句話說,Argon 在廣度上贏,但 OpenAI 與 Anthropic 各自在特定任務類型(前沿程式工程、終端代理、科學運算)仍保有明顯實力。對企業買家來說,模型選擇還是得看工作負載,沒有一刀切的答案。
發布時機的背景同樣重要。過去數月,Google DeepMind 歷經高層大換血:Demis Hassabis 從執行長轉任 Alphabet 董事長兼首席科學家,Jeff Dean 離職創業,Koray Kavukcuoglu 接掌 DeepMind;外部報告指出人才流失、模型延遲與內部路線分歧同時發生。Google 拿 Argon 回答的,不只是技術問題,而是「旗艦產品節奏是否失控」這個更根本的市場質疑。現在這個問題至少在紙面上有了答案。
Argon 尚未公開上市,目前僅向 Fairwind Program 的受信任網路安全防禦者開放,並正在走美國政府自願性預上市審查流程,全面開放將從付費 API 客戶與 Google AI Ultra 訂閱者開始。這意味著大多數企業買家還需要等一段時間,才能實際驗證基準數字能否在真實生產環境中兌現——法律、財務、代碼、網路安全這四條賽道,才是 Argon 真正的考驗場。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 130 期 ・ 隨時可退訂

