Google 將電腦操控能力內建至 Gemini 3.5 Flash,企業自動化部署門檻再降
電腦操控能力(computer use)不再是獨立模型的專屬功能——Google DeepMind 宣布將其直接整合進 Gemini 3.5 Flash 主線模型,讓開發者透過既有的 Gemini API 與 Gemini Enterprise Agent Platform 即可取用,不必切換到另一個特化模型。
這個能力此前僅存在於獨立的 Gemini 2.5 computer use 模型。把它整合進 3.5 Flash,意思是:一個模型同時具備函式呼叫(function calling)、Search 和 Maps grounding,以及跨瀏覽器、行動裝置、桌面環境自主操控畫面的能力。Google 點名的應用場景包括持續性軟體測試與跨專業應用的知識工作自動化——這兩類都是企業 IT 實際痛點,不是概念展示。
安全面向是這次發布的另一條主線。現實環境裡的自主代理(agent)最怕 prompt injection——惡意頁面或文件透過注入指令劫持代理的行為。Google 的應對方案分兩層:一是對 3.5 Flash 進行針對性對抗訓練;二是提供兩個可選的企業級防護機制,分別是「敏感或不可逆操作須明確用戶確認」和「偵測到間接 prompt injection 時自動中止任務」。Google 把這套組合稱為「defense-in-depth」,並建議搭配安全沙箱、人工驗核與嚴格存取控制一起用——言下之意,沒有任何一層防護是萬能的,企業部署時仍需自行加固。
真正值得注意的產業意義在於這次整合的方向。把 computer use 從獨立模型拉進主力 Flash 模型,Google 走的是「能力收斂」路線——一個通用快速模型能做的事愈來愈多,開發者不用在模型之間做取捨。這對 Anthropic 是個直接壓力,因為 computer use 正是 Anthropic Claude 主打的差異化能力之一,而 Google 現在是用定位為高 CP 值的 Flash 系列正面迎擊,不是用旗艦模型。對亞太市場的企業 IT 決策者而言,關鍵問題不是「這技術存不存在」,而是「我現在能不能放進 production」。Google 提供的企業級防護機制給出了一個明確訊號:這次是在為正式部署鋪路,不只是讓工程師玩概念。但 computer use 在複雜真實環境的可靠性,始終是業界未解的硬題——Google 自己也沒有宣稱已解決,只是說「best performance yet」。決策者在評估導入時,沙箱隔離和人工驗核仍是不能省的成本。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
