日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

77
累積集數
633
則深度解讀
6
大追蹤分類

Google聲稱AI Agent以916美元建構作業系統,學術研究者指出方法論存在重大缺漏

2026-05-22 · 來源:AI Snake Oil

Google在近期開發者大會上展示了一項引人注目的成果:以Gemini 3.5 Flash為核心的多代理系統,聲稱透過「單一提示詞」、由數十個子代理協作,花費約916美元完成了一套作業系統的開發。這個數字隨即在AI圈廣泛流傳。然而,來自普林斯頓、史丹佛等機構的五位研究者隨即在AI Snake Oil發表質疑,指出這項成果在方法論上有多處關鍵不透明之處。

質疑的核心並非否定成果本身,而是Google的描述方式系統性地模糊了「實際做了什麼」。第一,「單一提示詞」這個說法具有誤導性——Google自己的部落格文章中途承認,那個提示詞「最終長達數千行」。生成這份提示詞花了多少輪嘗試、指示有多具體,均未披露。第二,整個任務跑在一套客製化的scaffold架構上,設有專責角色分工、子代理委派機制,以及一個專門偵測與防止代理作弊的模組。這套scaffold是通用的,還是針對「從零建構作業系統」這項任務過度調整過的,Google沒有說明。第三,最終執行過程中是否有任何代理向人工求援、是否需要手動重啟或批准、成功前跑了幾次,這些都沒有清楚界定。

更值得注意的是一個根本性的疑慮:代理寫的程式碼究竟是原創,還是從訓練資料中拼湊既有的公開實作?Google自己也在文章中承認,玩具型作業系統是大學課程的常見作業,公開實作俯拾皆是。但它沒有做任何相似度分析或日誌比對來回應這個疑慮。研究者指出,即便沒有直接複製,代理之所以能完成這類任務,很可能是因為訓練資料中存在大量相關模式,這並不能說明代理有能力創造真正新穎的軟體。

Google公布了一個值得肯定的具體數字——916.92美元與26億tokens的用量——這在AI能力展示中已屬少見的透明。但整份部落格文章本質上是行銷素材,而非可被驗證的技術報告。Google沒有釋出那份長達數千行的提示詞、代理產出的程式碼,也沒有釋出執行日誌。

這件事對決策者的意義不在於「AI能不能用916美元建作業系統」,而在於一個更結構性的問題:AI廠商自行展示的能力成果,在方法論上存在難以消除的可信度缺口。研究者在文中提出「開放世界評測」(open-world evaluation)這個新範式——傳統基準測試已無法評估這類長時程真實任務,但廠商自辦的展示又缺乏獨立性。他們認為,學術界、非營利機構與政府的獨立評測機構必須填補這個空白。對於正在評估是否將AI Agent導入複雜工程流程的企業來說,在獨立驗證機制成熟之前,廠商的示範影片不應作為能力判斷的主要依據。

原文出處
原文標題 Did Google’s AI agents really build an operating system for $916?
媒體來源 AI Snake Oil
發布日期 2026-05-22
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。