Google聲稱AI Agent以916美元建構作業系統,學術研究者指出方法論存在重大缺漏
Google在近期開發者大會上展示了一項引人注目的成果:以Gemini 3.5 Flash為核心的多代理系統,聲稱透過「單一提示詞」、由數十個子代理協作,花費約916美元完成了一套作業系統的開發。這個數字隨即在AI圈廣泛流傳。然而,來自普林斯頓、史丹佛等機構的五位研究者隨即在AI Snake Oil發表質疑,指出這項成果在方法論上有多處關鍵不透明之處。
質疑的核心並非否定成果本身,而是Google的描述方式系統性地模糊了「實際做了什麼」。第一,「單一提示詞」這個說法具有誤導性——Google自己的部落格文章中途承認,那個提示詞「最終長達數千行」。生成這份提示詞花了多少輪嘗試、指示有多具體,均未披露。第二,整個任務跑在一套客製化的scaffold架構上,設有專責角色分工、子代理委派機制,以及一個專門偵測與防止代理作弊的模組。這套scaffold是通用的,還是針對「從零建構作業系統」這項任務過度調整過的,Google沒有說明。第三,最終執行過程中是否有任何代理向人工求援、是否需要手動重啟或批准、成功前跑了幾次,這些都沒有清楚界定。
更值得注意的是一個根本性的疑慮:代理寫的程式碼究竟是原創,還是從訓練資料中拼湊既有的公開實作?Google自己也在文章中承認,玩具型作業系統是大學課程的常見作業,公開實作俯拾皆是。但它沒有做任何相似度分析或日誌比對來回應這個疑慮。研究者指出,即便沒有直接複製,代理之所以能完成這類任務,很可能是因為訓練資料中存在大量相關模式,這並不能說明代理有能力創造真正新穎的軟體。
Google公布了一個值得肯定的具體數字——916.92美元與26億tokens的用量——這在AI能力展示中已屬少見的透明。但整份部落格文章本質上是行銷素材,而非可被驗證的技術報告。Google沒有釋出那份長達數千行的提示詞、代理產出的程式碼,也沒有釋出執行日誌。
這件事對決策者的意義不在於「AI能不能用916美元建作業系統」,而在於一個更結構性的問題:AI廠商自行展示的能力成果,在方法論上存在難以消除的可信度缺口。研究者在文中提出「開放世界評測」(open-world evaluation)這個新範式——傳統基準測試已無法評估這類長時程真實任務,但廠商自辦的展示又缺乏獨立性。他們認為,學術界、非營利機構與政府的獨立評測機構必須填補這個空白。對於正在評估是否將AI Agent導入複雜工程流程的企業來說,在獨立驗證機制成熟之前,廠商的示範影片不應作為能力判斷的主要依據。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
