【專訪】Gopalakrishnan:機器人還在GPT-2,接觸物理才是真正的硬仗
機器人什麼時候才能真正有用?這個問題現在吵得很凶,而且吵的人不只是研究者,連投資人,政策圈都在押注。今年夏天中國辦了一場機器人奧運,人形機器人跑得比人快,影片在網路上瘋傳;與此同時,各家預測報告喊著2027年人形機器人就能派上用場,2028年機器人可以蓋更多機器人工廠。喊得愈大聲,愈需要有人冷靜說清楚現在到底在哪裡。Keerthana Gopalakrishnan是Google DeepMind的首席研究科學家,也是Gemini機器人系列的研究主管——DeepMind是Google旗下的AI研究機構,長年做基礎模型與機器人研究。她在這場訪談裡說的話,比那些預測報告務實很多。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得注意的地方有四個。第一,中國機器人奧運那些跑步影片,技術難度其實被高估了——跑步在機器人研究裡屬於相對容易的問題,真正的硬仗是接觸。第二,Google今年夏天發布的Gemini Robotics 2是一套三層架構的模型,其中負責推理的那層已經開放API,任何開發者都能接入。第三,整個機器人領域現在大約還在GPT-2的水準,離可以廣泛部署還差一個世代。第四,安全不是能力的對立面,而是能力的一部分——她認為這兩件事根本不該對立著講。這四點合起來的意思是:機器人的突破不會突然發生,但方向是對的,只是時間表需要校正。
◎跑得快不等於有用,接觸才是真正的難題
中國機器人奧運的跑步影片讓很多人覺得機器人要來了,但Gopalakrishnan的解讀完全不同。跑步之所以可以練得這麼好,是因為地面是平的,接觸面是剛性的,這種環境很容易在電腦模擬裡複製,模型在模擬裡練完再放到實體機器人上,效果差距不大。但只要涉及接觸——布料,雞蛋,玻璃杯這類會變形的東西——現有的物理模擬就開始失準,模型在模擬裡學到的東西搬到現實就打折扣。她的結論很直接:跑步速度根本不是機器人能不能幫人做事的瓶頸,那只是一個讓大眾看得懂的基準測試。
◎Gemini Robotics 2的三層架構,現在能用的只有一層

Google今年夏天發布的Gemini Robotics 2實際上是三個模型。最上層是Gemini Robotics ER2,負責推理和理解場景,基於Gemini Flash這個語言模型微調而來,現在已經開放API,開發者可以像設定一般AI助理的工具一樣,定義機器人能執行哪些動作。中間層是Gemini Robotics 2本體,負責把上層的指令翻譯成機器人實際的肢體動作,能控制從手指到腳趾的整個人形機器人身體。最底層是On-Device版本,縮小到可以跑在機器人自己的電腦上,不需要連雲端。後兩層目前只開放給合作夥伴測試。推理層回應一個指令要幾秒鐘,Gopalakrishnan的看法是:工廠產線等不了,但你叫機器人去折衣服,你根本不在乎它花多久。速度和能力的取捨,會因應用場景而不同。
◎現在是GPT-2時代,差GPT-3還有兩件事
主持人問她機器人現在相當於語言模型發展的哪個階段,她說還在GPT-2。理由有兩個:第一,少樣本學習——給機器人看一次或幾次示範就能學會新任務——現在對簡單任務有效,對複雜任務還不穩;第二,跨機體泛化的問題還沒解決。語言模型不管跑在什麼硬體上行為都一致,但現在的機器人模型換一個不同的機器人身體,表現就可能大幅下降。她用的比喻很準:如果這個腦只在你的機器人上好用,換一台就失效,那它算什麼通用的腦?這個問題是機器人研究現在最核心的硬仗之一。
◎安全是能力,不是能力的對立面
訪談尾段談到安全,Gopalakrishnan把安全分成幾層:機械層面的安全(機器人倒下來砸到人),感測器失效時的應對(有人把籃子蓋在機器人頭上,它應該停下來請人移除,而不是繼續閉眼做任務),以及更高層的目標對齊問題。她的核心立場是:安全和能力不是互相競爭的,最有用的機器人就是最安全的機器人,沒有人會用一個讓人不放心的東西。這個說法聽起來像官方立場,但她補充的細節說明她確實在認真做這件事,而不只是說說而已。
從這場對話出來,有一件事很清楚:機器人的突破點不會是某個戲劇性的時刻,而是一系列工程問題被一個一個解決。接觸物理,跨機體泛化,推理速度,安全設計——每一個都是獨立的研究課題,沒有一個可以靠喊口號跳過。那些說2027年人形機器人就能大規模有用的預測,現在看起來需要很多事情同時順利才能成真。Gopalakrishnan沒有說不可能,她說的是:這些都是需要用實驗來回答的問題,不是拿來預測的題目。
談中國機器人奧運對公眾想像的影響,以及她父親和印度朋友的反應——說明這場比賽的意義主要在於公眾認知,而非研究突破。
解釋sim-to-real(模擬到現實)的概念:為什麼跑步和平面移動容易在模擬裡訓練,而布料折疊,雞蛋等涉及接觸變形的任務在模擬裡難以準確複製。
說明Gemini Robotics 2三層架構:ER2負責推理(已開放API),Robotics 2負責動作控制,On-Device版本可在機器人本機執行,後兩者目前僅限合作夥伴測試。
回答機器人現在相當於GPT幾的問題,她說仍在GPT-2階段,並指出進入下一階段需要少樣本學習更穩定,以及跨機體泛化能力更強。
談手部硬體進展:從一年多前的夾爪機器人到現在的多指靈巧手,Gemini Robotics 2已能控制多指手做細緻操作,如綁垃圾袋。提到Wuji手和Sharp手的力量差異。
談機器人安全的分層:機械操作安全,感測器失效應對(籃子蓋頭的例子),高層目標對齊,強調安全是能力的一部分而非對立面。
回應Nvidia研究者關於訓練資料來源的觀點,說明遠端操控資料,穿戴式感測器資料,人類第一人稱影片各有精準度與可擴展性的取捨,認為未來會是混合使用而非單一來源。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

