【演講】Physical Intelligence的Finn:機器人的GPT時刻來了,但硬體才是分發瓶頸
機器人能不能真的取代人做事,這個問題吵了二十年。差別是,過去說「快了」的人拿的是PPT,現在拿的是運轉13小時不停的咖啡機器人。Chelsea Finn是史丹佛電腦科學教授,專攻機器學習,2024年創辦Physical Intelligence——一家專門讓機器人學會在真實環境執行任務的公司。她在Y Combinator Startup School的這場演講,不是在賣夢想,是在交代技術帳:機器人現在做得到什麼,為什麼還不夠,下一步要補哪幾個洞。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場演講有四個值得說的點。第一,可靠度才是機器人落地的真正門檻,炫技影片解決不了這個問題。第二,強化學習用在機器人上有致命的效率問題,Finn的團隊找到了兩個具體的解法。第三,記憶體是被忽視的關鍵缺口,沒有記憶的機器人只能做重複性短任務。第四,Physical Intelligence現在有一個單一通用模型,在多項任務上的表現已經追上甚至超越針對單一任務微調的專用模型。合起來看:機器人的GPT時刻不是沒有,但分發管道是硬體,速度會慢得多。
◎可靠度而非能力,才是機器人落地的真正關卡
Finn在演講一開始就把問題切乾淨:AI推薦系統和物理機器人有一個根本差異。推薦系統猜錯了,人可以忽略;機器人做錯了,杯子打翻了,食材毀了,手術出問題了。這代表機器人必須在完全自主運作的狀態下維持極高的成功率,而不是靠人在旁邊接錯。她用製作濃縮咖啡當基準:目標是90%以上的成功率,而且必須連續跑13小時不需要人介入。這個標準比大多數人想像的嚴苛得多,而這正是為什麼炫技影片和真實部署之間還有一條很深的溝。
◎強化學習搬進機器人,算法要改,不是算力加倍就能解
強化學習是讓AI從嘗試錯誤中自我改進的訓練方式,在語言模型上已經被大規模驗證有效。問題是,語言模型的每一次嘗試只是跑算力,機器人的每一次嘗試是在真實世界動硬體。Finn算了一筆帳:一個一分鐘的任務跑一百萬次,相當於700個機器人日。這個成本在現實中根本跑不起來。她的團隊提出兩個解法。第一,當機器人走進死路,立刻讓人介入示範如何脫困,不讓無效嘗試繼續消耗時間。第二,訓練一個通用的價值函數——讓模型學會判斷什麼是進展,什麼是退步——這樣就不需要對每個任務反覆大量取樣。結果是:光靠強化學習後訓練階段,箱子組裝任務的產出效率提升了兩倍。
◎沒有記憶的機器人,只能做一件事
現在幾乎所有頂尖的機器人基礎模型都沒有記憶體,只看當下的攝影機畫面決定下一個動作。做重複性短任務夠用,但只要任務超過幾分鐘,步驟超過幾個,就會失敗。原因是技術成本:10秒的影片在50Hz控制頻率下要餵進50萬個token,實時運算根本負擔不起。Finn的解法是分層記憶:短期保留10秒的壓縮影像記憶,長期則把過去10到15分鐘發生的事轉成文字摘要再輸入模型。加上這套機制之後,機器人可以完全自主地連續執行一個15分鐘的廚房清潔任務,包括擦檯面,收碗盤,洗髒碗,不重複,不靠人提示。
◎單一通用模型已經追上專用模型,但ChatGPT時刻會慢很多
Physical Intelligence最新的PIO7模型是一個單一模型,訓練資料混合了機器人示範,自主嘗試影片,人類操作影片和網路資料。Finn拿它和針對單一任務用強化學習精調的專用模型做比較,結果PIO7在咖啡製作和紙箱組裝兩項任務上的成功率和產出效率持平或更好。更有意思的是組合泛化:PIO7能操作訓練資料裡幾乎沒出現過的氣炸鍋,也能在從未見過折衣服資料的全新機器人平台上完成折衣任務。這個結果的意思是:機器人領域正在從BERT時代進入GPT時代——從需要針對每個任務微調,到一個模型開箱即用。但Finn也直接說,機器人的ChatGPT時刻不會像語言模型那樣五天一百萬用戶,因為分發管道是實體硬體,速度受物理世界限制。
看完這場演講,有一件事值得總經理記住:機器人的技術瓶頸已經從能不能做到,移動到能不能穩定做。這個位移很重要,因為它意味著接下來幾年真正有價值的不是又一個酷炫的機器人影片,而是能在你的工廠或倉庫連跑八小時不出錯的系統。Ultra和Weave這兩家YC公司已經在用Physical Intelligence的模型做倉庫包裝和洗衣服務。這條路在走,速度比語言模型慢,但方向清楚。
說明物理AI與過去所有AI應用的根本差異:過去的AI系統出錯由人來接,機器人出錯直接影響物理世界,因此需要更高的自主可靠度
以製作濃縮咖啡為具體範例,說明為何90%以上的成功率是真實部署的最低門檻,並介紹從資料收集到模型迭代的訓練流程
解釋為何語言模型的強化學習算法無法直接套用到機器人,並提出兩個解法:人工介入終止死路軌跡,訓練通用價值函數取代大量重複取樣
說明為何現有機器人模型沒有記憶體,技術成本有多高,以及分層記憶(短期影像+長期文字摘要)如何讓機器人完成15分鐘的連續廚房清潔任務
展示PIO7單一通用模型的訓練方式與實驗結果,包括與專用微調模型的性能比較,以及組合泛化測試(氣炸鍋操作,新機器人平台折衣)
回答ChatGPT時刻問題:能力面已接近,但分發管道是實體硬體,不會出現五天一百萬用戶的爆發,並提到Waymo的實體部署速度作為參照
分享PIO7訓練過程中最意外的發現:機器人在從未見過的情況下自發將右手行為轉移到左手,展現出訓練資料之外的湧現能力
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
