【演講】Waymo技術長Dolgov:demo是1%,剩下的15年才是產品
每隔幾年科技圈就會有人宣布自駕車問題解決了。2010年有人這麼說,2016年有人這麼說,然後大家就等著。Waymo——Google母公司Alphabet旗下的自動駕駛部門,2009年從Google內部研究專案獨立出來——沒有跟著喊,他們繼續開車。今年八月,Waymo技術長Dmitri Dolgov站上Y Combinator Startup School的講台,Y Combinator是全球最具影響力的新創加速器,孵化過Airbnb,Stripe等公司。Dolgov在Waymo待了將近二十年,見過每一個炒作循環從高峰摔下來。他這場演講不是來賣夢的,是來算帳的——告訴你從demo到真產品之間那條路有多長,每一段需要什麼。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
Dolgov列了七堂課,核心論點可以壓成一句話:物理世界的AI和螢幕上的AI是不同物種,你不能用同一套直覺去建它。具體說,這場演講有幾個值得留意的點:第一,demo和產品之間的距離被他用數字算清楚了——18個月vs.15年;第二,自駕車需要的感測器組合,以及為什麼用眼睛就能開車這個論點在超人類安全標準面前站不住腳;第三,Waymo如何把最新的大型語言模型技術織入車用系統,同時要求複雜度不升反降;第四,模擬器本身就是一個和agent同等難度的AI問題;第五,eval——也就是如何定義並量化夠好——才是真正的護城河,不是模型架構。合起來看,這是一份罕見的,由當事人說出口的物理AI建造說明書。
◎demo是1%,剩下的99%才是產品
Waymo在2010年就解決了自駕:一支十幾人的團隊,十八個月,完成十萬英里自主駕駛,十條各百英里的無人工介入路線。那是在深度學習還沒爆發,transformer架構還沒出現之前。然後呢?然後又花了十年才推出商業服務,再花五年才到每週五十萬趟。Dolgov把這個現象用一個工程概念講清楚:可靠度活在九的指數梯子上。從90%到99%是一個量級的工程量,從99%到99.9%又是另一個量級,每往前一步都要做完全不同的事——你不能用同一招打到底。一個demo需要一個九,一個co-pilot助理系統需要幾個九,一個把陌生乘客放進無人車裡的全自主agent,需要的九疊起來會讓你頭皮發麻。每一波AI突破都讓demo變得更容易做,但長尾問題移動的幅度小得多。所以每個炒作週期的劇本都一樣:驚豔的demo,很少真正的產品。先數你的九,再數你的demo觀看數。
◎相機夠用,但達不到超人類——感測器不是備援而是互補
人類用眼睛就能開車這個論點在技術圈一直有市場。Dolgov的回答很直接:如果目標是大致匹配人類表現,相機確實夠用;如果目標是強超人類的安全性,純視覺的安全曲線在某個點就會趨平,而那個點不夠高。Waymo同時使用相機,LiDAR(光達,用雷射光直接測量周圍環境的三維結構)和雷達。相機給高解析度和色彩,但在黑暗和強光下退化;LiDAR在揚塵暴和黑夜中看得清楚;雷達能穿透霧和雨,直接量測速度。他放了三組影片對比:鳳凰城沙塵暴裡站在路邊的行人,黑夜中翻越混凝土護欄的人,完全無燈環境下追牛的孩子——相機幾乎什麼都看不到,LiDAR都看到了。這不是三個感測器互相備援,而是三套物理原理互相補強,融合成一個比任何單一感測器都精確的世界模型。另外他特別提醒:不要把公司賭在今天的硬體價格上,Waymo已經做到第六代硬體套件,每代都在大幅降成本。
◎新技術進生產環境,要求能力提升且複雜度下降
Waymo在2013年用上卷積神經網路做視覺感知,2017年押注transformer架構——他的說法是開車和語言建模沒有本質差別,你在和路上其他動態角色用車身語言對話,序列性和上下文同樣重要。今天他們跑的是Waymo基礎模型,一個多模態的世界-行動-語言模型,整合感測輸入,理解物理和社會語意,輸出行動決策,同時用快思慢想兩條路徑運作——快路徑處理毫秒級的緊急反應,慢路徑處理需要語意推理的複雜情境,例如路邊一輛著火的車,幾何上路徑暢通,但應該繞道。Dolgov說的硬道理是:引進新技術的正確驗收標準不只是性能有沒有提升,還要問系統有沒有變得更簡單。能力上升但碎片化加劇,那不叫成功。
◎模擬器和agent一樣難做——閉迴路才算數
訓練和評估物理AI有兩種模式。開迴路是給定情境問你會怎麼做,閉迴路是讓agent真的採取行動,看到後果,再決定下一步。對安全關鍵的物理agent來說,閉迴路不是可選項。問題是,夠真實的閉迴路模擬器本身就是一個和agent等級相當的AI工程問題。Waymo多年前就在建行為世界模型,現在加上感測真實性——模擬的不只是其他車輛和行人的行為,還要模擬相機和LiDAR實際會看到什麼。他們利用Google DeepMind的Gen3技術,可以生成完全合成的罕見場景:高速公路上停著的車,一架飛機降落在路上,金門大橋上的積雪,路口漫步的恐龍。這讓Waymo能在從未在現實中遭遇的極端情境下訓練和評估系統。
◎eval才是護城河,不是模型架構
Dolgov說的最重的一句話:如果你沒辦法定量定義什麼叫夠好,你建的不是產品,你是在對demo做迭代。模型架構現在擴散很快,新想法幾個月內就會被複製;資料重要,但沒有好的評估指標你連資料的ROI都算不清楚。真正難以複製的是:幾億英里的真實自主駕駛記錄,加上公開發表的安全數據,加上可被外部驗證的評估框架。最新數據是基於超過2.2億英里的全自主里程:在有Waymo運營的區域,Waymo造成嚴重傷害的碰撞事故比人類駕駛少約17倍。以現在的規模換算,Waymo平均每八天預防一起嚴重傷害事故。這個數字,還有支撐這個數字的整套驗證體系,才是真正的競爭壁壘。
Dolgov在演講結尾說,過去十年的AI發生在數位世界,他認為下一個十年會發生在物理世界。這個判斷本身不新鮮,但他有一點說得值得記住:物理AI的最佳時刻看起來像什麼都沒發生——任務完成了,安全,平穩,沒人注意到。數位AI的成功往往靠驚豔感,物理AI的成功靠的是你不在新聞上看到它。這是兩種完全不同的建造哲學,也是兩種完全不同的公司文化。Waymo花了十五年才有資格說自己在做後者。
開場交代場合與主題:這場演講以七堂課結構呈現,聚焦於在物理世界建造和部署AI的技術經驗,而非數位AI。
播放一段影片:Dolgov帶孩子乘坐Waymo,途中兩輛人類駕駛的車突然切入,Waymo平順閃避,孩子們沒有察覺。他用這個例子說明物理AI的最佳時刻是什麼都看起來沒發生。
提出物理AI vs 數位AI的四大鴻溝:錯誤成本(人命vs.token),延遲要求(毫秒級決策),資料鴻溝(沒有物理世界版的網際網路),驗證鴻溝(不能先上線再靠用戶找邊界案例)。
第一課:demo是1%的工作量。Waymo在2010年用十幾人團隊花十八個月完成早期里程碑,之後又花了十年推出服務,五年擴展到每週五十萬趟。明確說明九的指數梯子——每多一個九需要多十倍工程量。
第二課:以感測器選擇為例說明技術路線選擇。展示三組相機vs LiDAR對比影片——沙塵暴,黑夜翻護欄的人,無燈環境追牛的孩子——說明純視覺方案的安全曲線在超人類標準面前過早趨平。
介紹Waymo基礎模型的架構:多模態,世界模型,行動模型,語言對齊四個要素,以及快思慢想雙路徑設計。以路邊著火車輛為例說明慢路徑的語意推理如何改變決策。
第七課:eval和metrics是戰略護城河。提出三AI生態系統(agent,模擬器,critic)加飛輪概念,以及220億英里數據下Waymo嚴重傷害碰撞比人類駕駛少17倍,平均每八天預防一起嚴重傷害的數字。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
