【專訪】Runway Germanidis:影片模型不只生成畫面,它在模擬整個世界
影片生成這件事,過去幾年大家的注意力都放在生成品質夠不夠好看。但 Runway 聯合創辦人 Anastasis Germanidis——這家以紐約為根據地,把影片生成工具帶進好萊塢製作流程的 AI 公司背後的研究主腦——最近接受 Latent Space Podcast 訪問時,把問題往前推了一步:當影片生成模型夠強,能即時跑起來,它模擬的就不只是好看的畫面,而是整個物理世界。從那裡出發,應用場景就完全不同了。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得留意的點有四個,合起來說的其實是同一件事:影片生成模型正在從創作工具變成世界模擬器,而這個轉變比多數人意識到的走得更遠。第一,Runway 在 2023 年底就把研究重心押在 world model,比市場跟風早了將近兩年。第二,他們用影片預訓練模型切入機器人領域,只需要幾百小時的機器人資料就能有效運作,比業界主流做法少了好幾個數量級。第三,他們展示了一個把軟體介面直接用影片模型渲染出來的原型,繞過 HTML,CSS,React,像素直出。第四,Germanidis 直接點出:影片排行榜前十到二十名,大多數是中國模型,西方陣營明顯落後。
◎押注 world model 不是跟風,是 2023 年底就下的賭注
2024 年初 OpenAI 的 Sora 發布,影片生成圈才開始大規模討論world model這個方向。但 Germanidis 說得很清楚:Runway 在 2023 年底就成立了專門的研究小組。他的邏輯很直接——要把影片預測做好,模型就必須學會模擬物理,模擬人的動作與互動;既然語言模型可以靠規模擴張一路從胡言亂語進化到能寫程式,影片模型沒有理由不走同一條路。Sora 出來的時候,外界一度唱衰 Runway 已經被超越,追不上了。他們的回應是在三個月內把模型規模擴大十倍,從頭學會分散式訓練,推出 Gen 3。這不是公關說法,是他在訪談裡直接說那段時間是很多人在 Runway 最喜歡的時光——因為真的快要死了又活過來。
◎機器人不需要海量專屬資料,影片預訓練就夠了

機器人訓練最頭痛的問題一直是資料:你需要大量人工操控示範,費時費力,難以規模化。Runway 的做法是先用一般影片資料預訓練模型——街頭,廚房,運動場,各種第三人稱視角的人類活動——再用幾百小時的機器人專屬資料微調。對比業界從頭訓練動輒需要數十萬甚至數百萬小時的資料,差距是三個數量級。他們在 GWM Robotics 上驗證了一件事:在世界模型裡執行動作,和在真實機器手臂上執行同一個動作,結果的相關性夠高。這意味著可以在模擬器裡大量測試機器人政策,不用每次都動用真實硬體。Germanidis 說這個方向叫 world action model——先有好的世界模型,再加上動作預測頭,它就變成了策略模型。
◎軟體介面不需要寫程式碼,直接生成像素
訪談裡最讓人意外的展示是 interface world model:一個把軟體前端直接用影片生成模型渲染出來的原型。沒有 HTML,沒有 CSS,沒有 React,你描述按這個按鈕應該發生什麼,模型就即時生成對應的畫面,支援點擊,拖曳,捲動。Germanidis 拿它和用 Claude 生成程式碼來做同樣互動相比,說 LLM 在捕捉某些動態互動上仍有明顯落差。他的終極想像是神經作業系統——整個介面本身變成可學習的元件,應用程式的概念可能需要重新定義。他也指出這條路的現實障礙:即時跑影片模型的算力成本比渲染 HTML 高得多,現階段還需要先找到夠有說服力的應用場景,再等成本曲線下來。
◎影片模型排行榜,西方正在輸給中國
Germanidis 說了一句很直白的話:現在影片模型排行榜前十到二十名,大多數是中國模型,來自美國或西方陣營的只有少數幾家。圖片模型西方還撐得住,影片這塊已經明顯落後。Runway 和 Nvidia 共同發起了 Cosmos Coalition,目標是把部分世界模型研究開源——開放模型權重,物理評測基準,基礎設施——讓更多研究者能參與。他沒有把這件事說成純粹的地緣政治競爭,但意思很清楚:這個領域如果只靠少數幾家閉源公司在跑,西方陣營會繼續落後。
Runway 的路徑有一個一致的邏輯:先把影片生成做好,規模夠大之後,模型自然就學會了物理,學會了世界運作的方式,然後往機器人,往介面,往科學模擬延伸。這不是事後諸葛的包裝,訪談裡的時間線可以驗證。當然,規模繼續擴就會解決這個信念本身也是一個賭注——Yann LeCun 不這麼認為,Runway 的回答是:目前沒有證據顯示影片預測這條路會飽和。誰對,幾年後就知道了。
講述 Runway 七年發展的主軸:從開源模型工具起家,到建立內部研究團隊,再到現在把模型應用到真實世界場景,描述這是一個繞了一圈回到原點的過程。
說明 2022 年中決定建立千張 A100 叢集的決策背景:當時是 Series B 階段,這個決定在財務上幾乎是非理性的,但他們相信影片模型的 scaling law 會成立。
描述 2024 年 2 月 Sora 發布後的幾小時:外界在 Twitter 上說 Runway 完了,他本人也有幾小時的存亡危機感,隨後帶領團隊在三個月內把模型規模擴大十倍,從頭學習模型並行訓練,推出 Gen 3。
現場展示 interface world model 原型:直接生成軟體介面像素,支援點擊拖曳捲動,可用文字描述互動行為,並說明與用 Claude 生成程式碼相比的差異與潛在應用場景。
說明 GWM1 世界模型在機器人領域的驗證結果:用 Robosuite 基準測試,比較在世界模型內執行動作與在真實機器手臂上執行同一動作的結果相關性,確認模擬器可作為評測工具。
闡述機器人訓練的核心論點:第三人稱影片資料量比遙控操作資料多三個數量級,以影片預訓練為起點,再用少量機器人資料微調,是讓模型能泛化到新環境的關鍵。
說明 Cosmos Coalition 的成立動機:影片模型排行榜前十到二十名大多是中國模型,西方陣營明顯落後,與 Nvidia 共同推動開源世界模型研究是回應方式之一。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

