NVIDIA 發布 Cosmos 3 開源物理 AI 基礎模型,推動機器人與自駕車訓練週期從月縮短至天
NVIDIA 在 GTC Taipei 上發布 Cosmos 3,這是一個以全開源方式釋出的物理 AI 基礎模型,也是目前市場上第一個原生支援文字、圖像、影片、環境音效與動作指令多模態生成與推理的「omnimodel」。其核心架構採用 mixture-of-transformers 設計,由一個推理 transformer 搭配一個生成 transformer 組成,使模型能在生成影片與動作軌跡之前,先理解物件互動、運動與空間時序關係——這種架構上的分工設計,直接對應物理 AI 長期面臨的核心痛點:在訓練資料有限、模擬環境碎片化的條件下讓機器人或自駕車具備泛化能力。
Cosmos 3 以多個主要基準測試奪得開源模型榜首,涵蓋世界生成精度(Artificial Analysis、Physics-IQ、PAI-Bench、R-Bench)、動作策略(RoboLab、RoboArena)以及視覺理解(VANTAGE-Bench、TAR)七項榜單。NVIDIA 宣稱,這套系統能將物理 AI 的訓練與評估週期從數個月壓縮至數天。模型分三個層級:Cosmos 3 Super 面向對物理精度要求最高的機器人與自駕車後訓練場景,Cosmos 3 Nano 面向需要快速推理的邊緣應用,Cosmos 3 Edge 則尚未正式推出,定位即時邊緣推理。Super 與 Nano 已可透過 Hugging Face 下載或在 build.nvidia.com 試用。
同步宣布的還有 Cosmos Coalition,成員包括 Agile Robots、Black Forest Labs、LTX、Runway、Skild AI 與 Generalist,以共用開源生態的方式共同推進下一代世界模型研究。亞洲企業在採用端已有明確布局:Doosan Robotics、LG Electronics、Samsung Electronics 用於機器人,中國車企理想汽車用於自駕,Samsung 的加入值得關注——這是大型消費電子廠商直接接入物理 AI 基礎設施層的信號,而非停留在應用端整合。
這件事的產業意義不只是另一個開源模型發布。NVIDIA 把 Cosmos 3 定位成整個物理 AI 訓練堆疊的基礎設施層,搭配 DGX Cloud、NIM microservices,以及 Azure、CoreWeave、Baseten 等雲端夥伴的部署管道,形成的是一個從模型預訓練、合成資料生成到邊緣部署的完整閉環。開源策略是刻意的:降低採用門檻、擴大生態綁定,同時讓算力需求回流 NVIDIA 的基礎設施。對亞太地區的機器人新創與自駕車廠商而言,這意味著基礎模型取得成本大幅下降,但真正的競爭門檻將快速移向誰能用這套基礎建立更好的垂直領域資料與微調能力。開源釋出加速的不只是創新,也加速了差異化消失的速度。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
