輝達 Groq 3 LPX 全面量產,Vera Rubin 推理平台向代理應用全面擴張
輝達於 Hot Chips 大會宣布 Groq 3 LPX 推理加速器進入全面量產,搭配 Vera Rubin NVL72 平台;Artificial Analysis 測試顯示以 Gemma 4 31B 跑 10 萬 token 上下文,輸出速度達每秒 3,400 token,比最近競品快 4 倍。Nebius 是首家採用的 AI 雲;CoreWeave 已在生產環境部署 Spectrum-X Multiplane;SpaceXAI 宣布採用 Vera CPU 驅動代理 AI,部署範圍涵蓋地面資料中心至軌道衛星。
AI 工作負載從訓練轉向大規模持續推理後,誰能把 token 快速、便宜地吐出來,誰就拿到雲端業者的錢;輝達這套「晶片+網路+軟體」一體的 token factory 策略,正把 CoreWeave、SpaceXAI 這類大客戶深度綁進自家生態,自製晶片陣營若要突圍,代價只會比以前更高。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這是輝達 Vera Rubin 平台一系列動作的最新進展。此次重點不是一塊新晶片,而是一整套「AI 工廠」架構的落地量產宣告。
輝達在 Hot Chips 大會上宣布,Groq 3 LPX 已進入全面量產。這塊推理加速器是與 Vera Rubin NVL72 共同設計的,定位是讓 AI 代理在大量 token 輸出場景下維持低延遲、高吞吐。官方引用的關鍵數據是:在 Artificial Analysis 的測試中,以 Gemma 4 31B 開源代理模型跑 10 萬 token 長上下文工作,Groq 3 LPX 可達到每秒 3,400 個輸出 token,比「最接近的替代平台」快 4 倍。合作落地方面,雲端服務商 Nebius 是首家採用 Groq 3 LPX 的 AI 雲端;CoreWeave 已在生產環境部署 Spectrum-X Multiplane 網路架構;SpaceXAI 則宣布以 Vera CPU 驅動其下一代代理 AI 系統,未來部署範圍從地面資料中心延伸至軌道衛星。
從架構邏輯來看,這套系統的核心設計哲學叫「極端協同設計」(extreme codesign)——Rubin GPU 負責大規模上下文處理,LPX 負責對延遲敏感的 token 解碼工作,Spectrum-X Multiplane 負責在機架間搬移資料。以 Spectrum-X Multiplane 為例,它的做法是把每台伺服器的網路連線拆成多個獨立路徑,讓整個 AI 工廠可以擴展到 51.2 萬顆 GPU,不需要新增第三層網路,據稱比傳統方式提升 1.6 倍 AI 工廠產出。輝達同時推出了 NVLink Fusion,讓超大型雲端業者可以把自製 XPU 接進輝達的 NVLink 生態,不必完全依賴輝達自家 GPU,但仍使用輝達的網路、機架、軟體與供應鏈。這招「垂直整合、水平開放」的設計,等於主動吸納潛在競爭對手的客製晶片,把他們綁進輝達的基礎設施體系。
對企業主來說,這一整套東西說穿了就是一件事:AI 系統從「跑模型」進入「持續推理、多代理協作」的階段後,基礎設施的採購邏輯就變了。過去買算力,現在要買的是一個能把 token 高速、穩定、大量輸出的工廠系統。輝達推的「token factory」概念不只是行銷語言,它在告訴雲端業者與企業:你用 GPU 訓練的模型,最終必須靠一整套協同的推理基礎設施才能轉化成營收,而輝達現在賣的正是這條完整路徑。CoreWeave、Nebius、SpaceXAI 的接連採用,等於是在替這套主張背書。這個產業方向對還在評估要不要大規模部署代理 AI 的企業來說,意味著基礎設施的選擇將比以前更牽動長期的成本結構與廠商依賴程度,值得在供應商策略上提早卡位。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
