OpenAI自研Jalapeño推理晶片首批跑分出爐,每千瓦算力與回應速度雙勝現役Blackwell
OpenAI在Hot Chips大會公布自研推理晶片Jalapeño首批benchmark:SemiAnalysis InferenceX測試顯示,其每用戶token吞吐量與每千瓦推理效率均超越現役Nvidia Blackwell系統;晶片由OpenAI與Broadcom聯合開發,預計2026年底小批量部署,2027年進入較大規模量產。
自製推理晶片若真能把每千瓦效率壓出來,長期就是把推理毛利還給自己;但對比基準是已被Vera Rubin追上的Blackwell,Jalapeño量產前競爭基準線還會繼續移動,benchmark到落地之間還有兩年硬仗。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這是OpenAI Jalapeño晶片的進度更新。Hot Chips大會上,OpenAI首度公開了具體benchmark數字,讓外界有了第一個可以比較的錨點。
SemiAnalysis的InferenceX基準測試結果顯示,Jalapeño在每用戶token吞吐量與每千瓦推理效率兩項指標上,都超越了目前市售最先進的推理處理器。OpenAI硬體部門負責人Richard Ho在媒體電話會上說,這是「對現有最佳水準的非常、非常顯著的性能躍進」——能在單位電力下跑更多AI工作,同時回應延遲更低。要同時做到高吞吐與低延遲,通常是兩個方向的取捨,這是這份跑分結果值得認真看待的地方。
不過有一個重要的時間差需要注意:這份測試是對比Nvidia Blackwell系統,但Jalapeño預計到2026年底才會「極小批量」部署,2027年才進入較大規模量產。黃仁勳的Vera Rubin平台此刻已在OpenAI、CoreWeave等客戶環境跑起來了,到Jalapeño真正上線,競爭基準線會移動多少,現在還說不準。
Jalapeño去年十月首次曝光,由OpenAI與Broadcom聯合開發,過程中OpenAI自家模型也參與了晶片設計。架構設計上,OpenAI選擇針對推理流程中最容易卡住的兩個環節下刀:prefill(提示詞前置處理)與通訊延遲。做法是讓KV cache可以明確放置在本地,系統根據每個推理階段動態調用對應的運算、記憶體與網路資源,目標是把資料搬移與通訊等待壓到最低。
OpenAI把Jalapeño定位為多世代平台,也就是說,AI產品、模型、晶片、記憶體將整合在同一個技術棧裡共同演進。這個全棧自研的思路,和蘋果當年設計M系列晶片的邏輯如出一轍——軟硬體一起設計,才能針對自己的工作負載做最深層的優化,而不是把通用晶片採購來再想辦法用好。
對OpenAI而言,這條路的商業邏輯很直接:推理是目前最燒錢的成本項,自製晶片如果真能把每千瓦效率壓出來,長期就是把毛利空間還給自己。但自製晶片這條路也是最長的路——從benchmark到大規模量產之間,供應鏈、良率、軟體生態每一關都是硬仗。Jalapeño第一批跑分看起來令人印象深刻,但真正的考驗在2027年。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
