OpenAI揭露GPT-5.6效率工程:模型自己優化自己的推論成本
OpenAI這篇文章談的不是模型能力,是一件更狠的事:GPT-5.6家族裡的旗艦模型Sol,反過來優化了自己被服務的方式。旗艦版Sol在Artificial Analysis的Coding Agent Index上打贏Claude Fable 5,成本卻不到對手一半;中階的Terra智能打平上一代GPT-5.5,價格砍半;最便宜的Luna比Sol便宜八成。這數字本身不算稀奇,今天哪家實驗室不喊性價比。真正的重點在後面——這些便宜,有一部分是模型自己幫自己省出來的。
OpenAI講了三個具體案例。負載平衡上,Sol在Codex裡分析生產流量、抓出人類工程師沒發現的資源分配漏洞,光這一項就大幅壓低服務成本。核心運算層,Sol用OpenAI自家維護的Triton和Gluon語言,自主改寫GPU底層kernel程式碼,把端到端服務成本再砍20%。推測解碼(speculative decoding)這個加速技巧,Sol自己設計、跑了數百組草稿模型架構實驗,還在訓練過程中自主排除硬體故障與訓練不穩定的狀況,結果把token生成效率拉高超過15%。這不是「AI輔助工程師」的老故事,是模型直接下場改自己的推論管線,還順手管了品管——OpenAI為此另外做了一套叫FpSan的驗證工具,專門檢查AI自己寫的kernel有沒有寫錯。
第二個重點在agent harness,也就是Codex和ChatGPT Work跑複雜任務時,一次對話裡可能要呼叫模型三十次、每次都牽動工具呼叫與context處理。這裡的省錢邏輯很直白:少做重複工。系統把上下文設計成「只增不改」,新訊息永遠往後疊、不插進舊內容,這樣prompt caching才抓得住已經算過的部分不用重算;工具輸出預設封頂一萬token,不需要的技能與外掛延後才載入,不讓context窗口無謂膨脹。這些看起來瑣碎的工程決定,累加起來就是每一次呼叫都便宜一點,而一個任務動輒三十次呼叫,便宜一點乘以三十次就是實質的成本結構改變。
這篇文章真正該讀的訊號,不是GPT-5.6比誰便宜,是OpenAI正把「用AI優化AI基礎設施」變成常態流程,而且擺在公開技術部落格裡講,等於告訴市場:未來推論成本的下降曲線,會因為模型自己參與工程優化而變陡。對還在用人力堆棧調參、靠外購晶片撐效能的競爭者來說,這是一種複利效應——模型越強,優化模型基礎設施的能力也越強,兩邊互相餵養,差距只會越拉越大,不會自動收斂。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
