日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

71
累積集數
597
則深度解讀
6
大追蹤分類

NVIDIA Nemotron-Labs 擴散語言模型:以平行生成突破自回歸架構的推理速度瓶頸

2026-05-23 · 來源:Hugging Face Blog

NVIDIA 透過 Hugging Face 正式發布 Nemotron-Labs Diffusion 系列擴散語言模型(Diffusion Language Models,DLM),提供 3B、8B、14B 三種文字模型規模,以及一個 8B 視覺語言模型,全系列含基礎模型與指令微調版本,並同步釋出訓練程式碼。

這個系列最核心的技術突破,在於打破了「自回歸(AR)與擴散生成是兩類不同模型」的框架。Nemotron-Labs Diffusion 同一個模型檢查點支援三種推理模式:標準自回歸模式、擴散模式(以 32-token 為區塊平行去雜訊生成),以及自我推測模式(Self-speculation,用擴散起草、用自回歸驗證)。模式切換只需改一行部署設定,應用層無需修改。

效能數字是這篇發布最值得關注的部分。以每次前向傳遞產生的 token 數(TPF)衡量,擴散模式比純自回歸快 2.6 倍;線性自我推測達到 6 倍,二次型自我推測達 6.4 倍。在 B200 硬體上的實測數字更為具體:自我推測模式在 speedbench 資料集上達到約 865 tok/s,是同硬體自回歸基線的 4 倍。準確度方面,Nemotron-Labs Diffusion 8B 比 Qwen3 8B 平均高出 1.2%。訓練資料規模為預訓練 1.3 兆 token、後續監督微調 450 億 token。

從產業競爭格局來看,這件事的意義不只是「更快的推理」。自回歸架構長期以來的結構性限制,是每個 token 都需要完整的模型前向傳遞,導致 GPU 的大部分時間耗在記憶體讀寫而非計算;小批次或單一查詢(batch size=1)情境下,這個問題更加嚴重,而這恰好是邊緣部署與延遲敏感應用的典型使用場景。擴散架構以平行生成繞開這個瓶頸,且因為可以在生成後修訂 token,對「填空」(fill-in-the-middle)與程式碼補全類任務在架構上也更適合。

更值得注意的是 NVIDIA 選擇的技術路徑:不從頭訓練純擴散模型,而是在已有的自回歸模型上透過繼續預訓練與注意力機制改造加入擴散能力,同時維持 KV-cache 相容性。這個「AR 轉 DLM」的訓練策略大幅降低了產業採用門檻——既有 AR 模型的能力得以保留,開發者也不需要換掉現有工作流程。

對亞太區決策者而言,這次發布有幾個層面值得追蹤。第一,NVIDIA 以商業友善授權開放 3B 至 14B 模型,代表中小型模型的本地部署成本曲線可能進一步往下走。第二,推理速度的硬體效率提升意味著同樣的 GPU 可服務更多請求,對推理服務商的單位成本結構有直接影響。第三,自我推測模式在維持輸出一致性(temperature 0 下與 AR 輸出等效)的同時大幅提速,這對需要可重現結果的金融、法律、醫療等垂直場景是關鍵說服點。

擴散語言模型並非新概念,但過去一直卡在準確度落後自回歸模型、訓練不穩定、與現有工具鏈相容性差等問題。Nemotron-Labs 這次的發布,是這個架構路線第一次以可商用規模、完整工具鏈支援、且準確度不輸主流基準的形式出現在公開市場——這個時間點,比業界普遍預期提前了。

原文出處
原文標題 Towards Speed-of-Light Text Generation with Nemotron-Labs Diffusion Language Models
媒體來源 Hugging Face Blog
發布日期 2026-05-23
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。