Nemotron-Labs-Diffusion是什麼
Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式語言模型,在單一架構內統一自迴歸、擴散和自我推測解碼。通過聯合 AR-擴散目標訓練,模型可在不同併發場景下切換模式維持高吞吐量。該系列包含 3B、8B、14B 參數的基礎、指令和視覺語言模型,在準確率和速度上均超越現有開源 AR 和擴散語言模型。

Nemotron-Labs-Diffusion的主要功能
-
三模式解碼切換:支持 AR、擴散、自我推測三種解碼模式,通過改變注意力模式可在單一模型內無縫切換。
-
塊級擴散並行生成:採用塊級擴散公式,將序列分塊後在塊內雙向並行解碼,單次前向生成多個 token。
-
自我推測草稿驗證:擴散並行生成多 token 草稿,AR 在同一模型內驗證,共享 KV 緩存且無需輔助預測頭。
-
視覺語言理解:提供視覺語言模型變體,支持圖像理解與圖文推理,擴展多模態應用邊界。
-
高效推理部署:支持 FP8 低精度格式,結合 SGLang 框架在 GB200 GPU 上實現高吞吐量服務。
Nemotron-Labs-Diffusion的技術原理
- 聯合 AR-擴散目標訓練:模型同時優化自迴歸 next-token 損失和塊級擴散去噪損失,加權組合(α=0.3)平衡兩者。AR 目標爲擴散提供從左到右的語言先驗,防止擴散訓練浪費容量在任意 token 排列上;擴散目標則增強模型的前瞻規劃能力。
- 兩階段訓練策略:第一階段僅用 AR 目標預訓練,建立強大的左到右語言歸納偏置;第二階段開啓聯合訓練,使擴散梯度補充,實現兩種目標的和諧融合。
- 結構化注意力模式:訓練時採用雙流輸入,噪聲流中 token 在塊內雙向注意力、跨塊因果注意力,並關注乾淨流中的已生成前綴;乾淨流則保持嚴格因果掩碼,使 AR 目標與擴散目標可在同一前向-反向傳播中聯合計算。
- 全局損失平均:針對擴散目標中不同樣本噪聲 token 數量變化導致的梯度方差問題,採用全局 token 級損失平均,按批次中所有 token 平等加權,避免少數高權重噪聲樣本 disproportionately 影響批次梯度。
- 最優採樣與 LoRA 增強:擴散模式配合基於採樣軌跡優化的採樣器提升並行度;自我推測模式可附加 LoRA 草稿適配器增強草稿質量,提高接受率和實際設備效率。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Nemotron-Labs-Diffusion
-
安裝依賴:執行
pip install "transformers>=5.0" torch peft等命令,準備 Python 與 GPU 環境。 -
獲取模型:從 HuggingFace 拉取
nvidia/Nemotron-Labs-Diffusion-8B等模型權重及對應分詞器。 -
選擇模式:根據併發水平選擇 AR 模式(高併發)、擴散模式(最大並行)或自我推測模式(低延遲)。
-
運行腳本:使用
chat_ar.py、chat_dlm.py或chat_linear_spec.py等官方腳本進行單輪或多輪對話推理。 -
服務部署:基於 SGLang 框架啓動推理服務,配置 Linear Self-Speculation 與 FP8 精度,接入生產環境。
Nemotron-Labs-Diffusion的核心優勢
- 三模式統一架構:單一模型同時掌握 AR 語言先驗與擴散並行規劃能力,無需維護多套模型與管線。
- 吞吐量顯著提升:8B 模型單次前向解碼 token 數達 Qwen3-8B 的 6 倍,GB200 上 SPEED-Bench 吞吐量提升 4 倍。
- 自我推測優於 MTP:自我推測模式的接受率和實際設備效率均優於多 token 預測(MTP)方法。
- 雙目標和諧訓練:全局損失平均與兩階段策略有效平衡雙目標梯度,避免模式間的容量競爭。
- 場景自適應切換:通過切換注意力模式即可適配雲側高併發與端側低併發場景,無需架構改造。
Nemotron-Labs-Diffusion的項目地址
- HuggingFace模型庫:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion
- arXiv技術論文:https://arxiv.org/pdf/2607.05722
Nemotron-Labs-Diffusion的同類競品對比
-
實時對話助手:低併發場景下用自我推測模式,實現低延遲交互式 AI 對話,提升用戶體驗。
-
雲推理服務:AR 模式適配高併發批量請求,充分用 GPU 計算密度,降低雲端部署成本。
-
代碼與數學推理:擴散模式增強前瞻規劃,適合需要多步邏輯推導的編程輔助和數學求解任務。
-
端側本地推理:8B 模型可在個人設備運行,三模式切換適配不同負載,保障數據隱私。
-
視覺語言應用:視覺語言模型變體支持圖像理解與圖文問答,適用於智能文檔分析與多模態交互。
Nemotron-Labs-Diffusion的應用場景
-
實時對話助手:低併發場景下使用自我推測模式,實現低延遲交互式 AI 對話,提升用戶體驗。
-
雲推理服務:AR 模式適配高併發批量請求,充分利用 GPU 計算密度,降低雲端部署成本。
-
代碼與數學推理:擴散模式增強前瞻規劃,適合需要多步邏輯推導的編程輔助和數學求解任務。
-
端側本地推理:8B 模型可在個人設備運行,三模式切換適配不同負載,保障數據隱私。
-
視覺語言應用:視覺語言模型變體支持圖像理解與圖文問答,適用於智能文檔分析與多模態交互。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...