Nemotron-Labs-Diffusion – 英偉達開源的三模式語言模型

AI工具3周前發佈新公告 AI管理員
0 0

Nemotron-Labs-Diffusion是什麼

Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式語言模型,在單一架構內統一自迴歸、擴散和自我推測解碼。通過聯合 AR-擴散目標訓練,模型可在不同併發場景下切換模式維持高吞吐量。該系列包含 3B、8B、14B 參數的基礎、指令和視覺語言模型,在準確率和速度上均超越現有開源 AR 和擴散語言模型。

Nemotron-Labs-Diffusion – 英偉達開源的三模式語言模型

Nemotron-Labs-Diffusion的主要功能

  • 三模式解碼切換:支持 AR、擴散、自我推測三種解碼模式,通過改變注意力模式可在單一模型內無縫切換。
  • 塊級擴散並行生成:採用塊級擴散公式,將序列分塊後在塊內雙向並行解碼,單次前向生成多個 token。
  • 自我推測草稿驗證:擴散並行生成多 token 草稿,AR 在同一模型內驗證,共享 KV 緩存且無需輔助預測頭。
  • 視覺語言理解:提供視覺語言模型變體,支持圖像理解與圖文推理,擴展多模態應用邊界。
  • 高效推理部署:支持 FP8 低精度格式,結合 SGLang 框架在 GB200 GPU 上實現高吞吐量服務。

Nemotron-Labs-Diffusion的技術原理

  • 聯合 AR-擴散目標訓練:模型同時優化自迴歸 next-token 損失和塊級擴散去噪損失,加權組合(α=0.3)平衡兩者。AR 目標爲擴散提供從左到右的語言先驗,防止擴散訓練浪費容量在任意 token 排列上;擴散目標則增強模型的前瞻規劃能力。
  • 兩階段訓練策略:第一階段僅用 AR 目標預訓練,建立強大的左到右語言歸納偏置;第二階段開啓聯合訓練,使擴散梯度補充,實現兩種目標的和諧融合。
  • 結構化注意力模式:訓練時採用雙流輸入,噪聲流中 token 在塊內雙向注意力、跨塊因果注意力,並關注乾淨流中的已生成前綴;乾淨流則保持嚴格因果掩碼,使 AR 目標與擴散目標可在同一前向-反向傳播中聯合計算。
  • 全局損失平均:針對擴散目標中不同樣本噪聲 token 數量變化導致的梯度方差問題,採用全局 token 級損失平均,按批次中所有 token 平等加權,避免少數高權重噪聲樣本 disproportionately 影響批次梯度。
  • 最優採樣與 LoRA 增強:擴散模式配合基於採樣軌跡優化的採樣器提升並行度;自我推測模式可附加 LoRA 草稿適配器增強草稿質量,提高接受率和實際設備效率。

Nemotron-Labs-Diffusion – 英偉達開源的三模式語言模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Nemotron-Labs-Diffusion

  • 安裝依賴:執行 pip install "transformers>=5.0" torch peft 等命令,準備 Python 與 GPU 環境。
  • 獲取模型:從 HuggingFace 拉取 nvidia/Nemotron-Labs-Diffusion-8B 等模型權重及對應分詞器。
  • 選擇模式:根據併發水平選擇 AR 模式(高併發)、擴散模式(最大並行)或自我推測模式(低延遲)。
  • 運行腳本:使用 chat_ar.pychat_dlm.pychat_linear_spec.py 等官方腳本進行單輪或多輪對話推理。
  • 服務部署:基於 SGLang 框架啓動推理服務,配置 Linear Self-Speculation 與 FP8 精度,接入生產環境。

Nemotron-Labs-Diffusion的核心優勢

  • 三模式統一架構:單一模型同時掌握 AR 語言先驗與擴散並行規劃能力,無需維護多套模型與管線。
  • 吞吐量顯著提升:8B 模型單次前向解碼 token 數達 Qwen3-8B 的 6 倍,GB200 上 SPEED-Bench 吞吐量提升 4 倍。
  • 自我推測優於 MTP:自我推測模式的接受率和實際設備效率均優於多 token 預測(MTP)方法。
  • 雙目標和諧訓練:全局損失平均與兩階段策略有效平衡雙目標梯度,避免模式間的容量競爭。
  • 場景自適應切換:通過切換注意力模式即可適配雲側高併發與端側低併發場景,無需架構改造。

Nemotron-Labs-Diffusion的項目地址

  • HuggingFace模型庫:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion
  • arXiv技術論文:https://arxiv.org/pdf/2607.05722

Nemotron-Labs-Diffusion的同類競品對比

  • 實時對話助手:低併發場景下用自我推測模式,實現低延遲交互式 AI 對話,提升用戶體驗。
  • 雲推理服務:AR 模式適配高併發批量請求,充分用 GPU 計算密度,降低雲端部署成本。
  • 代碼與數學推理:擴散模式增強前瞻規劃,適合需要多步邏輯推導的編程輔助和數學求解任務。
  • 端側本地推理:8B 模型可在個人設備運行,三模式切換適配不同負載,保障數據隱私。
  • 視覺語言應用:視覺語言模型變體支持圖像理解與圖文問答,適用於智能文檔分析與多模態交互。

Nemotron-Labs-Diffusion的應用場景

  • 實時對話助手:低併發場景下使用自我推測模式,實現低延遲交互式 AI 對話,提升用戶體驗。
  • 雲推理服務:AR 模式適配高併發批量請求,充分利用 GPU 計算密度,降低雲端部署成本。
  • 代碼與數學推理:擴散模式增強前瞻規劃,適合需要多步邏輯推導的編程輔助和數學求解任務。
  • 端側本地推理:8B 模型可在個人設備運行,三模式切換適配不同負載,保障數據隱私。
  • 視覺語言應用:視覺語言模型變體支持圖像理解與圖文問答,適用於智能文檔分析與多模態交互。
© 版權聲明

相關文章

暫無評論

暫無評論...