Qwen3.8-27B-DFlash2 – Inco AI 開源的投機解碼草稿模型

AI工具2天前發佈新公告 AI管理員
0 0

Qwen3.8-27B-DFlash2是什麼

Qwen3.8-27B-DFlash2 是 Inco AI 開源的投機解碼草稿模型,專爲 Qwen3.8-27B 設計。模型僅 1.92B 參數,通過塊級並行預測、輕量路徑選擇器和雙抽頭動態卷積,在單次前向傳播中並行生成整塊 token 草稿。模型在 H200 單卡、SGLang 單併發下,吞吐達到自迴歸解碼的 2.7–3.4 倍,平均接受長度 4.80,優於原生 MTP 與社區 DSpark,且解碼結果無損。

Qwen3.8-27B-DFlash2 – Inco AI 開源的投機解碼草稿模型

Qwen3.8-27B-DFlash2的主要功能

  • 並行草稿生成:作爲 Qwen3.8-27B 的投機解碼草稿模型,單次前向傳播即可並行預測整塊 token,取代傳統逐 token 自迴歸草稿生成。
  • 智能路徑選擇:通過輕量路徑選擇器在每個位置的 top-16 候選中追蹤出一條連貫路徑,解決並行預測帶來的 token 銜接不自然問題。
  • 局部依賴建模:用雙抽頭動態卷積專門建模塊內相鄰位置的局部依賴,顯著緩解塊尾位置的”後綴衰減”現象。
  • 無損推理加速:在 SGLang、vLLM、llama.cpp 等主流引擎上實現單併發 2.7–3.4 倍於自迴歸解碼的吞吐,且嚴格保證解碼輸出無損。

Qwen3.8-27B-DFlash2的技術原理

  • 塊級並行草稿生成:傳統投機解碼的草稿模型仍需自迴歸逐 token 生成,DFlash 將草稿過程也改爲非自迴歸,通過一次前向傳播並行預測整塊內所有位置的 token。
  • 輕量路徑選擇器:由於各位置獨立預測的 top-1 候選未必彼此連貫,選擇器保留每位置的 top-16 候選,對所有相鄰候選對並行打分(基於低秩雙線性注意力與上下文門控),通過貪心或採樣從最後一個已驗證 token 出發追蹤最佳後繼路徑,僅增加 2M 參數即可將接受長度提升約 0.4 個 token。
  • 雙抽頭動態卷積:觀察到深層注意力對塊內依賴的投入持續衰減,團隊在 Attention 與 MLP 子層前後插入內容自適應的雙抽頭動態深度卷積,每個位置混合自身表示與前驅表示,用極低成本(+3% 參數、+0.7% 延遲)承擔塊內局部建模,使注意力迴歸上下文讀取,效果接近增加十層 Transformer。

Qwen3.8-27B-DFlash2 – Inco AI 開源的投機解碼草稿模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Qwen3.8-27B-DFlash2

  • 模型準備:通過 ModelScope 分別下載 Qwen3.8-27B 目標模型與 Qwen3.8-27B-DFlash2 草稿模型到本地。
  • SGLang 部署:安裝 sglang 後執行 sglang.launch_server,指定 --speculative-algorithm DFLASH 及草稿模型路徑即可啓動加速服務。
  • vLLM 部署:安裝對應版本 vLLM 後使用 vllm serve,在 --speculative-config 中將 method 設爲 dflash 並填入草稿模型名。
  • llama.cpp 部署:拉取並編譯支持 DFlash 的 PR 分支,分別加載目標模型與草稿模型的 GGUF 文件,以 --spec-type draft-dflash 啓動服務端。
  • Apple Silicon:使用 oMLX 預編譯包,在 Model Manager 中爲目標模型開啓 DFlash、指定草稿模型並將 Verify mode 設爲 dflash。
  • 命令行工具:安裝 dflash 包後,可直接通過 dflash generate 命令搭配 transformers、MLX 或 OpenAI 兼容後端運行推理與評測。

Qwen3.8-27B-DFlash2的核心優勢

  • 極小體積:僅 1.92B 參數(約 3.85GB)的草稿模型,即可爲 27B 目標模型提供顯著加速,部署成本極低。
  • 並行草稿:突破傳統自迴歸草稿限制,單次前向傳播並行生成整塊 token,大幅降低草稿階段延遲。
  • 無損加速:在單卡 H200 上實現單併發 2.7–3.4 倍於自迴歸解碼的吞吐,且通過嚴格驗證保證輸出結果完全無損。
  • 精準選擇:輕量路徑選擇器以僅 2M 參數、0.6% 延遲開銷,從 top-16 候選中追蹤連貫路徑,顯著提升草稿接受率。
  • 局部建模:雙抽頭動態卷積以 3% 參數量專門建模塊內依賴,有效緩解深層位置的”後綴衰減”,效果媲美增加十層 Transformer。
  • 生態兼容:已原生集成 SGLang、vLLM、llama.cpp、oMLX 等主流推理引擎,支持 NVIDIA 與 Apple Silicon 多平台部署。

Qwen3.8-27B-DFlash2的項目地址

  • 項目官網:https://inco.ai/blog/dflash2/
  • GitHub倉庫:https://github.com/z-lab/dflash

Qwen3.8-27B-DFlash2的同類競品對比

對比維度 Qwen3.8-27B-DFlash2 DSpark(社區草稿模型)
平均接受長度 4.80 3.62
GSM8K 5.46 4.36
MATH-500 5.28 3.92
HumanEval 4.39 3.30
MBPP 4.79 3.51
MT-Bench 4.10 3.01
草稿生成方式 一次前向、整塊並行預測 自迴歸、逐 token 生成
連貫性修正機制 輕量路徑選擇器(top-16 候選選路) 串行 head 重寫全詞表分佈
額外參數開銷 +2.0M(選擇器)/ +16.5M(卷積) +77.8M
週期延遲開銷 +1.3% +9.6%
單併發吞吐 自迴歸解碼的 2.7–3.4× 低於 DFlash 2(接受長度差距顯著)
輸出一致性 嚴格無損 嚴格無損

Qwen3.8-27B-DFlash2的應用場景

  • AI Agent 服務:大幅降低 Agent 長時運行中的逐 token 解碼成本,支撐工具調用、任務規劃等高吞吐執行流程。
  • 實時對話系統:單併發 2.7–3.4 倍加速顯著降低響應延遲,提升聊天機器人與客服助手的交互體驗。
  • 代碼生成助手:在 HumanEval、MBPP 基準上接受長度領先,適合 IDE 插件與編程 Copilot 等需要快速補全的場景。
  • 長文本創作:高接受長度使每次驗證產出更多 token,加速文章、報告、營銷文案等長文檔生成。
  • 端側本地部署:1.92B 小體積配合 oMLX 與 llama.cpp 支持,可在 Apple Silicon 筆記本等設備上實現高效本地推理。
© 版權聲明

相關文章

暫無評論

暫無評論...