Qwen3.8-27B-DFlash2是什麼
Qwen3.8-27B-DFlash2 是 Inco AI 開源的投機解碼草稿模型,專爲 Qwen3.8-27B 設計。模型僅 1.92B 參數,通過塊級並行預測、輕量路徑選擇器和雙抽頭動態卷積,在單次前向傳播中並行生成整塊 token 草稿。模型在 H200 單卡、SGLang 單併發下,吞吐達到自迴歸解碼的 2.7–3.4 倍,平均接受長度 4.80,優於原生 MTP 與社區 DSpark,且解碼結果無損。

Qwen3.8-27B-DFlash2的主要功能
- 並行草稿生成:作爲 Qwen3.8-27B 的投機解碼草稿模型,單次前向傳播即可並行預測整塊 token,取代傳統逐 token 自迴歸草稿生成。
- 智能路徑選擇:通過輕量路徑選擇器在每個位置的 top-16 候選中追蹤出一條連貫路徑,解決並行預測帶來的 token 銜接不自然問題。
- 局部依賴建模:用雙抽頭動態卷積專門建模塊內相鄰位置的局部依賴,顯著緩解塊尾位置的”後綴衰減”現象。
- 無損推理加速:在 SGLang、vLLM、llama.cpp 等主流引擎上實現單併發 2.7–3.4 倍於自迴歸解碼的吞吐,且嚴格保證解碼輸出無損。
Qwen3.8-27B-DFlash2的技術原理
-
塊級並行草稿生成:傳統投機解碼的草稿模型仍需自迴歸逐 token 生成,DFlash 將草稿過程也改爲非自迴歸,通過一次前向傳播並行預測整塊內所有位置的 token。
-
輕量路徑選擇器:由於各位置獨立預測的 top-1 候選未必彼此連貫,選擇器保留每位置的 top-16 候選,對所有相鄰候選對並行打分(基於低秩雙線性注意力與上下文門控),通過貪心或採樣從最後一個已驗證 token 出發追蹤最佳後繼路徑,僅增加 2M 參數即可將接受長度提升約 0.4 個 token。
-
雙抽頭動態卷積:觀察到深層注意力對塊內依賴的投入持續衰減,團隊在 Attention 與 MLP 子層前後插入內容自適應的雙抽頭動態深度卷積,每個位置混合自身表示與前驅表示,用極低成本(+3% 參數、+0.7% 延遲)承擔塊內局部建模,使注意力迴歸上下文讀取,效果接近增加十層 Transformer。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Qwen3.8-27B-DFlash2
- 模型準備:通過 ModelScope 分別下載 Qwen3.8-27B 目標模型與 Qwen3.8-27B-DFlash2 草稿模型到本地。
- SGLang 部署:安裝 sglang 後執行
sglang.launch_server,指定--speculative-algorithm DFLASH及草稿模型路徑即可啓動加速服務。 - vLLM 部署:安裝對應版本 vLLM 後使用
vllm serve,在--speculative-config中將 method 設爲dflash並填入草稿模型名。 - llama.cpp 部署:拉取並編譯支持 DFlash 的 PR 分支,分別加載目標模型與草稿模型的 GGUF 文件,以
--spec-type draft-dflash啓動服務端。 - Apple Silicon:使用 oMLX 預編譯包,在 Model Manager 中爲目標模型開啓 DFlash、指定草稿模型並將 Verify mode 設爲 dflash。
- 命令行工具:安裝
dflash包後,可直接通過dflash generate命令搭配 transformers、MLX 或 OpenAI 兼容後端運行推理與評測。
Qwen3.8-27B-DFlash2的核心優勢
- 極小體積:僅 1.92B 參數(約 3.85GB)的草稿模型,即可爲 27B 目標模型提供顯著加速,部署成本極低。
- 並行草稿:突破傳統自迴歸草稿限制,單次前向傳播並行生成整塊 token,大幅降低草稿階段延遲。
- 無損加速:在單卡 H200 上實現單併發 2.7–3.4 倍於自迴歸解碼的吞吐,且通過嚴格驗證保證輸出結果完全無損。
- 精準選擇:輕量路徑選擇器以僅 2M 參數、0.6% 延遲開銷,從 top-16 候選中追蹤連貫路徑,顯著提升草稿接受率。
- 局部建模:雙抽頭動態卷積以 3% 參數量專門建模塊內依賴,有效緩解深層位置的”後綴衰減”,效果媲美增加十層 Transformer。
- 生態兼容:已原生集成 SGLang、vLLM、llama.cpp、oMLX 等主流推理引擎,支持 NVIDIA 與 Apple Silicon 多平台部署。
Qwen3.8-27B-DFlash2的項目地址
- 項目官網:https://inco.ai/blog/dflash2/
- GitHub倉庫:https://github.com/z-lab/dflash
Qwen3.8-27B-DFlash2的同類競品對比
| 對比維度 | Qwen3.8-27B-DFlash2 | DSpark(社區草稿模型) |
|---|---|---|
| 平均接受長度 | 4.80 | 3.62 |
| GSM8K | 5.46 | 4.36 |
| MATH-500 | 5.28 | 3.92 |
| HumanEval | 4.39 | 3.30 |
| MBPP | 4.79 | 3.51 |
| MT-Bench | 4.10 | 3.01 |
| 草稿生成方式 | 一次前向、整塊並行預測 | 自迴歸、逐 token 生成 |
| 連貫性修正機制 | 輕量路徑選擇器(top-16 候選選路) | 串行 head 重寫全詞表分佈 |
| 額外參數開銷 | +2.0M(選擇器)/ +16.5M(卷積) | +77.8M |
| 週期延遲開銷 | +1.3% | +9.6% |
| 單併發吞吐 | 自迴歸解碼的 2.7–3.4× | 低於 DFlash 2(接受長度差距顯著) |
| 輸出一致性 | 嚴格無損 | 嚴格無損 |
Qwen3.8-27B-DFlash2的應用場景
-
AI Agent 服務:大幅降低 Agent 長時運行中的逐 token 解碼成本,支撐工具調用、任務規劃等高吞吐執行流程。
-
實時對話系統:單併發 2.7–3.4 倍加速顯著降低響應延遲,提升聊天機器人與客服助手的交互體驗。
-
代碼生成助手:在 HumanEval、MBPP 基準上接受長度領先,適合 IDE 插件與編程 Copilot 等需要快速補全的場景。
-
長文本創作:高接受長度使每次驗證產出更多 token,加速文章、報告、營銷文案等長文檔生成。
-
端側本地部署:1.92B 小體積配合 oMLX 與 llama.cpp 支持,可在 Apple Silicon 筆記本等設備上實現高效本地推理。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...