AngelSpec是什麼
AngelSpec 是騰訊混元團隊開源的端到端推測解碼訓練框架,基於 TorchSpec 構建,支持 MTP 自迴歸與 DFly 塊並行共 6 種草稿架構。推理與訓練解耦,推理引擎經 Mooncake/RDMA 向訓練工作器流式傳輸隱藏狀態。在 Hy3-A21B 上,DFly 實現 1.98–2.40 倍端到端加速,吞吐較 DFlash 提升 10.5–11.8%。

AngelSpec的主要功能
- 六種草稿架構統一訓練:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共享一條訓練流水線,切換僅需改配置。
- MTP 訓練與 TTT 展開:支持多深度自迴歸展開訓練,內存接近單次因果前向,通過 Ulysses 序列並行支持最長 128k 上下文。
- 接受率對齊目標函數:支持 CE、top-k KL、LK Loss、D-PACE 加權及端到端 TV 損失,可通過配置自由組合。
- 文檔感知序列打包:Megatron 風格固定長度打包,嚴格跨文檔隔離,同時覆蓋 DFlash 與 MTP 路徑。
- 在線真實評估:訓練期間通過 vLLM 等引擎執行真實推測解碼,實時報告平均接受長度與逐位接受率。
- 多推理後端支持:兼容 vLLM、SGLang、HuggingFace 等主流推理引擎。
AngelSpec的技術原理
- 推測解碼基礎:AngelSpec 建立在推測解碼機制之上:一個輕量草稿模型並行提出多個未來 token,目標大模型通過一次前向傳播使用拒絕採樣完成批量驗證,在不改變目標分佈的前提下將單步解碼擴展爲多步推進。其核心挑戰在於草稿接受率與驗證開銷之間的權衡,而 AngelSpec 從訓練、架構與推理三個層面系統性解決這一問題。
- 工作負載異構性建模:AngelSpec 將真實世界的工作負載異構性作爲首要設計考量。在線請求橫跨開放式對話、代碼生成、數學推理與工具調用,其條件熵與延續結構差異顯著:高熵對話場景下接受率隨深度快速衰減,適合短序列自迴歸草稿;代碼與數學場景存在長可預測跨度,適合塊並行擴散草稿。因此 AngelSpec 訓練互補的專用草稿器——MTP 面向對話數據,DFly 面向代碼與數學數據——而非追求單一通用模型。
- 共享參數多深度 MTP 訓練:MTP 草稿器採用共享參數的多深度訓練方案。所有邏輯預測深度複用同一物理 MTP 模塊,在訓練時自迴歸展開:深度 k+1 接收深度 k 的 argmax 預測,同時維護逐層增長的草稿 KV 緩存與對角線注意力掩碼。Training-Time Test(TTT)機制使草稿器暴露於推理時遇到的自生成軌跡分佈,消除教師強制帶來的暴露偏差,顯著改善第二、第三草稿位的接受率。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用AngelSpec
- 環境安裝:執行
pip install -e ".[vllm]"與pip install mooncake-transfer-engine安裝框架及 vLLM 後端。 - 單節點快速啓動:8 張 GPU 劃分 4 張推理 + 4 張訓練,運行
./examples/qwen3-8b-dfly/run.sh即可啓動完整流水線。 - 配置覆蓋:通過 CLI 直接覆蓋 YAML 配置項,如
training.learning_rate=5e-5 training.num_train_steps=500。 - Conda 環境搭建:運行
./tools/build_conda.sh 1 vllm一鍵構建含 mooncake 的隔離環境,激活後即可使用。 - 多節點部署:通過 Inference Controller 與 Training Controller 經 Ray 調度,結合 Mooncake 隱藏狀態存儲實現跨節點解耦訓練。
AngelSpec的核心優勢
- 工作負載專業化:MTP 針對高熵對話場景優化,DFly 針對代碼與數學等長可預測跨度場景強化,避免單一草稿模型在所有領域表現平庸。
- DFly 架構創新:混合目標條件主幹結合逐層目標視圖,配合前驅條件自迴歸頭,在保留並行生成能力的同時提升塊內依賴建模。
- D-Cut 動態驗證:將目標驗證視爲共享批次級資源,根據前綴置信度與運行時成本模型自適應調整驗證深度,在高併發下持續轉化額外負載爲吞吐。
- 分離式獨立擴展:推理與訓練 GPU 池通過 Mooncake 存儲解耦,雙方可按各自負載獨立擴縮容,避免統一併行策略的次優問題。
- 開源完整套件:同步釋放框架代碼、Hy3-A21B/Qwen3-8B 的 MTP 與 DFly 草稿權重、訓練配置及技術報告,實現開箱即用。
AngelSpec的項目地址
- 項目官網:https://angelspec.readthedocs.io/
- GitHub倉庫:https://github.com/Tencent/AngelSpec
- HuggingFace模型庫:https://huggingface.co/collections/AngelSlim/angelspec
- arXiv技術論文:https://arxiv.org/pdf/2607.25852
AngelSpec的同類競品對比
| 對比維度 | AngelSpec | SpecForge |
|---|---|---|
| 出品方 | 騰訊混元團隊 | SGLang / 美團等社區團隊 |
| 核心定位 | 統一 MTP + 塊並行推測解碼訓練框架 | 面向 EAGLE-3 的生產級訓練框架 |
| 草稿架構 | 6 種(DFly、DFlash、DFlare、Eagle3、DSpark、MTP) | 以 EAGLE-3 爲主,支持主流開源模型 |
| 架構特色 | DFly 混合目標條件 + 前驅自迴歸頭 + D-Cut 動態驗證 | 目標-草稿解耦混合併行 + TTT 稀疏樹注意力優化 |
| 分離設計 | 推理/訓練完全解耦,經 Mooncake/RDMA 流傳輸隱藏狀態 | 支持同機共存與跨節點分離,通過 SGLang 後端集成 |
| 訓練優化 | 接受率對齊目標(TV/LK/D-PACE)+ 文檔感知打包 | FlexAttention 稀疏掩碼 + 原地梯度內核,內存降 93.5% |
| 開源模型 | Hy3-A21B、Qwen3-8B 的 MTP/DFly 權重 | SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿) |
| 性能數據 | Hy3-A21B 上 1.98–2.40× 加速,較 DFlash 高 10.5–11.8% | Qwen3-235B 訓練加速 9.99×,推理最高 4.48× 加速 |
| 推理後端 | vLLM、SGLang、HuggingFace | SGLang、HuggingFace、自定義後端 |
AngelSpec的應用場景
-
大模型在線推理加速:爲混元 Hy3、Qwen3 等 MoE/稠密模型部署推測解碼草稿,降低自迴歸解碼延遲。
-
高併發對話服務:利用 D-Cut 動態資源分配,在併發 4–64 範圍內維持最高平均吞吐,適配客服與助手場景。
-
代碼生成與數學推理:通過 DFly 塊並行草稿捕獲長可預測跨度,加速 IDE 補全、解題引擎等結構化輸出任務。
-
長上下文訓練與推理:藉助 Ulysses 序列並行支持 128k 上下文,適配文檔分析、代碼庫檢索等長序列場景。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...