AngelSpec – 騰訊混元團隊開源的端到端推測解碼訓練框架

AI工具10小時前發佈新公告 AI管理員
0 0

AngelSpec是什麼

AngelSpec 是騰訊混元團隊開源的端到端推測解碼訓練框架,基於 TorchSpec 構建,支持 MTP 自迴歸與 DFly 塊並行共 6 種草稿架構。推理與訓練解耦,推理引擎經 Mooncake/RDMA 向訓練工作器流式傳輸隱藏狀態。在 Hy3-A21B 上,DFly 實現 1.98–2.40 倍端到端加速,吞吐較 DFlash 提升 10.5–11.8%。

AngelSpec – 騰訊混元團隊開源的端到端推測解碼訓練框架

AngelSpec的主要功能

  • 六種草稿架構統一訓練:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共享一條訓練流水線,切換僅需改配置。
  • MTP 訓練與 TTT 展開:支持多深度自迴歸展開訓練,內存接近單次因果前向,通過 Ulysses 序列並行支持最長 128k 上下文。
  • 接受率對齊目標函數:支持 CE、top-k KL、LK Loss、D-PACE 加權及端到端 TV 損失,可通過配置自由組合。
  • 文檔感知序列打包:Megatron 風格固定長度打包,嚴格跨文檔隔離,同時覆蓋 DFlash 與 MTP 路徑。
  • 在線真實評估:訓練期間通過 vLLM 等引擎執行真實推測解碼,實時報告平均接受長度與逐位接受率。
  • 多推理後端支持:兼容 vLLM、SGLang、HuggingFace 等主流推理引擎。

AngelSpec的技術原理

  • 推測解碼基礎:AngelSpec 建立在推測解碼機制之上:一個輕量草稿模型並行提出多個未來 token,目標大模型通過一次前向傳播使用拒絕採樣完成批量驗證,在不改變目標分佈的前提下將單步解碼擴展爲多步推進。其核心挑戰在於草稿接受率與驗證開銷之間的權衡,而 AngelSpec 從訓練、架構與推理三個層面系統性解決這一問題。
  • 工作負載異構性建模:AngelSpec 將真實世界的工作負載異構性作爲首要設計考量。在線請求橫跨開放式對話、代碼生成、數學推理與工具調用,其條件熵與延續結構差異顯著:高熵對話場景下接受率隨深度快速衰減,適合短序列自迴歸草稿;代碼與數學場景存在長可預測跨度,適合塊並行擴散草稿。因此 AngelSpec 訓練互補的專用草稿器——MTP 面向對話數據,DFly 面向代碼與數學數據——而非追求單一通用模型。
  • 共享參數多深度 MTP 訓練:MTP 草稿器採用共享參數的多深度訓練方案。所有邏輯預測深度複用同一物理 MTP 模塊,在訓練時自迴歸展開:深度 k+1 接收深度 k 的 argmax 預測,同時維護逐層增長的草稿 KV 緩存與對角線注意力掩碼。Training-Time Test(TTT)機制使草稿器暴露於推理時遇到的自生成軌跡分佈,消除教師強制帶來的暴露偏差,顯著改善第二、第三草稿位的接受率。

AngelSpec – 騰訊混元團隊開源的端到端推測解碼訓練框架

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用AngelSpec

  • 環境安裝:執行 pip install -e ".[vllm]"pip install mooncake-transfer-engine 安裝框架及 vLLM 後端。
  • 單節點快速啓動:8 張 GPU 劃分 4 張推理 + 4 張訓練,運行 ./examples/qwen3-8b-dfly/run.sh 即可啓動完整流水線。
  • 配置覆蓋:通過 CLI 直接覆蓋 YAML 配置項,如 training.learning_rate=5e-5 training.num_train_steps=500
  • Conda 環境搭建:運行 ./tools/build_conda.sh 1 vllm 一鍵構建含 mooncake 的隔離環境,激活後即可使用。
  • 多節點部署:通過 Inference Controller 與 Training Controller 經 Ray 調度,結合 Mooncake 隱藏狀態存儲實現跨節點解耦訓練。

AngelSpec的核心優勢

  • 工作負載專業化:MTP 針對高熵對話場景優化,DFly 針對代碼與數學等長可預測跨度場景強化,避免單一草稿模型在所有領域表現平庸。
  • DFly 架構創新:混合目標條件主幹結合逐層目標視圖,配合前驅條件自迴歸頭,在保留並行生成能力的同時提升塊內依賴建模。
  • D-Cut 動態驗證:將目標驗證視爲共享批次級資源,根據前綴置信度與運行時成本模型自適應調整驗證深度,在高併發下持續轉化額外負載爲吞吐。
  • 分離式獨立擴展:推理與訓練 GPU 池通過 Mooncake 存儲解耦,雙方可按各自負載獨立擴縮容,避免統一併行策略的次優問題。
  • 開源完整套件:同步釋放框架代碼、Hy3-A21B/Qwen3-8B 的 MTP 與 DFly 草稿權重、訓練配置及技術報告,實現開箱即用。

AngelSpec的項目地址

  • 項目官網:https://angelspec.readthedocs.io/
  • GitHub倉庫:https://github.com/Tencent/AngelSpec
  • HuggingFace模型庫:https://huggingface.co/collections/AngelSlim/angelspec
  • arXiv技術論文:https://arxiv.org/pdf/2607.25852

AngelSpec的同類競品對比

對比維度 AngelSpec SpecForge
出品方 騰訊混元團隊 SGLang / 美團等社區團隊
核心定位 統一 MTP + 塊並行推測解碼訓練框架 面向 EAGLE-3 的生產級訓練框架
草稿架構 6 種(DFly、DFlash、DFlare、Eagle3、DSpark、MTP) 以 EAGLE-3 爲主,支持主流開源模型
架構特色 DFly 混合目標條件 + 前驅自迴歸頭 + D-Cut 動態驗證 目標-草稿解耦混合併行 + TTT 稀疏樹注意力優化
分離設計 推理/訓練完全解耦,經 Mooncake/RDMA 流傳輸隱藏狀態 支持同機共存與跨節點分離,通過 SGLang 後端集成
訓練優化 接受率對齊目標(TV/LK/D-PACE)+ 文檔感知打包 FlexAttention 稀疏掩碼 + 原地梯度內核,內存降 93.5%
開源模型 Hy3-A21B、Qwen3-8B 的 MTP/DFly 權重 SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿)
性能數據 Hy3-A21B 上 1.98–2.40× 加速,較 DFlash 高 10.5–11.8% Qwen3-235B 訓練加速 9.99×,推理最高 4.48× 加速
推理後端 vLLM、SGLang、HuggingFace SGLang、HuggingFace、自定義後端

AngelSpec的應用場景

  • 大模型在線推理加速:爲混元 Hy3、Qwen3 等 MoE/稠密模型部署推測解碼草稿,降低自迴歸解碼延遲。
  • 高併發對話服務:利用 D-Cut 動態資源分配,在併發 4–64 範圍內維持最高平均吞吐,適配客服與助手場景。
  • 代碼生成與數學推理:通過 DFly 塊並行草稿捕獲長可預測跨度,加速 IDE 補全、解題引擎等結構化輸出任務。
  • 長上下文訓練與推理:藉助 Ulysses 序列並行支持 128k 上下文,適配文檔分析、代碼庫檢索等長序列場景。
© 版權聲明

相關文章

暫無評論

暫無評論...