LLaDA2.2-flash – InclusionAI 開源的擴散語言模型

AI工具3天前發佈新公告 AI管理員
0 0

LLaDA2.2-flash是什麼

LLaDA2.2-flash是InclusionAI開源的擴散語言模型(dLLM),採用MoE架構,總參數量約100B,原生支持128K上下文。模型通過多輪並行去噪擬合答案,引入萊文斯坦編輯實現序列的增刪改能力。模型在7項Agent基準上平均得分53.83,逼近同規模自迴歸模型Ling-2.6-flash的55.74分,同時保持1.64倍解碼吞吐優勢。

LLaDA2.2-flash – InclusionAI 開源的擴散語言模型

LLaDA2.2-flash的主要功能

  • 擴散式並行生成:通過塊並行解碼同時處理多個Token位置,實現高吞吐文本生成。
  • 萊文斯坦編輯:在去噪過程中支持KEEP、SUBSTITUTE、DELETE、INSERT四種編輯操作,突破定長替換限制。
  • 長上下文處理:原生支持128K上下文窗口,適配長程軟件工程、工具調用軌跡等複雜場景。
  • Agent任務執行:支持代碼修復、API交互、多輪工具調用等需要持續糾錯的環境反饋任務。
  • MoE高效推理:採用混合專家架構,通過塊路由機制控制長上下文下的推理成本。

LLaDA2.2-flash的技術原理

  • 擴散語言模型範式:與自迴歸模型從左到右逐Token生成不同,LLaDA2.2先確定一批待填補的噪聲位置,通過多輪去噪逐步擬合出完整序列,多個位置協同推進具備反覆打磨潛力。
  • 萊文斯坦編輯機制:用最長公共子序列(LCS)將生成草稿與目標序列對齊,構建KEEP、SUBSTITUTE、DELETE、INSERT四類編輯指令。DELETE移除冗餘Token並左移後續序列,INSERT在當前位置前創建[MASK]等待後續填充,使模型具備非等長序列修正能力。
  • L-EBPO強化學習:提出基於萊文斯坦編輯證據下界的塊級策略優化算法,外層優化多輪Agent交互的軌跡級決策,內層負責單次生成中Block內的插入和刪除,通過恢復編輯軌跡使梯度覆蓋結構決策,環境獎勵來自工具調用正確性、輸出格式有效性和任務完成度。
  • 塊路由機制(Block Routing):針對MoE在長上下文塊擴散中的專家並集膨脹問題,通過Token賽馬取Block級准入分數,從256個路由專家中選出Top-48組成候選池,再在每個Token在池內執行Top-k路由,使專家工作集獲得可預測的O(C)上界。

LLaDA2.2-flash – InclusionAI 開源的擴散語言模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用LLaDA2.2-flash

  • 硬件準備:本地部署LLaDA2.2-flash需配備至少4張A100-80GB或同等顯存GPU支持BF16全精度加載,若使用FP8量化或處理128K長上下文場景則需相應預留更多顯存資源。
  • 模型下載:通過ModelScope SDK下載模型時,執行from modelscope import snapshot_download; model_dir = snapshot_download("inclusionAI/LLaDA2.2-flash")可自動完成約206GB模型文件的下載。
  • Git克隆:若採用Git LFS方式獲取模型,運行git lfs install初始化大文件支持,執行git clone https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash.git拉取完整模型倉庫。
  • 模型加載:用Transformers加載模型時,調用AutoModelForCausalLM.from_pretrained(model_path, trust_remote_code=True, device_map="auto")並務必設置trust_remote_code=True啓用自定義擴散解碼邏輯。
  • 精度設置:模型加載完成後,執行model = model.to(torch.bfloat16)將其轉換爲BF16精度,隨後調用model.eval()將模型切換至評估推理模式。
  • 分詞器加載:同步加載對應分詞器AutoTokenizer.from_pretrained(model_path, trust_remote_code=True),確保分詞規則與模型配置完全匹配。
  • 輸入構造:構造用戶提示後,通過tokenizer.apply_chat_template([{"role": "user", "content": prompt}], add_generation_prompt=True, tokenize=True, return_tensors="pt")將對話格式化爲模型所需的輸入張量。
  • 參數配置:調用model.generate()時配置關鍵擴散解碼參數:block_length=32控制每步並行去噪Token數量,threshold=0.5設定去噪置信度閾值,editing_threshold=0.0關閉主動編輯,temperature=0.0啓用貪心解碼,gen_length=512設定最大生成長度。
  • 結果解碼:生成完成後,使用tokenizer.decode(generated_tokens[0], skip_special_tokens=True)將Token序列解碼爲可讀文本並輸出最終結果。

LLaDA2.2-flash的核心優勢

  • 高吞吐解碼:BF16平均解碼吞吐量達到同規模自迴歸模型Ling-2.6-flash的1.64倍,FP8量化後還可再提升18.6%。
  • 結構化自我糾錯:萊文斯坦編輯使模型具備增刪改能力,SWE-bench Verified解決率從35.8提升至44.4,絕對增益8.6個百分點。
  • 原生長上下文:通過持續預訓練從8K擴展到128K,非外推方式,適配Agent長程交互需求。
  • 開源可復現:採用Apache-2.0協議,模型與訓練細節均已公開,支持本地完整復現。
  • MoE推理效率:塊路由機制將每Block專家工作集控制在固定容量內,顯著降低HBM流量與通信成本。

LLaDA2.2-flash的項目地址

  • GitHub倉庫:https://github.com/inclusionAI/LLaDA2.X
  • ModelScope地址https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash

LLaDA2.2-flash的同類競品對比

對比維度 LLaDA2.2-flash Ling-2.6-flash
架構範式 採用擴散語言模型(dLLM)結合 MoE 架構,通過多輪並行去噪生成序列。 採用自迴歸(AR)結合 MoE 架構,從左到右逐 Token 順序生成文本。
序列編輯能力 原生支持萊文斯坦編輯,具備 KEEP、SUBSTITUTE、DELETE、INSERT 四種增刪改操作。 無原生序列編輯能力,生成後修正需依賴外部重採樣或後處理。
強化學習策略 使用 L-EBPO 算法,在環境反饋中聯合優化軌跡級決策與塊內編輯動作。 採用標準 RLHF 或傳統強化學習框架進行對齊與優化。
Agent 基準均分 在 7 項 Agent 基準測試中平均得分爲 53.83。 在相同 7 項 Agent 基準測試中平均得分爲 55.74,高出 1.91 分。
解碼吞吐量 BF16 平均解碼吞吐量達到 Ling-2.6-flash 的 1.64 倍,FP8 量化後再提升 18.6%。 作爲自迴歸基準模型,解碼吞吐受逐 Token 生成方式限制。
上下文窗口 通過持續預訓練原生支持 128K 上下文,非位置外推方式。 上下文能力未在公開技術報告中詳細披露具體訓練方式。

LLaDA2.2-flash的應用場景

  • 軟件工程Agent:模型原生支持萊文斯坦編輯的增刪改能力,可勝任代碼修復、Bug定位、函數補全等需要非等長文本編輯的複雜編程任務。
  • 多輪工具調用:在API交互與MCP協議執行中,模型能夠動態修正參數、增刪字段,適配需要持續糾錯的複雜Agent工作流。
  • 長文檔處理:、原生128K上下文窗口,模型可高效完成長文本分析、報告生成與知識提取,無需依賴位置外推。
  • 科研與實驗復現:作爲開源的MoE擴散語言模型,LLaDA2.2-flash爲學術界提供了自迴歸路線之外的可復現研究基座與替代技術路徑。
© 版權聲明

相關文章

暫無評論

暫無評論...