Instella-MoE – AMD 開源的混合專家語言模型系列

AI工具1個月前發佈新公告 AI管理員
0 0

Instella-MoE是什麼

Instella-MoE 是 AMD 開源的混合專家語言模型系列,總參數量 16B、激活參數量 2.8B,採用 27 層解碼器架構。模型基於 AMD Instinct MI300X / MI325X GPU 及 ROCm 軟件棧從頭訓練,提供預訓練、長上下文 Base、SFT、DPO 和 RL 優化共 6 個全開源版本,在 AMD 硬件上實現訓練與推理的高效協同。

Instella-MoE – AMD 開源的混合專家語言模型系列

Instella-MoE的主要功能

  • 多階段模型系列:提供預訓練、Mid-training、長上下文 Base、SFT、DPO 及 RL 優化共 6 個版本,覆蓋從基座到對話的全鏈路需求。
  • 高效 MoE 推理:僅激活 2.8B 參數即可完成推理,在保持較小計算開銷的同時獲得接近更大稠密模型的性能。
  • 長上下文支持:Base 版本支持 64K 上下文長度,可處理長文檔理解與推理任務。
  • 指令遵循與思維鏈:SFT 版本實現指令跟蹤與鏈式推理,Think 版本通過強化學習進一步提升響應質量。
  • AMD 原生優化:基於 ROCm 生態和 SGLang 推理框架深度優化,在 AMD 硬件上實現高效訓練與推理。

Instella-MoE的技術原理

  • MoE 架構與注意力機制:模型採用混合專家架構,總參數量 16B 中每次前向傳播僅激活 2.8B 參數,通過門控路由機制動態分配 token 到不同專家網絡,實現大容量與低推理成本的解耦。同時引入門控多頭潛在注意力,在潛在注意力空間中增加門控控制,增強長序列建模能力並降低 KV 緩存開銷。
  • AMD 原生訓練系統:訓練完全基於 AMD ROCm™ 軟件棧,底層採用 Primus 訓練框架 與 Miles RL 框架。預訓練階段使用 FarSkip-Collective 技術實現專家並行下的通信與計算重疊,將預訓練速度提升 12.7%。模型在 AMD Instinct MI300X / MI325X GPU 上從頭訓練,充分發揮了 AMD 硬件的互聯帶寬優勢。
  • 後訓練與強化學習:後訓練採用四階段流水線:SFT→ DPO→ 兩階段 RL。RL 階段分爲:Stage 1 進行指令遵循專項強化學習;Stage 2 採用 MOPD,通過 Domain Router 將 IF Prompts 路由至 IF-RL Teacher、其他 Prompts 路由至 DPO Teacher,以 Token 級反向 KL 散度約束學生模型策略更新,在保持通用能力的同時強化指令遵循與推理質量。

Instella-MoE – AMD 開源的混合專家語言模型系列

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Instella-MoE

  • 獲取模型權重:訪問 Hugging Face 模型集合(amd/instella-moe)或 GitHub 倉庫下載所需版本(Base / SFT / DPO / Think)。
  • 環境準備:安裝 AMD ROCm 驅動及 PyTorch for ROCm,或直接使用支持 ROCm 的 Docker 鏡像。
  • 加載模型:用 Transformers 庫或 SGLang 推理框架加載模型權重,SGLang 可充分發揮 AMD 硬件的推理加速能力。
  • 執行推理:根據任務類型選擇對應版本——Base 用於文本續寫與嵌入,SFT / DPO / Think 用於對話與指令任務。
  • 微調與部署:基於 Base 模型使用自有數據繼續訓練,或通過 vLLM / SGLang 部署爲 API 服務。

Instella-MoE的核心優勢

  • 全鏈路開源透明:從預訓練到 RL 的 6 個階段模型全部開源,訓練數據與代碼透明可查。
  • AMD 生態原生適配:基於 ROCm 和自研 GPU 訓練,在 AMD Instinct 系列硬件上推理效率最優,TTFT 最高可降低 39.2%。
  • 激活參數高效:16B 總參數僅激活 2.8B,推理成本顯著低於同性能稠密模型。
  • 後訓練技術先進:MOPD 多教師蒸餾結合 Token 級反向 KL,在指令遵循和數學推理上表現突出。
  • 通信計算深度重疊:FarSkip-Collective 與 SGLang 專家並行實現通信隱藏,訓練與推理效率雙優。

Instella-MoE的項目地址

  • 項目官網:https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
  • GitHub倉庫:https://github.com/AMD-AGI/Instella-MoE
  • HuggingFace模型庫:https://huggingface.co/collections/amd/instella-moe

Instella-MoE的同類競品對比

維度 Instella-MoE-16B-A3B Qwen3.5-4B-Base
推出方 AMD(2026.07) 阿里巴巴通義千問
總參數量 16B 4B
激活參數量 2.8B 4B(稠密,全參數激活)
架構類型 MoE(混合專家) 稠密 Transformer
開源程度 6 個階段權重 + 代碼全開源 權重開源
上下文長度 64K 128K
Base 平均性能 76.7% 79.5%

Instella-MoE的應用場景

  • 企業私有化部署:基於 AMD ROCm 生態在本地 GPU 集羣部署對話與推理服務,滿足數據合規需求。
  • 長文檔分析:用 64K 長上下文能力處理法律合同、科研論文、財報等長文本理解與摘要任務。
  • 代碼輔助生成:SFT / Think 版本支持編程指令遵循,可用於 IDE 插件或代碼審查工具。
  • 科研與教學:全開源鏈路適合學術界進行 MoE 架構研究、訓練方法復現及大模型課程教學。
  • 邊緣與混合雲推理:低激活參數量適合在資源受限環境中進行高效推理,或作爲混合雲 AI 服務的基座模型。
© 版權聲明

相關文章

暫無評論

暫無評論...