Instella-MoE是什麼
Instella-MoE 是 AMD 開源的混合專家語言模型系列,總參數量 16B、激活參數量 2.8B,採用 27 層解碼器架構。模型基於 AMD Instinct MI300X / MI325X GPU 及 ROCm 軟件棧從頭訓練,提供預訓練、長上下文 Base、SFT、DPO 和 RL 優化共 6 個全開源版本,在 AMD 硬件上實現訓練與推理的高效協同。

Instella-MoE的主要功能
-
多階段模型系列:提供預訓練、Mid-training、長上下文 Base、SFT、DPO 及 RL 優化共 6 個版本,覆蓋從基座到對話的全鏈路需求。
-
高效 MoE 推理:僅激活 2.8B 參數即可完成推理,在保持較小計算開銷的同時獲得接近更大稠密模型的性能。
-
長上下文支持:Base 版本支持 64K 上下文長度,可處理長文檔理解與推理任務。
-
指令遵循與思維鏈:SFT 版本實現指令跟蹤與鏈式推理,Think 版本通過強化學習進一步提升響應質量。
-
AMD 原生優化:基於 ROCm 生態和 SGLang 推理框架深度優化,在 AMD 硬件上實現高效訓練與推理。
Instella-MoE的技術原理
- MoE 架構與注意力機制:模型採用混合專家架構,總參數量 16B 中每次前向傳播僅激活 2.8B 參數,通過門控路由機制動態分配 token 到不同專家網絡,實現大容量與低推理成本的解耦。同時引入門控多頭潛在注意力,在潛在注意力空間中增加門控控制,增強長序列建模能力並降低 KV 緩存開銷。
- AMD 原生訓練系統:訓練完全基於 AMD ROCm™ 軟件棧,底層採用 Primus 訓練框架 與 Miles RL 框架。預訓練階段使用 FarSkip-Collective 技術實現專家並行下的通信與計算重疊,將預訓練速度提升 12.7%。模型在 AMD Instinct MI300X / MI325X GPU 上從頭訓練,充分發揮了 AMD 硬件的互聯帶寬優勢。
- 後訓練與強化學習:後訓練採用四階段流水線:SFT→ DPO→ 兩階段 RL。RL 階段分爲:Stage 1 進行指令遵循專項強化學習;Stage 2 採用 MOPD,通過 Domain Router 將 IF Prompts 路由至 IF-RL Teacher、其他 Prompts 路由至 DPO Teacher,以 Token 級反向 KL 散度約束學生模型策略更新,在保持通用能力的同時強化指令遵循與推理質量。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Instella-MoE
- 獲取模型權重:訪問 Hugging Face 模型集合(
amd/instella-moe)或 GitHub 倉庫下載所需版本(Base / SFT / DPO / Think)。 - 環境準備:安裝 AMD ROCm 驅動及 PyTorch for ROCm,或直接使用支持 ROCm 的 Docker 鏡像。
- 加載模型:用 Transformers 庫或 SGLang 推理框架加載模型權重,SGLang 可充分發揮 AMD 硬件的推理加速能力。
- 執行推理:根據任務類型選擇對應版本——Base 用於文本續寫與嵌入,SFT / DPO / Think 用於對話與指令任務。
- 微調與部署:基於 Base 模型使用自有數據繼續訓練,或通過 vLLM / SGLang 部署爲 API 服務。
Instella-MoE的核心優勢
-
全鏈路開源透明:從預訓練到 RL 的 6 個階段模型全部開源,訓練數據與代碼透明可查。
-
AMD 生態原生適配:基於 ROCm 和自研 GPU 訓練,在 AMD Instinct 系列硬件上推理效率最優,TTFT 最高可降低 39.2%。
-
激活參數高效:16B 總參數僅激活 2.8B,推理成本顯著低於同性能稠密模型。
-
後訓練技術先進:MOPD 多教師蒸餾結合 Token 級反向 KL,在指令遵循和數學推理上表現突出。
-
通信計算深度重疊:FarSkip-Collective 與 SGLang 專家並行實現通信隱藏,訓練與推理效率雙優。
Instella-MoE的項目地址
- 項目官網:https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
- GitHub倉庫:https://github.com/AMD-AGI/Instella-MoE
- HuggingFace模型庫:https://huggingface.co/collections/amd/instella-moe
Instella-MoE的同類競品對比
| 維度 | Instella-MoE-16B-A3B | Qwen3.5-4B-Base |
|---|---|---|
| 推出方 | AMD(2026.07) | 阿里巴巴通義千問 |
| 總參數量 | 16B | 4B |
| 激活參數量 | 2.8B | 4B(稠密,全參數激活) |
| 架構類型 | MoE(混合專家) | 稠密 Transformer |
| 開源程度 | 6 個階段權重 + 代碼全開源 | 權重開源 |
| 上下文長度 | 64K | 128K |
| Base 平均性能 | 76.7% | 79.5% |
Instella-MoE的應用場景
-
企業私有化部署:基於 AMD ROCm 生態在本地 GPU 集羣部署對話與推理服務,滿足數據合規需求。
-
長文檔分析:用 64K 長上下文能力處理法律合同、科研論文、財報等長文本理解與摘要任務。
-
代碼輔助生成:SFT / Think 版本支持編程指令遵循,可用於 IDE 插件或代碼審查工具。
-
科研與教學:全開源鏈路適合學術界進行 MoE 架構研究、訓練方法復現及大模型課程教學。
-
邊緣與混合雲推理:低激活參數量適合在資源受限環境中進行高效推理,或作爲混合雲 AI 服務的基座模型。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...