MAGI-2-preview是什麼
MAGI-2-preview 是 Sand.ai 開源的全球首個千億參數 MoE 多模態視頻生成模型,總參數 114B、激活僅 6B。模型延續單流架構,將文本、視頻、音頻統一納入同一 Transformer 聯合建模,實現原生多模態生成,在 AA 視頻生成榜單排名第六。模型代碼與預訓練權重已開放,驗證視頻生成領域高效 Scaling 新路徑。

MAGI-2-preview的主要功能
- 多模態視頻生成:支持文本、圖像、視頻到視頻的生成,並原生融合音頻理解。
- MoE 稀疏激活:114B 總參數中僅激活 6B,大幅降低推理成本。
- 單流統一架構:摒棄傳統的 cross-attention 拼接方式,從第一層起即對畫面與聲音共同建模。
- 高效 Scaling:針對視頻生成場景重構 MoE 通信與訓練穩定性,解決超長序列下的跨卡通信瓶頸。
MAGI-2-preview的技術原理
- MoE 混合專家架構:模型總容量達 114B,單次前向傳播僅激活 6B 參數,實現容量與計算解耦。
- 單流 Transformer:文本、視頻、音頻 token 從輸入層即進入同一 Transformer,通過自注意力直接交換跨模態信息,相比多塔拼接架構更利於捕捉音畫同步細節。
- 分佈式通信優化:針對視頻超長序列特性,重構了專家並行中的 token 路由與通信策略,降低跨 GPU 數據傳輸開銷。
- 訓練穩定性方案:動態路由、專家負載均衡與多模態數據聯合訓練的三重穩定性保障機制。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用MAGI-2-preview
- 環境準備:克隆 GitHub 倉庫
SandAI-org/MAGI-2-preview,按 README 配置依賴。 - 下載權重:從 GitHub Releases 獲取預訓練權重。
- 運行推理:修改配置文件與腳本參數,支持
t2v/i2v/v2v三種模式,參考 MAGI-1 的run.sh格式執行。 - 硬件要求:具體配置待官方文檔更新,建議參考 MAGI-1 的 24B 多卡 H100 或 4.5B 單卡 24GB VRAM 方案。
MAGI-2-preview的核心優勢
- 開源可商用:模型採用 Apache 2.0 協議,預訓練權重與推理代碼完全開放。
- 千億 MoE 首創:全球首個成功開源的千億級 MoE 視頻生成模型,驗證視頻領域 Scaling 新路徑。
- 低成本高容量:6B 激活參數即可驅動 114B 模型,推理成本遠低於同規模稠密模型。
- 原生多模態:單流架構讓音視頻在模型底層即深度融合,避免後期對齊帶來的延遲與質量損失。
MAGI-2-preview的項目地址
- 項目官網:https://sand.ai/blog/magi-2-preview
- GitHub倉庫:https://github.com/SandAI-org/MAGI-2-preview
- HuggingFace模型庫:https://huggingface.co/sand-ai/MAGI-2-preview
MAGI-2-preview的同類競品對比
| 對比維度 | MAGI-2-preview | Wan2.7-Video |
|---|---|---|
| 開發團隊 | Sand.ai | 阿里通義實驗室 |
| 架構 | MoE + 單流自迴歸 Transformer | 3D DiT + MoE + 流匹配 |
| 總參數 | 114B | 270B(14B 系列) |
| 激活參數 | 6B | 140B |
| 生成範式 | 自迴歸 | 擴散(流匹配) |
| 多模態 | 原生音視頻聯合建模(單流統一) | 文本/圖像/視頻/音頻全模態輸入 |
| 視頻時長 | 未明確(延續 MAGI-1 流式能力) | 2-15 秒 |
| 分辨率 | 未明確 | 720P / 1080P |
| 開源協議 | Apache 2.0(可商用) | 開源(權重開放) |
| 核心能力 | 高效 Scaling、原生多模態視頻生成 | 視頻編輯、參考生視頻、運鏡控制、表情驅動 |
| 榜單表現 | AA 視頻生成榜第六 | DesignArena V2V 榜首 |
| 編輯能力 | 未明確 | 一句話修改視頻、風格遷移、局部替換 |
MAGI-2-preview的應用場景
-
長視頻廣告與短劇:MoE 大容量支持複雜敘事建模,可生成分鐘級連貫劇情視頻。
-
多模態影視預演:原生音頻理解能力實現配音、音效與畫面的同步生成與編輯。
-
AI 視頻學術研究:開源千億級視頻 MoE 權重爲學術界提供可復現的 Scaling 基線。
-
企業私有化部署:模型基於Apache 2.0 協議支持金融、醫療等敏感行業構建私有視頻生成能力。
-
實時流媒體生成:稀疏激活降低推理成本,可支撐低延遲的實時視頻生成與直播場景。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...