Wan-Dancer是什麼
Wan-Dancer 是阿里通義萬相開源的音樂驅動人像舞蹈視頻生成模型。輸入一張人物照片與一段音樂,可生成節奏精準、動作流暢、風格鮮明的高質量舞蹈視頻。模型首次突破分鐘級時序瓶頸,支持 15 秒至 3 分鐘的 720p/30fps 超長連貫輸出,覆蓋中國古典舞、韓舞、街舞、踢踏舞、拉丁舞五種舞種,支持通過 LoRA 進行個性化舞蹈定製。

Wan-Dancer的主要功能
-
音樂驅動舞蹈生成:輸入人物照片與音樂,自動生成與節拍精準對齊的舞蹈視頻。
-
分鐘級長視頻生成:突破傳統 20 秒限制,穩定生成 15 秒至 3 分鐘的連貫高清視頻。
-
多風格舞蹈覆蓋:支持中國古典舞、K-Pop、街舞、踢踏舞、拉丁舞五種差異顯著的風格。
-
LoRA 個性化定製:僅需少量特定舞蹈數據即可訓練專屬動作風格,實現同款舞蹈復刻。
-
關鍵幀二次編輯:全局階段生成的關鍵幀支持手動修改,實現換裝與動作精細控制。
Wan-Dancer的技術原理
-
全局關鍵幀規劃(Global DiT):基於完整音樂結構生成長時一致性關鍵幀,規劃舞蹈動作骨架與關鍵姿態,確保全局時間尺度連貫。
-
局部時序細化(Local DiT):在全局關鍵幀基礎上細化動作細節與幀間過渡,解決動作單一重複問題,提升複雜動作表現力。
-
動態幀率適配:引入 RoPE 映射絕對時間信息,實現不同時長音樂與舞蹈動作的精確時序對齊,消除長序列漂移。
-
光流運動連續性:基於光流的損失函數優化幀間過渡,在快速旋轉、複雜步法場景中保持自然連貫。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Wan-Dancer
-
在線體驗:訪問魔搭創空間https://www.modelscope.cn/studios/Wan-AI/Wan-Dancer,上傳 9:16 豎屏單人正面照片與 10–30 秒音樂,選擇舞種後點擊生成。
-
本地部署:克隆 GitHub 倉庫,安裝依賴環境,通過 ModelScope 下載 14B 權重,分別運行全局關鍵幀推理與局部時序細化腳本。
-
Diffsynth-Studio 推理:安裝 DiffSynth-Studio 後,調用 WanVideoPipeline 加載全局/局部模型配置,設置參考圖、音樂路徑、關鍵幀掩碼等參數進行生成。
Wan-Dancer的核心優勢
-
分層解耦架構:全局 DiT 規劃長時一致性關鍵幀,局部 DiT 細化動作細節與幀間過渡,解決時序漂移與動作重複問題。
-
動態幀率適配:引入 RoPE 映射絕對時間信息,確保不同時長音樂與舞蹈動作精確同步。
-
運動連續性增強:基於光流的損失函數優化,在快速旋轉、複雜步法等場景中保持自然連貫。
-
身份高保真:參考圖人物身份特徵在長序列中保持穩定,避免角色畸變。
Wan-Dancer的項目地址
- 項目官網:https://humanaigc.github.io/wan-dancer-project/
- GitHub倉庫:https://github.com/Wan-Video/Wan-Dancer
- HuggingFace模型庫:https://huggingface.co/Wan-AI/Wan-Dancer-14B
- arXiv技術論文:https://arxiv.org/pdf/2607.09581
Wan-Dancer的同類競品對比
| 對比維度 | Wan-Dancer | MuseDance |
|---|---|---|
| 研發機構 | 阿里通義萬相 | 石溪大學 + 字節跳動 + 蘋果 |
| 核心架構 | 分層解耦雙 DiT(全局關鍵幀規劃 + 局部時序細化) | 端到端 U-Net 擴散,基於 Stable Diffusion v1.5 |
| 訓練策略 | 全局與局部模型分別訓練、分別推理 | 兩階段訓練:第一階段外觀預訓練,第二階段凍結空間注意力並注入音樂/節拍/運動模塊 |
| 音樂理解 | 專用 Music Encoder + RoPE 時間映射 | AST(Audio Spectrogram Transformer)提取音樂嵌入,通過交叉注意力注入 |
| 節拍對齊 | RoPE 動態幀率適配,將絕對時間映射到生成過程 | Librosa 提取節拍位置,one-hot 編碼後通過交叉注意力顯式對齊 |
| 運動控制 | 光流損失優化幀間過渡 + Prompt 速度標註 | 運動對齊模塊:利用歷史生成幀的隱狀態做時序自注意力 |
| 身份保持 | 參考圖像經 VAE 編碼 + 全局關鍵幀錨定約束 | 第一階段學習外觀 + 凍結空間注意力 + ReferenceNet 特徵融合 |
| 生成時長 | 分鐘級(15 秒–3 分鐘) | 短視頻片段(實驗設置 4 秒 @ 12fps) |
| 分辨率/幀率 | 720p / 30fps | 640×640 / 12fps(實驗配置) |
Wan-Dancer的應用場景
- 短視頻內容創作:爲抖音、快手、小紅書等平台快速生成個性化舞蹈視頻,無需真人出鏡即可實現風格多樣的舞蹈內容量產。
- 虛擬偶像與數字人表演:爲直播、虛擬演唱會及數字人賬號定製特定舞種的連貫表演素材,降低虛擬角色舞蹈動作的製作成本。
- 舞蹈教學與編舞輔助:藉助音樂節拍對齊與關鍵幀預覽功能,輔助舞蹈教師拆解動作節奏、設計編舞方案,並生成標準化教學演示視頻。
- 廣告與影視預演:低成本生成分鏡級別的舞蹈鏡頭預覽,幫助導演與創意團隊在拍攝前快速驗證舞蹈編排與視覺風格,加速決策流程。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...