Wan-Dancer – 阿里通義開源的人像舞蹈視頻生成模型

AI工具3周前發佈新公告 AI管理員
0 0

Wan-Dancer是什麼

Wan-Dancer 是阿里通義萬相開源的音樂驅動人像舞蹈視頻生成模型。輸入一張人物照片與一段音樂,可生成節奏精準、動作流暢、風格鮮明的高質量舞蹈視頻。模型首次突破分鐘級時序瓶頸,支持 15 秒至 3 分鐘的 720p/30fps 超長連貫輸出,覆蓋中國古典舞、韓舞、街舞、踢踏舞、拉丁舞五種舞種,支持通過 LoRA 進行個性化舞蹈定製。

Wan-Dancer – 阿里通義開源的人像舞蹈視頻生成模型

Wan-Dancer的主要功能

  • 音樂驅動舞蹈生成:輸入人物照片與音樂,自動生成與節拍精準對齊的舞蹈視頻。
  • 分鐘級長視頻生成:突破傳統 20 秒限制,穩定生成 15 秒至 3 分鐘的連貫高清視頻。
  • 多風格舞蹈覆蓋:支持中國古典舞、K-Pop、街舞、踢踏舞、拉丁舞五種差異顯著的風格。
  • LoRA 個性化定製:僅需少量特定舞蹈數據即可訓練專屬動作風格,實現同款舞蹈復刻。
  • 關鍵幀二次編輯:全局階段生成的關鍵幀支持手動修改,實現換裝與動作精細控制。

Wan-Dancer的技術原理

  • 全局關鍵幀規劃(Global DiT):基於完整音樂結構生成長時一致性關鍵幀,規劃舞蹈動作骨架與關鍵姿態,確保全局時間尺度連貫。
  • 局部時序細化(Local DiT):在全局關鍵幀基礎上細化動作細節與幀間過渡,解決動作單一重複問題,提升複雜動作表現力。
  • 動態幀率適配:引入 RoPE 映射絕對時間信息,實現不同時長音樂與舞蹈動作的精確時序對齊,消除長序列漂移。
  • 光流運動連續性:基於光流的損失函數優化幀間過渡,在快速旋轉、複雜步法場景中保持自然連貫。

Wan-Dancer – 阿里通義開源的人像舞蹈視頻生成模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Wan-Dancer

  • 在線體驗:訪問魔搭創空間https://www.modelscope.cn/studios/Wan-AI/Wan-Dancer,上傳 9:16 豎屏單人正面照片與 10–30 秒音樂,選擇舞種後點擊生成。
  • 本地部署:克隆 GitHub 倉庫,安裝依賴環境,通過 ModelScope 下載 14B 權重,分別運行全局關鍵幀推理與局部時序細化腳本。
  • Diffsynth-Studio 推理:安裝 DiffSynth-Studio 後,調用 WanVideoPipeline 加載全局/局部模型配置,設置參考圖、音樂路徑、關鍵幀掩碼等參數進行生成。

Wan-Dancer的核心優勢

  • 分層解耦架構:全局 DiT 規劃長時一致性關鍵幀,局部 DiT 細化動作細節與幀間過渡,解決時序漂移與動作重複問題。
  • 動態幀率適配:引入 RoPE 映射絕對時間信息,確保不同時長音樂與舞蹈動作精確同步。
  • 運動連續性增強:基於光流的損失函數優化,在快速旋轉、複雜步法等場景中保持自然連貫。
  • 身份高保真:參考圖人物身份特徵在長序列中保持穩定,避免角色畸變。

Wan-Dancer的項目地址

  • 項目官網:https://humanaigc.github.io/wan-dancer-project/
  • GitHub倉庫:https://github.com/Wan-Video/Wan-Dancer
  • HuggingFace模型庫:https://huggingface.co/Wan-AI/Wan-Dancer-14B
  • arXiv技術論文:https://arxiv.org/pdf/2607.09581

Wan-Dancer的同類競品對比

對比維度 Wan-Dancer MuseDance
研發機構 阿里通義萬相 石溪大學 + 字節跳動 + 蘋果
核心架構 分層解耦雙 DiT(全局關鍵幀規劃 + 局部時序細化) 端到端 U-Net 擴散,基於 Stable Diffusion v1.5
訓練策略 全局與局部模型分別訓練、分別推理 兩階段訓練:第一階段外觀預訓練,第二階段凍結空間注意力並注入音樂/節拍/運動模塊
音樂理解 專用 Music Encoder + RoPE 時間映射 AST(Audio Spectrogram Transformer)提取音樂嵌入,通過交叉注意力注入
節拍對齊 RoPE 動態幀率適配,將絕對時間映射到生成過程 Librosa 提取節拍位置,one-hot 編碼後通過交叉注意力顯式對齊
運動控制 光流損失優化幀間過渡 + Prompt 速度標註 運動對齊模塊:利用歷史生成幀的隱狀態做時序自注意力
身份保持 參考圖像經 VAE 編碼 + 全局關鍵幀錨定約束 第一階段學習外觀 + 凍結空間注意力 + ReferenceNet 特徵融合
生成時長 分鐘級(15 秒–3 分鐘) 短視頻片段(實驗設置 4 秒 @ 12fps)
分辨率/幀率 720p / 30fps 640×640 / 12fps(實驗配置)

Wan-Dancer的應用場景

  • 短視頻內容創作:爲抖音、快手、小紅書等平台快速生成個性化舞蹈視頻,無需真人出鏡即可實現風格多樣的舞蹈內容量產。
  • 虛擬偶像與數字人表演:爲直播、虛擬演唱會及數字人賬號定製特定舞種的連貫表演素材,降低虛擬角色舞蹈動作的製作成本。
  • 舞蹈教學與編舞輔助:藉助音樂節拍對齊與關鍵幀預覽功能,輔助舞蹈教師拆解動作節奏、設計編舞方案,並生成標準化教學演示視頻。
  • 廣告與影視預演:低成本生成分鏡級別的舞蹈鏡頭預覽,幫助導演與創意團隊在拍攝前快速驗證舞蹈編排與視覺風格,加速決策流程。
© 版權聲明

相關文章

暫無評論

暫無評論...