Wan-Animate-2 – 萬相團隊開源的新一代角色動畫模型

Wan-Animate-2是什麼

Wan-Animate-2是萬相團隊開源的新一代角色動畫模型,作爲 Wan-Animate 的重大架構升級,放棄了對顯式姿態骨架和輔助姿態提取網絡的依賴,改爲端到端的雙分支 Diffusion Transformer(DiT),直接從參考視頻中捕捉運動先驗。模型支持文本驅動的視角控制,提供可達 24 fps 的實時流式變體。

Wan-Animate-2 – 萬相團隊開源的新一代角色動畫模型

Wan-Animate-2的主要功能

  • 驅動視頻轉角色動畫:輸入參考圖 reference.png 與驅動模板視頻 template.mp4,讓參考角色復刻驅動視頻中的動作與鏡頭節奏。
  • 端到端運動遷移:重新設計的 DiT 直接消費驅動視頻,不再經過中間運動提取器,目標是同時提升運動保真與身份一致性。
  • 身份/外觀保持:通過 reference image token 與 reference video token 參與注意力計算,把參考外觀注入生成過程,減少“動作像但臉崩”的情況。
  • 文本規範化控制:推理前先用 LLM 生成固定範式 caption,只寫“人物外觀描述 + 背景描述”,不描述動作、不推測情緒,再作爲 Wan-Animate-2 的 prompt。
  • 文本驅動視角控制:支持用文本把輸出相機視角與驅動視頻解耦,方便做“同一套動作、不同機位/視角”的生成。
  • Base 高質量模式:默認推理腳本走常規配置,官方示例 Diffusers 側爲 num_inference_steps=40,更偏質量優先。
  • Distillation 低步數模式:蒸餾權重示例爲 10 steps、guidance_scale=1.0、Euler solver/no CFG,面向更快出片與低延遲驗證。
  • 實時化前瞻功能:論文提出 Wan-Animate-2-Lite,用 teacher forcing、error buffer、Self-Forcing 蒸餾與 chunk-wise 反傳,把延遲壓向實時閾值,面向流式角色動畫。
  • 本地與在線體驗:提供本地 Gradio 腳本,Base 用 wan_animate_2_gradio.py,蒸餾用 wan_animate_2_gradio_distillation.py;README 也指向 ModelScope Studio 在線 demo。
  • 工程生態入口:權重走 HuggingFace/ModelScope,模型 ID 示例爲 Wan-AI/Wan2.2-Animate-2-14B;Diffusers 已可源碼安裝接入,ComfyUI/DiffSynth-Studio 仍在 Todo。
  • 可配置並行生成:默認按 8×A800、720P 調參,也測過 2×A800、480P;不同硬件需要改 YAML 並行配置。

如何使用Wan-Animate-2

  • 準備硬件:優先按官方默認 8×A800、720P 規劃;官方另測過 2×A800、480P,消費級單卡不要默認能跑。
  • 克隆倉庫git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git
  • 建環境:Python 3.11;安裝 torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0,CUDA 12.6 源;再裝 requirements.txtflash-attn,最後 pip install -e .
  • 下載權重:HuggingFace 用 huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/;ModelScope 用 modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/
  • 先生成 caption:用 Qwen3.7-Plus 之類 LLM,按官方中文範式只寫“人物外觀描述 + 背景描述”,不要寫動作、情緒或評價。
  • 跑 Base:進入 infer,執行 wan_animate_2_demo.py,傳 --prompt--refer-img-file--refer-video-file--config ./wan_animate_2.yaml
  • 跑蒸餾版:改用 wan_animate_2_distillation.yaml,並加 --sample_guide_scale 1.0 --step 10;Diffusers 側對應 guidance_scale=1.0flow_solver="euler"
  • 改並行配置:GPU 數量/顯存與官方不一致時,先改 YAML parallel configs,再排查 OOM 或速度異常。
  • 快速體驗:不想部署可先試 ModelScope Studio;本地則運行 wan_animate_2_gradio.pywan_animate_2_gradio_distillation.py

Wan-Animate-2 – 萬相團隊開源的新一代角色動畫模型

微信關注回覆“開源”,加入AI開源項目交流羣

Wan-Animate-2的核心優勢

  • 動作保真與身份一致性是主賣點:去掉中間運動提取器,理論上少一層誤差累積。
  • 更貼近生產鏈路:官方把 caption 前置成固定範式,要求描述人物外觀與背景、不描述動作,便於穩定復現。
  • 低延遲路線明確:Distillation 已可跑 10 步推理;Lite 論文口徑更是直指實時/流式數字人。
  • 可商用友好度較高:Apache-2.0 對二次開發更友好,但實際商用仍要處理素材版權、肖像權與平台規則。

Wan-Animate-2的項目地址

  • 項目官網https://humanaigc.github.io/wan-animate-2
  • Github倉庫:https://github.com/Wan-Video/Wan-Animate-2
  • ModelScopehttps://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
  • arXiv技術論文:https://arxiv.org/pdf/2608.06009
  • 在線體驗Demohttps://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate

Wan-Animate-2的同類競品對比

對比維度 Wan-Animate-2 MagicAnimate MusePose
核心任務 參考圖 + 驅動視頻生成角色動畫,強調端到端動作遷移與身份保持。

單張圖 + motion video 生成動畫,主打時序一致性與參考圖保真。 參考圖 + pose 序列生成虛擬人視頻,偏舞蹈/全身動作。

技術路線 重新設計 DiT 直接消費驅動視頻,去掉中間運動提取器;加文本驅動視角控制。

早期擴散方案,默認依賴 DensePose 驅動;需配 SD1.5、MSE VAE 與項目 checkpoints。

diffusion-based + pose-guided;基於/優化 Moore-AnimateAnyone 路線,並提供 pose align。

動作信號 直接用 driving video,少一層姿態/關鍵點中間表示。

依賴 motion video/DensePose 類條件。

顯式 dwpose 序列,先把舞蹈視頻對齊到參考圖再推理。

身份/細節 目標是高保真運動 + 強身份保持;真實效果仍建議同素材自測臉、手、閃爍。

官網自承臉和手可能失真,默認配置可能出現動漫到寫實的風格漂移。

官方 Limitations 寫明:臉部區域、複雜服裝細節保持不穩定,複雜背景有噪聲/閃爍。

速度/實時 Distillation 示例 10 steps、無 CFG、Euler;論文另提 Lite 衝實時流式。 屬早期高質量擴散路線,未以實時爲主賣點。

未主打實時;優勢在 pose align 提升可用性,不是低延遲架構。

分辨率/硬件 默認 8×A800、720P;官方測過 2×A800、480P;硬件不同要改 YAML 並行。

官網安裝要求 python>=3.8、CUDA>=11.3、ffmpeg;未給新一代顯存承諾。

官方給出 512×512×48 約 16GB VRAM、768×768×48 約 28GB VRAM;訓練機示例爲 8×80GB。

生態/易用 HuggingFace/ModelScope 權重、Gradio、Diffusers 源碼接入;ComfyUI 仍在 Todo。

有 HuggingFace/Replicate/Colab 等早期體驗入口,但架構偏老。 已支持 Comfyui-MusePose,2025-03-04 發佈 train codes。

Wan-Animate-2的應用場景

  • 虛擬主播 / 數字人直播:Lite 路線明確指向實時閾值與流式角色動畫,適合做“真人驅動虛擬形象”的低延遲直播間。
  • 短視頻 / 短劇角色替身:把演員的表演視頻作爲 driving video,套到角色立繪或參考圖上,適合奇幻角色、IP 形象、低成本替身鏡頭;核心是端到端動作遷移與身份保持。
  • 舞蹈、MV、手勢舞二創:用一段舞蹈模板驅動不同角色形象,做多角色翻跳、同框換裝或風格化 MV;視角控制還能做“同動作不同機位”的剪輯素材。
  • 電商與品牌內容:讓品牌 mascot、虛擬模特按統一模板展示動作,用於上新短片、活動頁視頻、社媒素材;商用前要處理肖像、服裝版權與平台合規。
  • 教育 / 知識博主課件:把講師形象或卡通講師驅動成固定動作模板,批量生成開場、轉場、知識點提示鏡頭,降低重複拍攝成本。
  • 遊戲 NPC / 過場預演:策劃先用真人表演快速驅動角色原型,驗證動作節奏、鏡頭和情緒,再決定是否進入正式動捕與渲染管線。
© 版權聲明

相關文章

暫無評論

暫無評論...