Wan-Animate-2是什麼
Wan-Animate-2是萬相團隊開源的新一代角色動畫模型,作爲 Wan-Animate 的重大架構升級,放棄了對顯式姿態骨架和輔助姿態提取網絡的依賴,改爲端到端的雙分支 Diffusion Transformer(DiT),直接從參考視頻中捕捉運動先驗。模型支持文本驅動的視角控制,提供可達 24 fps 的實時流式變體。

Wan-Animate-2的主要功能
-
驅動視頻轉角色動畫:輸入參考圖
reference.png與驅動模板視頻template.mp4,讓參考角色復刻驅動視頻中的動作與鏡頭節奏。 -
端到端運動遷移:重新設計的 DiT 直接消費驅動視頻,不再經過中間運動提取器,目標是同時提升運動保真與身份一致性。
-
身份/外觀保持:通過 reference image token 與 reference video token 參與注意力計算,把參考外觀注入生成過程,減少“動作像但臉崩”的情況。
-
文本規範化控制:推理前先用 LLM 生成固定範式 caption,只寫“人物外觀描述 + 背景描述”,不描述動作、不推測情緒,再作爲 Wan-Animate-2 的 prompt。
-
文本驅動視角控制:支持用文本把輸出相機視角與驅動視頻解耦,方便做“同一套動作、不同機位/視角”的生成。
-
Base 高質量模式:默認推理腳本走常規配置,官方示例 Diffusers 側爲
num_inference_steps=40,更偏質量優先。 -
Distillation 低步數模式:蒸餾權重示例爲 10 steps、
guidance_scale=1.0、Euler solver/no CFG,面向更快出片與低延遲驗證。 -
實時化前瞻功能:論文提出 Wan-Animate-2-Lite,用 teacher forcing、error buffer、Self-Forcing 蒸餾與 chunk-wise 反傳,把延遲壓向實時閾值,面向流式角色動畫。
-
本地與在線體驗:提供本地 Gradio 腳本,Base 用
wan_animate_2_gradio.py,蒸餾用wan_animate_2_gradio_distillation.py;README 也指向 ModelScope Studio 在線 demo。 -
工程生態入口:權重走 HuggingFace/ModelScope,模型 ID 示例爲
Wan-AI/Wan2.2-Animate-2-14B;Diffusers 已可源碼安裝接入,ComfyUI/DiffSynth-Studio 仍在 Todo。 -
可配置並行生成:默認按 8×A800、720P 調參,也測過 2×A800、480P;不同硬件需要改 YAML 並行配置。
如何使用Wan-Animate-2
-
準備硬件:優先按官方默認 8×A800、720P 規劃;官方另測過 2×A800、480P,消費級單卡不要默認能跑。
-
克隆倉庫:
git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git。 -
建環境:Python 3.11;安裝 torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0,CUDA 12.6 源;再裝
requirements.txt、flash-attn,最後pip install -e .。 -
下載權重:HuggingFace 用
huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/;ModelScope 用modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/。 -
先生成 caption:用 Qwen3.7-Plus 之類 LLM,按官方中文範式只寫“人物外觀描述 + 背景描述”,不要寫動作、情緒或評價。
-
跑 Base:進入
infer,執行wan_animate_2_demo.py,傳--prompt、--refer-img-file、--refer-video-file、--config ./wan_animate_2.yaml。 -
跑蒸餾版:改用
wan_animate_2_distillation.yaml,並加--sample_guide_scale 1.0 --step 10;Diffusers 側對應guidance_scale=1.0、flow_solver="euler"。 -
改並行配置:GPU 數量/顯存與官方不一致時,先改 YAML parallel configs,再排查 OOM 或速度異常。
-
快速體驗:不想部署可先試 ModelScope Studio;本地則運行
wan_animate_2_gradio.py或wan_animate_2_gradio_distillation.py。

微信關注回覆“開源”,加入AI開源項目交流羣
Wan-Animate-2的核心優勢
-
動作保真與身份一致性是主賣點:去掉中間運動提取器,理論上少一層誤差累積。
-
更貼近生產鏈路:官方把 caption 前置成固定範式,要求描述人物外觀與背景、不描述動作,便於穩定復現。
-
低延遲路線明確:Distillation 已可跑 10 步推理;Lite 論文口徑更是直指實時/流式數字人。
-
可商用友好度較高:Apache-2.0 對二次開發更友好,但實際商用仍要處理素材版權、肖像權與平台規則。
Wan-Animate-2的項目地址
- 項目官網:https://humanaigc.github.io/wan-animate-2
- Github倉庫:https://github.com/Wan-Video/Wan-Animate-2
- ModelScope:https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
- arXiv技術論文:https://arxiv.org/pdf/2608.06009
- 在線體驗Demo:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
Wan-Animate-2的同類競品對比
| 對比維度 | Wan-Animate-2 | MagicAnimate | MusePose |
|---|---|---|---|
| 核心任務 | 參考圖 + 驅動視頻生成角色動畫,強調端到端動作遷移與身份保持。 | 單張圖 + motion video 生成動畫,主打時序一致性與參考圖保真。 | 參考圖 + pose 序列生成虛擬人視頻,偏舞蹈/全身動作。 |
| 技術路線 | 重新設計 DiT 直接消費驅動視頻,去掉中間運動提取器;加文本驅動視角控制。 | 早期擴散方案,默認依賴 DensePose 驅動;需配 SD1.5、MSE VAE 與項目 checkpoints。 | diffusion-based + pose-guided;基於/優化 Moore-AnimateAnyone 路線,並提供 pose align。 |
| 動作信號 | 直接用 driving video,少一層姿態/關鍵點中間表示。 | 依賴 motion video/DensePose 類條件。 | 顯式 dwpose 序列,先把舞蹈視頻對齊到參考圖再推理。 |
| 身份/細節 | 目標是高保真運動 + 強身份保持;真實效果仍建議同素材自測臉、手、閃爍。 | 官網自承臉和手可能失真,默認配置可能出現動漫到寫實的風格漂移。 | 官方 Limitations 寫明:臉部區域、複雜服裝細節保持不穩定,複雜背景有噪聲/閃爍。 |
| 速度/實時 | Distillation 示例 10 steps、無 CFG、Euler;論文另提 Lite 衝實時流式。 | 屬早期高質量擴散路線,未以實時爲主賣點。 | 未主打實時;優勢在 pose align 提升可用性,不是低延遲架構。 |
| 分辨率/硬件 | 默認 8×A800、720P;官方測過 2×A800、480P;硬件不同要改 YAML 並行。 | 官網安裝要求 python>=3.8、CUDA>=11.3、ffmpeg;未給新一代顯存承諾。 | 官方給出 512×512×48 約 16GB VRAM、768×768×48 約 28GB VRAM;訓練機示例爲 8×80GB。 |
| 生態/易用 | HuggingFace/ModelScope 權重、Gradio、Diffusers 源碼接入;ComfyUI 仍在 Todo。 | 有 HuggingFace/Replicate/Colab 等早期體驗入口,但架構偏老。 | 已支持 Comfyui-MusePose,2025-03-04 發佈 train codes。 |
Wan-Animate-2的應用場景
-
虛擬主播 / 數字人直播:Lite 路線明確指向實時閾值與流式角色動畫,適合做“真人驅動虛擬形象”的低延遲直播間。
-
短視頻 / 短劇角色替身:把演員的表演視頻作爲 driving video,套到角色立繪或參考圖上,適合奇幻角色、IP 形象、低成本替身鏡頭;核心是端到端動作遷移與身份保持。
-
舞蹈、MV、手勢舞二創:用一段舞蹈模板驅動不同角色形象,做多角色翻跳、同框換裝或風格化 MV;視角控制還能做“同動作不同機位”的剪輯素材。
-
電商與品牌內容:讓品牌 mascot、虛擬模特按統一模板展示動作,用於上新短片、活動頁視頻、社媒素材;商用前要處理肖像、服裝版權與平台合規。
-
教育 / 知識博主課件:把講師形象或卡通講師驅動成固定動作模板,批量生成開場、轉場、知識點提示鏡頭,降低重複拍攝成本。
-
遊戲 NPC / 過場預演:策劃先用真人表演快速驅動角色原型,驗證動作節奏、鏡頭和情緒,再決定是否進入正式動捕與渲染管線。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...