阿里 Wan2.1 本地部署教程 – 8G 顯存可文生視頻 

AI教程4周前發佈新公告 AI管理員
0 0

今天發點適合本地做 AI 視頻的東西。

說實話,現在的 AI 視頻生成技術已經算成熟了,只有一個缺點:貴,收費基本都按秒,而且很難保證一條過,錢包真的頂不住啊。

今天這個 GitHub 的阿里 Wan2.1 項目就很精妙,最低8G的顯存就能本地跑,相信現在大部分電腦都能符合。

阿里 Wan2.1 本地部署教程 – 8G 顯存可文生視頻 

 

01. 項目簡介

 

Wan2.1 是阿里通義團隊開源的一整套視頻生成基礎模型。

項目地址:https://github.com/Wan-Video/Wan2.1

Wan2.1 不只包含文生視頻,還覆蓋圖生視頻、首尾幀補間、視頻編輯、參考主體生成和文生圖等任務。

雖然現在出了 Wan2.2,但 Wan2.1 在低顯存玩法上比較完整,尤其適合本地實驗和二次開發。

很多視頻生成項目只放出單一模型,比如只做文生視頻,或者只做圖生視頻。Wan2.1 更像一組視頻模型工具箱,不同模型負責不同任務。

  • 文生視頻可以從 Wan2.1-T2V-1.3B 開始,主打 480P,適合本地測試和低顯存設備;
  • 如果更好的畫面細節和運動表現,選擇 Wan2.1-T2V-14B,支持 480P 和 720P。
  • 圖生視頻對應 Wan2.1-I2V-14B,官方分別提供 480P 和 720P 版本。
  • 控制視頻的開始和結束畫面,可以使用 Wan2.1-FLF2V-14B-720P。
  • Wan2.1-VACE-1.3B 偏向視頻創作和編輯,面向 480P 場景,門檻更低
  • Wan2.1-VACE-14B 支持 480P 和 720P,適合做參考主體生成、局部修改、視頻換主體和更復雜的視頻編輯。

官方提供了 Hugging Face、ModelScope、Diffusers、ComfyUI 和 Gradio 等接入方式。

我這次選擇的就是 Wan2.1-T2V-1.3B ,8G顯存就能跑。在 RTX 4090 上生成約 5 秒 480P 視頻,官方參考時間約 4 分鐘。1.3B 也能嘗試 720P,但官方說明 720P 穩定性不如 480P。

用戶輸入提示詞後,Wan2.1 先用 T5 編碼器把文字變成語義向量。語義向量會描述畫面內容、主體動作、場景、鏡頭運動、畫面風格、光線和色彩。

後續每個 Transformer Block 會通過 Cross-Attention,也就是交叉注意力,把文字語義注入視頻生成過程。Wan2.1 支持多語言輸入,官方尤其強調中文和英文提示詞能力。

阿里 Wan2.1 本地部署教程 – 8G 顯存可文生視頻 

Wan2.1 還支持提示詞擴寫。比如你寫:

一隻貓在廚房做蛋糕。

擴寫模型可以補充貓的外觀、廚房環境、製作動作、鏡頭距離、光照、風格和動作順序。

但實際寫提示詞時,推薦的結構是:

主體 + 動作 + 場景 + 鏡頭 + 光線 + 風格 + 運動節奏。

比如:

一名穿黃色雨衣的女孩站在雨夜街頭,緩緩轉頭看向鏡頭,遠處車輛駛過,霓虹燈倒映在積水中。鏡頭從中景緩慢向前推進,淺景深,寫實電影風格,冷藍色調。

Wan2.1 採用 Diffusion Transformer,生成過程可以粗略理解爲:

  • 創建一段隨機噪聲。
  • 模型根據提示詞判斷噪聲裏應該出現什麼。
  • 多次迭代去噪。
  • 逐步形成主體、背景和動作。
  • VAE 把潛變量解碼成視頻。

 

02. 項目實測

 

運行 Wan2.1 前,需要先準備對應的 Python 環境。官方依賴主要包括:

  • PyTorch ≥ 2.4.0
  • torchvision ≥ 0.19.0
  • Diffusers ≥ 0.31.0
  • Transformers ≥ 4.49.0
  • Accelerate
  • Flash Attention
  • Gradio
  • OpenCV
  • NumPy 1.x

基礎安裝方式如下,以 Windows PowerShell 爲例:

1  Set-Location "想安裝 Wan 2.1的文件夾路徑"
2  git clone https://github.com/Wan-Video/Wan2.1.git
3  Set-Location .\Wan2.1
4  
5  python -m venv .venv
6  .\.venv\Scripts\python.exe -m pip install --upgrade pip
7  .\.venv\Scripts\python.exe -m pip install -r requirements.txt

這裏的 .venv 是 Wan2.1 項目自己的 Python 虛擬環境,後續安裝依賴和運行腳本,都建議使用 .venv 裏的 Python,避免污染系統 Python 環境。

然後下載 1.3B 模型:

1  Set-Location "Wan 2.1的文件夾路徑"
2  .\.venv\Scripts\python.exe -m pip install "huggingface_hub[cli]"
3  
4  .\.venv\Scripts\huggingface-cli.exe download Wan-AI/Wan2.1-T2V-1.3B `
5    --local-dir .\Wan2.1-T2V-1.3B

安裝完之後進入 Wan2.1 項目目錄的 .venv 虛擬環境就可以用了,PowerShell 裏按以下格式輸入:

Set-Location "Wan 2.1的文件夾路徑"
# 進入 Wan2.1 項目目錄。後面的模型路徑、輸出路徑、generate.py 都基於這個目錄執行。

New-Item -ItemType Directory -Force .\outputs
# 創建 outputs 輸出文件夾。如果文件夾已經存在,-Force 會讓 PowerShell 繼續執行,不報錯。

.\.venv\Scripts\python.exe generate.py `
# 使用 Wan2.1 項目裏的 .venv 虛擬環境 Python,運行 generate.py 生成腳本。末尾的 ` 表示命令還沒結束,下一行繼續。

  --task t2v-1.3B `
# 指定任務類型。t2v 表示文生視頻,1.3B 表示使用 13 億參數版本。

  --size 832*480 `
# 設置視頻分辨率。這裏是寬 832、高 480,也就是 480P 橫屏。

  --frame_num 65 `
# 設置生成幀數。Wan2.1 通常按 16 FPS 導出,65 幀大約是 4 秒。

  --ckpt_dir .\Wan2.1-T2V-1.3B `
# 指定模型權重目錄,也就是下載好的 Wan2.1-T2V-1.3B 文件夾。

  --offload_model True `
# 開啓模型卸載,把暫時不用的模型部分放到 CPU 內存裏,降低顯存壓力,但會變慢。

  --t5_cpu `
# 讓 T5 文本編碼器在 CPU 上運行,省顯存。T5 負責理解提示詞。

  --sample_steps 20 `
# 設置採樣步數。步數越高通常畫面更穩,但耗時更久。20 步比較適合質量和速度平衡。

  --sample_shift 8 `
# 控制採樣過程的時間分佈。1.3B 常用 8 到 12,8 是比較穩的默認選擇。

  --sample_guide_scale 6 `
# 控制提示詞引導強度。數值越高越聽提示詞,但太高可能讓畫面變硬或變形。1.3B 用 6 比較穩。

  --save_file .\outputs\moonlit_train_window.mp4 `
# 指定輸出視頻文件名和保存位置。這裏會保存到 outputs 文件夾裏。

  --prompt "提示詞放這裏"
# 視頻提示詞。描述主體、場景、動作、鏡頭、光線、風格和運動節奏。這個也要這種格式

我們做第一個 case 的時候先用小一點幀數,慢慢去測試我們機器的上限在哪裏。

Wan2.1 默認導出通常是 16 FPS,所以:65 幀 ÷ 16 FPS ≈ 4 秒。

常見參考:33 幀 ≈ 2 秒49 幀 ≈ 3 秒65 幀 ≈ 4 秒81 幀 ≈ 5 秒。

case 1 33 幀,採樣步數12

PowerShell 輸入:

Set-Location “D:\360MoveData\Users\win\Desktop\蒸餾\Wan2.1”

.\.venv\Scripts\python.exe generate.py `

–task t2v-1.3B `

–size 832*480 `

–frame_num 33 `

–ckpt_dir .\Wan2.1-T2V-1.3B `

–offload_model True `

–t5_cpu `

–sample_steps 12 `

–sample_shift 8 `

–sample_guide_scale 6 `

–save_file .\outputs\quick_test.mp4 `

–prompt “A small robot walking through a rainy neon street, cinematic lighting.”

可以看到 33 幀,12 步時主體已經可以明確了,機器人形體基本穩定,霓虹街道和溼地反光都出來了。問題是畫面比較空,雨感不明顯,機器人動作很僵。

case 2 33 幀,採樣步數20

PowerShell 輸入:

.\.venv\Scripts\python.exe generate.py `

–task t2v-1.3B `

–size 832*480 `

–frame_num 33 `

–ckpt_dir .\Wan2.1-T2V-1.3B `

–offload_model True `

–t5_cpu `

–sample_steps 20 `

–sample_shift 8 `

–sample_guide_scale 6 `

–save_file .\outputs\robot_neon_street.mp4 `

–prompt “A small friendly robot walking alone through a rainy neon street at night, wet asphalt reflecting red and blue signs, soft steam rising from street vents, cinematic cyberpunk atmosphere, low-angle tracking shot, slow camera movement, detailed metal body, glowing eyes, realistic rain, volumetric lighting, shallow depth of field, high detail, smooth motion, 35mm film look”

比之前的畫面明顯更好了。紅藍霓虹、溼路面、夜景氛圍都更穩,機器人居中,主體識別度很好。但 2 秒太短,動作幅度不夠,機器人更像站在街上輕微移動,不太像“walking through”。

case 3 49 幀,採樣步數 20

PowerShell 輸入:

Set-Location “D:\360MoveData\Users\win\Desktop\蒸餾\Wan2.1”

 

.\.venv\Scripts\python.exe generate.py `

–task t2v-1.3B `

–size 832*480 `

–frame_num 49 `

–ckpt_dir .\Wan2.1-T2V-1.3B `

–offload_model True `

–t5_cpu `

–sample_steps 20 `

–sample_shift 8 `

–sample_guide_scale 6 `

–save_file .\outputs\robot_neon_street_v2.mp4 `

–prompt “A cinematic 3-second video of a small friendly robot walking alone through a rain-soaked neon street at night. The robot has a compact metal body, round glowing eyes, and subtle reflections on its wet surface. Red, blue, and purple neon signs reflect on the asphalt. Light rain falls through the frame, steam rises from street vents, and distant shop lights glow softly in the background. Low-angle tracking shot, slow forward camera movement, realistic rain, volumetric lighting, shallow depth of field, smooth walking motion, detailed cyberpunk street, moody atmosphere, 35mm film look, high detail.”

這版空間感已經出來了。霧氣、地面反光、遠處店鋪燈光都更完整,機器人和環境融合得也更自然。3.06 秒比前兩個運動起來更舒服一些,畫面更像一個完整鏡頭。

case 4 65 幀,採樣步數 20

PowerShell 輸入:

Set-Location “D:\360MoveData\Users\win\Desktop\蒸餾\Wan2.1”

 

.\.venv\Scripts\python.exe generate.py `

–task t2v-1.3B `

–size 832*480 `

–frame_num 65 `

–ckpt_dir .\Wan2.1-T2V-1.3B `

–offload_model True `

–t5_cpu `

–sample_steps 20 `

–sample_shift 8 `

–sample_guide_scale 6 `

–save_file .\outputs\moonlit_train_window.mp4 `

–prompt “A cinematic 4-second video seen from inside an old night train. A young traveler sits beside a rain-covered window, watching a quiet countryside pass by under moonlight. Reflections of warm carriage lamps shimmer on the glass. Outside the window, distant trees, small houses, and silver mist slide slowly across the frame. The camera begins with a close-up of raindrops on the window, then gently shifts focus to the traveler’s calm face and the moving landscape beyond. Soft film grain, realistic rain, warm interior light, cool blue moonlight outside, slow emotional camera movement, shallow depth of field, natural motion, detailed train cabin, quiet poetic atmosphere, 35mm film look, high detail.”

這條時間長了,敘事感也好起來了。車廂內暖光、窗外冷藍色、雨滴和旅人側臉都很到位,人物沒有明顯變形,整體很穩定。但是跑了很久,說明我機器的上限基本就在這了。

 

03. 挖一挖

 

AI 視頻已經不是單純的嚐鮮工具。

Goldman Sachs 預測,創作者經濟規模可能從約 2500 億美元增長到 2027 年的 4800 億美元。視頻內容需求在漲,但對創作者來說,最大的壓力還是成本、試錯次數和生產速度。

Wan2.1 不能替代專業視頻團隊,也不能保證每條一次成片,但 Wan2.1-T2V-1.3B 把文生視頻這件事從按秒付費的平台,拉回到本地顯卡可以反覆測試的工作流裏。提示詞可以慢慢改,參數可以自己調,失敗成本也低很多。

Grand View Research 預計,全球 AI 視頻生成市場會從 2025 年的 7.885 億美元增長到 2033 年的 34.416 億美元,年複合增長率約 20.3%。

阿里 Wan2.1 本地部署教程 – 8G 顯存可文生視頻 

Wan2.1 適合放在真實生產鏈路的前段:先用低成本生成樣片、驗證鏡頭、測試提示詞和風格,再決定哪些片段值得精修、剪輯、補幀或交給更貴的商業模型處理。

Wan2.1把過去昂貴、低頻、靠預算堆出來的視頻試錯,變成普通電腦也能參與的日常生產流程。

原文鏈接:GitHub 狂攬 16K Stars, 8G 顯存就能本地文生視頻

© 版權聲明

相關文章

暫無評論

暫無評論...