H3-World是什麼
H3-World是騰訊聯合新加坡國立大學、香港理工大學推出的動作可控世界模型,基於33B的MiniMax-H3視頻生成器微調。模型將鍵盤操作翻譯成英文指令,通過預訓練文本通路注入模型,並藉助時間注意力路由把每條指令綁定到對應視頻幀,實現精確的時間對齊控制。H3-World僅用8000條遊戲視頻、rank-32 LoRA微調0.199%參數,可讓模型按鍵盤輸入實時生成可控畫面,並泛化到未見場景,是通往交互式生成世界的重要一步。

H3-World的主要功能
- 鍵盤動作轉視頻控制:將鍵盤輸入的角色移動和相機操作轉化爲對應的視頻畫面變化,實現”按鍵即操控”的交互式世界模擬。
- 時間精確控制:可在同一視頻的不同時間段執行不同動作指令,精確控制動作發生的時間。
- 多環境泛化:從遊戲畫面訓練出發,能泛化到霓虹都市、沙漠綠洲、奇幻教堂等多樣視覺環境,保持場景內容穩定。
- 組合動作泛化:能將訓練中見過的角色/相機動作基元組合成從未出現過的動作對,實現組合泛化控制。
- 長時程生成:支持更長時序的連續可控視頻生成,動作指令可持續驅動畫面演進。
H3-World的技術原理
- 動作語言化表示:把每一幀的鍵盤操作翻譯成一句簡短英文指令(如”strafe left”),讓動作用自然語言形式存在。
- 複用預訓練文本通路:指令通過 MiniMax-H3 原有的文本編碼路徑注入模型,直接複用視頻預訓練階段學到的語義表示,因此模型天然理解動作含義,無需從頭學習動作編碼。
- 時間注意力路由:通過定向注意力掩碼將每條指令與其對應的視頻潛變量幀綁定,把指令作用限制在預定時間區間內,避免相鄰動作之間的控制泄露,這是實現時間精確控制的關鍵。
- 輕量 LoRA 微調:僅在 H3 自注意力投影上訓練一個 rank-32 LoRA,用 0.199% 的可訓練參數、8000 條遊戲視頻、10000 步優化完成適配,大幅降低把視頻生成器改造爲世界模型的成本。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用H3-World
方式一:在線體驗
-
打開 Hugging Face 上的交互式演示 Space(hugging-apps/h3-world-action-demo),無需下載 135GB 權重即可體驗鍵盤驅動控制。
-
上傳或選擇一張初始幀圖片,並輸入場景描述 prompt。
-
通過預設動作或鍵盤按鍵(角色移動 + 相機操作)輸入控制指令。
-
模型實時生成約 5.2 秒、832×480 的可控視頻片段。
方式二:本地部署
-
環境準備:創建 Python 3.10 + CUDA 12.8 的 conda 環境,安裝 PyTorch 2.10 及 requirements.txt 依賴。
-
獲取代碼:克隆 H3-World 官方倉庫,並克隆 DiffSynth-Studio 到指定目錄、切換到指定 commit 後打上官方 attention 補丁(不可省略,否則 LoRA 無效)。
-
下載權重:從 Hugging Face 下載 MiniMax-H3 基座權重(約 135GB)和 H3-World LoRA(step-10000.safetensors)放到倉庫對應目錄。
-
配置緩存:運行 env.sh 將 Hugging Face、Torch、Triton 緩存指向倉庫內。
-
運行推理:提供首幀圖像、靜態語義條件和時間表式的動作序列(每段對應一句角色/相機指令)。
-
生成結果:模型按動作時間表生成對應時序的視頻潛變量並解碼輸出,可自迴歸擴展更長時程。
H3-World的核心優勢
- 零新增模塊的優雅設計:直接複用預訓練文本通路,把動作控制問題轉化爲模型本就擅長的語言理解問題。
- 極致輕量的訓練成本:僅用 8000 條遊戲視頻、10000 步優化、rank-32 LoRA 微調 0.199% 參數,解鎖 33B 模型的交互控制能力。
- 時間精確的控制能力:通過時間注意力路由,能在同一視頻中按時間表執行不同動作,解決全局 prompt 無法精確控制動作時機的痛點。
- 顯著優於傳統條件注入方式:相比 additive-bias、FiLM 等直接動作條件方法,語言接地的方式能產生協調的角色+相機運動,且不破壞場景內容。
- 強大的組合泛化能力:能將訓練中見過的動作基元組合成從未出現過的動作對,泛化到分佈外的視覺環境。
- 通用性強:單一模型可處理第一/第三人稱、角色移動與相機運動等多種控制類型,無需針對不同任務分別訓練。
H3-World的項目地址
- 項目官網:https://danzer1xxxxchan.github.io/H3-World/
- GitHub倉庫:https://github.com/Danzer1xxxxChan/H3-World
- HuggingFace模型庫:https://modelscope.cn/models/DANNY621/H3-World
- 技術論文:https://modelscope.cn/papers/2609.01560
H3-World的同類競品對比
| 對比維度 | H3-World | Genie 3 |
|---|---|---|
| 技術路線 | 基於已有 33B 視頻生成器(MiniMax-H3)微調,複用預訓練文本通路 | 從零訓練的自迴歸世界模型(約 10 億參數級) |
| 動作接口 | 鍵盤動作翻譯爲英文指令,走文本通路注入 | 鍵盤/動作向量直接作爲動作 token 輸入 |
| 訓練成本 | 極低:8000 條遊戲視頻、rank-32 LoRA、僅 0.199% 參數可訓練 | 高:大規模互聯網視頻自迴歸預訓練 |
| 時間精確控制 | 強:時間注意力路由實現逐幀/分時段精確綁定 | 較弱:實時響應快但按時間表切換動作能力有限 |
| 生成質量基座 | 繼承 MiniMax-H3 的高質量生成能力 | 自有生成基座,畫質與物理一致性已優化 |
| 泛化方式 | 組合泛化:動作基元組合到未見場景 | 多樣化互聯網視頻帶來的廣泛場景覆蓋 |
H3-World的應用場景
-
遊戲原型開發:設計師輸入初始畫面即可實時”遊玩”虛擬場景,快速驗證關卡概念和鏡頭語言,無需先建完整遊戲引擎。
-
AI Agent 訓練沙盒:爲具身智能體提供可交互的虛擬環境,agent 通過鍵盤動作探索世界並獲得視覺反饋,降低真實世界訓練成本。
-
影視與動畫預演:導演用鍵盤操控虛擬相機運鏡(搖、移、升降),實時生成分鏡預覽,大幅壓縮前期 previz 製作週期。
-
機器人操作策略驗證:將機械臂/無人機的移動指令映射爲動作語言,在生成的仿真環境中測試動作序列的時序合理性。
-
沉浸式內容創作:結合 VR/遊戲交互,讓用戶用自然按鍵方式驅動個性化虛擬世界演進的 UGC 工具,人人可生成”可玩的視頻”。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...