H3-World – 騰訊聯合高校等開源的動作可控世界模型

AI工具3周前發佈新公告 AI管理員
0 0

H3-World是什麼

H3-World是騰訊聯合新加坡國立大學、香港理工大學推出的動作可控世界模型,基於33B的MiniMax-H3視頻生成器微調。模型將鍵盤操作翻譯成英文指令,通過預訓練文本通路注入模型,並藉助時間注意力路由把每條指令綁定到對應視頻幀,實現精確的時間對齊控制。H3-World僅用8000條遊戲視頻、rank-32 LoRA微調0.199%參數,可讓模型按鍵盤輸入實時生成可控畫面,並泛化到未見場景,是通往交互式生成世界的重要一步。

H3-World – 騰訊聯合高校等開源的動作可控世界模型

H3-World的主要功能

  • 鍵盤動作轉視頻控制:將鍵盤輸入的角色移動和相機操作轉化爲對應的視頻畫面變化,實現”按鍵即操控”的交互式世界模擬。
  • 時間精確控制:可在同一視頻的不同時間段執行不同動作指令,精確控制動作發生的時間。
  • 多環境泛化:從遊戲畫面訓練出發,能泛化到霓虹都市、沙漠綠洲、奇幻教堂等多樣視覺環境,保持場景內容穩定。
  • 組合動作泛化:能將訓練中見過的角色/相機動作基元組合成從未出現過的動作對,實現組合泛化控制。
  • 長時程生成:支持更長時序的連續可控視頻生成,動作指令可持續驅動畫面演進。

H3-World的技術原理

  • 動作語言化表示:把每一幀的鍵盤操作翻譯成一句簡短英文指令(如”strafe left”),讓動作用自然語言形式存在。
  • 複用預訓練文本通路:指令通過 MiniMax-H3 原有的文本編碼路徑注入模型,直接複用視頻預訓練階段學到的語義表示,因此模型天然理解動作含義,無需從頭學習動作編碼。
  • 時間注意力路由:通過定向注意力掩碼將每條指令與其對應的視頻潛變量幀綁定,把指令作用限制在預定時間區間內,避免相鄰動作之間的控制泄露,這是實現時間精確控制的關鍵。
  • 輕量 LoRA 微調:僅在 H3 自注意力投影上訓練一個 rank-32 LoRA,用 0.199% 的可訓練參數、8000 條遊戲視頻、10000 步優化完成適配,大幅降低把視頻生成器改造爲世界模型的成本。

H3-World – 騰訊聯合高校等開源的動作可控世界模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用H3-World

方式一:在線體驗

  • 打開 Hugging Face 上的交互式演示 Space(hugging-apps/h3-world-action-demo),無需下載 135GB 權重即可體驗鍵盤驅動控制。
  • 上傳或選擇一張初始幀圖片,並輸入場景描述 prompt。
  • 通過預設動作或鍵盤按鍵(角色移動 + 相機操作)輸入控制指令。
  • 模型實時生成約 5.2 秒、832×480 的可控視頻片段。

方式二:本地部署

  • 環境準備:創建 Python 3.10 + CUDA 12.8 的 conda 環境,安裝 PyTorch 2.10 及 requirements.txt 依賴。
  • 獲取代碼:克隆 H3-World 官方倉庫,並克隆 DiffSynth-Studio 到指定目錄、切換到指定 commit 後打上官方 attention 補丁(不可省略,否則 LoRA 無效)。
  • 下載權重:從 Hugging Face 下載 MiniMax-H3 基座權重(約 135GB)和 H3-World LoRA(step-10000.safetensors)放到倉庫對應目錄。
  • 配置緩存:運行 env.sh 將 Hugging Face、Torch、Triton 緩存指向倉庫內。
  • 運行推理:提供首幀圖像、靜態語義條件和時間表式的動作序列(每段對應一句角色/相機指令)。
  • 生成結果:模型按動作時間表生成對應時序的視頻潛變量並解碼輸出,可自迴歸擴展更長時程。

H3-World的核心優勢

  • 零新增模塊的優雅設計:直接複用預訓練文本通路,把動作控制問題轉化爲模型本就擅長的語言理解問題。
  • 極致輕量的訓練成本:僅用 8000 條遊戲視頻、10000 步優化、rank-32 LoRA 微調 0.199% 參數,解鎖 33B 模型的交互控制能力。
  • 時間精確的控制能力:通過時間注意力路由,能在同一視頻中按時間表執行不同動作,解決全局 prompt 無法精確控制動作時機的痛點。
  • 顯著優於傳統條件注入方式:相比 additive-bias、FiLM 等直接動作條件方法,語言接地的方式能產生協調的角色+相機運動,且不破壞場景內容。
  • 強大的組合泛化能力:能將訓練中見過的動作基元組合成從未出現過的動作對,泛化到分佈外的視覺環境。
  • 通用性強:單一模型可處理第一/第三人稱、角色移動與相機運動等多種控制類型,無需針對不同任務分別訓練。

H3-World的項目地址

  • 項目官網:https://danzer1xxxxchan.github.io/H3-World/
  • GitHub倉庫:https://github.com/Danzer1xxxxChan/H3-World
  • HuggingFace模型庫:https://modelscope.cn/models/DANNY621/H3-World
  • 技術論文:https://modelscope.cn/papers/2609.01560

H3-World的同類競品對比

對比維度 H3-World Genie 3
技術路線 基於已有 33B 視頻生成器(MiniMax-H3)微調,複用預訓練文本通路 從零訓練的自迴歸世界模型(約 10 億參數級)
動作接口 鍵盤動作翻譯爲英文指令,走文本通路注入 鍵盤/動作向量直接作爲動作 token 輸入
訓練成本 極低:8000 條遊戲視頻、rank-32 LoRA、僅 0.199% 參數可訓練 高:大規模互聯網視頻自迴歸預訓練
時間精確控制 強:時間注意力路由實現逐幀/分時段精確綁定 較弱:實時響應快但按時間表切換動作能力有限
生成質量基座 繼承 MiniMax-H3 的高質量生成能力 自有生成基座,畫質與物理一致性已優化
泛化方式 組合泛化:動作基元組合到未見場景 多樣化互聯網視頻帶來的廣泛場景覆蓋

H3-World的應用場景

  • 遊戲原型開發:設計師輸入初始畫面即可實時”遊玩”虛擬場景,快速驗證關卡概念和鏡頭語言,無需先建完整遊戲引擎。
  • AI Agent 訓練沙盒:爲具身智能體提供可交互的虛擬環境,agent 通過鍵盤動作探索世界並獲得視覺反饋,降低真實世界訓練成本。
  • 影視與動畫預演:導演用鍵盤操控虛擬相機運鏡(搖、移、升降),實時生成分鏡預覽,大幅壓縮前期 previz 製作週期。
  • 機器人操作策略驗證:將機械臂/無人機的移動指令映射爲動作語言,在生成的仿真環境中測試動作序列的時序合理性。
  • 沉浸式內容創作:結合 VR/遊戲交互,讓用戶用自然按鍵方式驅動個性化虛擬世界演進的 UGC 工具,人人可生成”可玩的視頻”。
© 版權聲明

相關文章

暫無評論

暫無評論...