HOMIE – 香港科技大學開源的數字人視頻生成框架

AI工具1個月前發佈新公告 AI管理員
0 0

HOMIE是什麼

HOMIE 是香港科技大學開源的數字人視頻生成框架,基於 Wan2.1-T2V-14B 骨幹網絡並集成 Qwen3-VL 多模態大模型。框架能統一處理數字人+商品+Logo+文字四要素,精準解決人-物交互、品牌貼牌、OCR文字保真和多視角一致性四大難題。模型訓練僅需 5.5K 步/約 1 萬 A100 小時,OCR 準確率比開源最強模型提升 38.7%,支持 480P 單卡到 720P 多卡推理,大幅降低電商帶貨、虛擬主播等場景的視頻製作門檻。

HOMIE – 香港科技大學開源的數字人視頻生成框架

HOMIE的主要功能

  • 人-物交互視頻個性化:支持多個人物與多種物體同時出現在同一視頻中,保持每個主體的外觀一致性,並實現自然、合理的交互動作(如手持、展示、傳遞商品等)。
  • Logo / 抽象概念精準貼附:用多模態大模型(MLLM)的語義推理能力,自動將品牌Logo等抽象概念貼附到語義最相關的物體上,無需在提示詞中顯式描述位置關係。
  • OCR 文字高保真生成:配合 OCR 參考圖,確保產品包裝、標籤上的文字在生成視頻中清晰可讀、不模糊、不串字,解決 AI 視頻生成中”文字糊成一團”的痛點。
  • 多視角一致性生成:給定同一物體的多視角參考圖,當物體在視頻中發生旋轉或運動時,能保持一致的外觀和細節,適用於手辦、3D模型、玩偶等展示場景。

HOMIE的技術原理

  • 整體架構: 阿里 Wan2.1-T2V-14B 的 DiT 爲骨幹,引入 Qwen3-VL-2B-Thinking 作爲視覺理解模塊,配合 UmT5 文本編碼器和 VAE 視覺編碼器,形成”文本+多模態語義+視覺”三路並行的生成架構。
  • MLLM 集成策略: 在不破壞原有文生視頻對齊關係、不產生昂貴重對齊成本的前提下,將多模態大模型的語義推理能力注入 DiT,使模型能自動理解參考圖像之間的潛在關係。
  • 全局多模態自注意力引導(GMG): 在 DiT 的自注意力層中,將 MLLM 提取的語義特徵與 VAE 視覺 token 進行全局對齊,通過投影、池化和仿射變換,讓生成過程中的每個視頻 token 都能”看到”參考圖的全局語義信息。
  • 模態-參考嵌入(MRE): 爲 MLLM 特徵 token 和 VAE 視覺 token 分別賦予模態嵌入,爲不同參考圖像賦予獨立參考嵌入,並將同一主體的多視角/OCR 參考圖 token 關聯起來,避免信息混淆。
  • 三階段漸進訓練: 單主體 480P→ 多主體 480P→ 高清 720P,總計僅 5.5K 步完成訓練,遠低於同類方法的數萬步。

HOMIE – 香港科技大學開源的數字人視頻生成框架

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用HOMIE

  • 環境準備:從 GitHub 克隆 HOMIE 代碼倉庫到本地並完成環境依賴安裝。
  • 權重下載:從 HuggingFace 下載官方發佈的預訓練權重到指定模型目錄。
  • 素材準備:準備參考圖像,包括人物照片、商品圖、Logo 圖或 OCR 文字圖等多主體素材。
  • 提示詞編寫:編寫文本提示詞,準確描述目標視頻中人物與物體之間的交互動作和場景。
  • 運行推理:運行推理腳本,HOMIE 會自動融合多模態參考信息並生成個性化視頻。
  • 分辨率選擇:單卡 GPU 可直接生成 832×480 分辨率視頻,多卡 FSDP 可擴展至 720P 高清輸出。

HOMIE的核心優勢

  • 統一框架:一個框架同時處理人-物交互、Logo 貼牌、OCR 文字保真和多視角一致性四大任務,無需爲不同場景切換不同模型。
  • 訓練高效:僅需 5.5K 步 / 約 1 萬 A100 小時即可完成訓練,成本遠低於同類方法通常所需的 3–4 萬步。
  • MLLM 無損集成:在不犧牲文本編碼器可控性、不產生昂貴重對齊成本的前提下,將多模態大模型的語義推理能力注入視頻生成管線。
  • 質量領先:OCR 準確率相對提升 38.7%,多視角一致性提升 8.2%,40 人用戶研究中 64.7% 將整體質量票選爲第一。
  • 推理靈活:支持 480P 單卡到 720P 多卡推理,並可輸出 1280×720 豎屏視頻,直接適配直播帶貨與短視頻製作。

HOMIE的項目地址

  • 項目官網:https://yiyangcai.github.io/homie-page.github.io
  • GitHub倉庫:https://github.com/YIYANGCAI/HOMIE
  • HuggingFace模型庫:https://huggingface.co/yychai/homie-r2v-wan2.1
  • arXiv技術論文:https://arxiv.org/pdf/2607.18217

HOMIE的同類競品對比

對比維度 HOMIE SkyReels-V3
發佈方 香港科技大學 崑崙萬維
骨幹網絡 Wan2.1-T2V-14B 自研視頻模型
MLLM 集成 Qwen3-VL-2B,保留文本編碼器無損注入 集成 MLLM,但替換文本編碼器
OCR 準確率 0.452(開源最高) 0.326
多視角一致性 (DINOrec) 0.685 0.654
主體一致性 (Face-Sim) 0.786 0.751
Logo 細節保真 能忠實渲染 Logo 細節 Logo 位置正確但細節易模糊
訓練成本 5.5K 步 / ~1 萬 A100 小時 未公開,推測遠高於 HOMIE
開源協議 Apache 2.0(可商用) 開源可商用

HOMIE的應用場景

  • 電商直播帶貨:生成指定數字人手持指定商品做指定動作的帶貨視頻,支持 1280×720 豎屏輸出,直接適配短視頻平台。
  • 品牌廣告製作:自動將品牌 Logo 貼附到語義相關的產品上,無需在提示詞中顯式指定位置關係。
  • 虛擬主播 / 數字人:保持數字人身份一致的同時,與多種商品進行自然交互。
  • 產品多視角展示:給定手辦、3D 模型或玩偶的多視角參考圖,生成旋轉展示視頻,各角度外觀保持一致。
  • 包裝文字保真:配合 OCR 參考圖,確保產品包裝、標籤上的文字在視頻中清晰可讀,適用於食品、化妝品、保健品等需要展示成分/說明的場景。
© 版權聲明

相關文章

暫無評論

暫無評論...