HunyuanWorld-Voyager – 騰訊推出的超長漫遊世界模型

AI工具1年前 (2025)發佈新公告 AI管理員
0 0

HunyuanWorld-Voyager是什麼

HunyuanWorld-Voyager(簡稱混元Voyager)是騰訊推出的業界首個支持原生3D重建的超長漫遊世界模型。是新穎的視頻擴散框架,能從單張圖片生成用戶定義相機路徑的3D點雲序列,支持沿着自定義相機軌跡進行世界探索的3D一致場景視頻生成,可生成對齊的深度和RGB視頻,用於高效直接的3D重建。模型包含兩個關鍵組件:世界一致視頻擴散和長距離世界探索,通過高效的點剔除和自迴歸推理實現迭代場景擴展。提出了可擴展的數據引擎,用於生成RGB-D視頻訓練的可擴展數據。在WorldScore基準測試中,Voyager在多個指標上均取得了優異的成績,展現了其強大的性能。

HunyuanWorld-Voyager – 騰訊推出的超長漫遊世界模型

HunyuanWorld-Voyager的主要功能

  • 從單張圖片生成3D點雲序列:能根據用戶定義的相機路徑,從單張圖片生成3D一致的點雲序列,支持長距離的世界探索。
  • 生成3D一致的場景視頻:可以沿着用戶自定義的相機軌跡生成3D一致的場景視頻,爲用戶提供沉浸式的3D場景漫遊體驗。
  • 支持實時3D重建:生成的RGB和深度視頻可直接用於高效的3D重建,無需額外的重建工具,實現從視頻到3D模型的快速轉換。
  • 多種應用場景支持:適用於視頻重建、圖像到3D生成、視頻深度估計等多種3D理解和生成任務,具有廣泛的應用前景。
  • 強大的性能表現:在斯坦福大學發佈的WorldScore基準測試中,HunyuanWorld-Voyager在多個關鍵指標上均取得了優異的成績,展現了其在3D場景生成和視頻擴散方面的強大能力。

HunyuanWorld-Voyager的技術原理

  • 世界一致視頻擴散:模型採用統一的架構,聯合生成對齊的RGB和深度視頻序列,通過條件於現有的世界觀察來確保全局一致性。
  • 長距離世界探索:利用高效的點剔除技術和自迴歸推理,結合平滑的視頻採樣,實現迭代場景擴展,同時保持上下文感知的一致性。
  • 可擴展的數據引擎:提出了一個視頻重建管道,自動化地進行相機姿態估計和度量深度預測,能夠爲任意視頻生成大規模、多樣化的訓練數據,無需手動3D註釋。
  • 自迴歸推理與世界緩存機制:通過高效的點剔除和自迴歸推理,結合世界緩存機制,實現迭代場景擴展,維持幾何一致性,支持任意相機軌跡。
  • 高效的3D重建:生成的RGB和深度視頻可直接用於高效的3D重建,無需額外的重建工具,實現從視頻到3D模型的快速轉換。

HunyuanWorld-Voyager的項目地址

  • 項目官網:https://3d-models.hunyuan.tencent.com/world/
  • Github倉庫:https://github.com/Tencent-Hunyuan/HunyuanWorld-Voyager
  • Hugging Face模型庫:https://huggingface.co/tencent/HunyuanWorld-Voyager
  • 技術報告:https://3d-models.hunyuan.tencent.com/voyager/voyager_en/assets/HYWorld_Voyager.pdf

HunyuanWorld-Voyager的應用場景

  • 視頻重建:通過生成對齊的RGB和深度視頻,實現高效且直接的3D重建,無需額外的重建工具。
  • 圖像到3D生成:從單張圖片生成3D一致的點雲序列,支持從2D圖像到3D場景的轉換,可用於虛擬場景的快速構建。
  • 視頻深度估計:生成與RGB視頻對齊的深度信息,可用於視頻分析和3D理解任務。
  • 虛擬現實(VR)和增強現實(AR):生成的3D場景和視頻可用於創建沉浸式的VR體驗或增強現實應用。
  • 遊戲開發:生成的3D場景資產可無縫接入主流遊戲引擎,爲遊戲開發提供豐富的創意和內容支持。
  • 3D建模和動畫:生成的3D點雲和視頻可作爲3D建模和動畫製作的輸入,提高創作效率。
© 版權聲明

相關文章

暫無評論

暫無評論...