WorldClaw – 騰訊混元團隊推出的 3D 世界生成框架

AI工具1個月前發佈新公告 AI管理員
1 0

WorldClaw是什麼

WorldClaw是騰訊混元團隊推出的Agent驅動開放世界3D生成框架。用戶輸入一句自然語言描述,系統可自動規劃地形、區域、建築、物體與空間關係,採用全局到局部的生成策略,在Blender中構建出可自由探索且支持逐對象編輯的完整3D場景。框架由Claude Opus、GPT-Image-2、SAM3及Hunyuan3D等多模型協同驅動,具備視覺Agent自檢修復能力,可自動修正懸空、穿模等接觸問題。

WorldClaw – 騰訊混元團隊推出的 3D 世界生成框架

WorldClaw的主要功能

  • 智能場景規劃:規劃Agent分析用戶描述,將開放式提示詞轉換爲包含區域、地形、物體、材質及空間關係的結構化場景規格。
  • 全局到局部生成:先建立世界地形與空間框架,再逐步填充各區域細節,避免道路斷裂與尺度失衡。
  • 獨立資產生成:建築、植被、車輛等對象保持獨立實例,非單一烘焙模型,支持單獨移動、替換與編輯。
  • 視覺自檢與修復:視覺Agent多視角渲染檢查比例、姿勢與接觸問題,自動修復物體懸空、穿模等缺陷。
  • Blender深度整合:地形生成、資產生成、場景擺放、檢查與渲染全流程運行於Blender 5.1.1,支持MCP接口操作。

WorldClaw的技術原理

  • 多Agent協同架構:系統由規劃Agent、場景優化Agent和視覺檢查Agent組成,分別負責場景設計、Blender操作與質量驗證。
  • 多模型分工:Claude Opus 4.8作爲Agent基礎模型,GPT-Image-2負責圖像生成,SAM3/SAM3D負責分割,Hunyuan3D負責3D重建與資產生成。
  • Coarse-to-Fine生成策略:先生成語義高度場確定地形骨架,按區域生成物體組成方案,最後獨立重建各3D資產並組合。
  • 局部修復機制:針對接觸問題僅修改對應支撐區域,避免破壞整體地貌結構。

如何使用WorldClaw

  • 輸入描述:用自然語言描述想要的開放世界場景。
  • 智能規劃:規劃Agent自動拆解提示詞,生成包含區域、地形、物體與空間關係的結構化場景規格。
  • 地形骨架生成:系統生成帶語義的高度場,確定山峯、河流、海岸等地形區域的空間基礎。
  • 區域資產生成:按區域分別生成建築、植被、車輛等獨立3D資產,並擺放到對應位置。
  • 視覺檢查修復:視覺Agent多視角渲染檢查,自動修復比例異常、懸空、穿模等問題。
  • 導出編輯:在Blender中獲取完整場景,自由調整對象位置、替換資產或修改材質。

WorldClaw的核心優勢

  • 從提示詞到完整世界:一句自然語言描述,可自動規劃並生成包含地形、建築、植被、設施的完整可探索3D場景,無需人工逐資產建模。
  • 獨立可編輯資產:所有對象保持獨立紋理Mesh和實例,支持單獨移動、替換、修改材質,無需重新生成整個世界。
  • 智能自檢修復:視覺Agent主動檢查比例、姿勢與接觸問題,自動修復懸空、穿模等常見3D缺陷,提升生成質量。
  • 深度Blender集成:全流程運行於Blender 5.1.1,支持MCP接口直接操作,便於接入現有3D工作流。

WorldClaw的項目地址

  • 項目官網:https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw/
  • arXiv技術論文:https://arxiv.org/pdf/2608.05248

WorldClaw的同類競品對比

維度 WorldClaw(騰訊混元) Lyra 2.0(NVIDIA)
輸入方式 自然語言提示詞 單張圖像 + 自定義相機軌跡(可選文本引導)
核心驅動 多Agent協同(規劃+場景優化+視覺檢查) 生成式重建管線(視頻生成→3D重建)
生成策略 Coarse-to-Fine:先全局地形骨架,再逐區域生成獨立資產 自迴歸視頻生成 + 前饋3D Gaussian Splatting重建
一致性保障 Agent規劃全局結構 + 視覺Agent多視角檢查修復 逐幀3D幾何記憶路由(抗空間遺忘)+ 自增強漂移修正(抗時間漂移)
資產生成 原生生成建築、植被、車輛等獨立Mesh實例 從生成視頻重建爲3D Gaussians與表面Mesh
可編輯性 獨立對象級編輯,支持移動、替換、改材質 可導出Mesh到仿真引擎,對象級編輯能力有限
地形系統 語義高度場生成複雜開放地形(山峯、峽谷、河流) 從單圖擴展,支持大規模室內外場景,無顯式地形骨架
引擎集成 深度整合Blender 5.1.1(MCP接口直接操作) 可導出至NVIDIA Isaac Sim等物理仿真引擎
底層模型 Claude Opus 4.8 + GPT-Image-2 + SAM3 + Hunyuan3D 基於Wan 2.1-14B DiT視頻擴散模型

WorldClaw的應用場景

  • 遊戲原型開發:快速生成開放世界關卡白模與概念場景,加速前期玩法驗證與迭代。
  • 影視虛擬製片:構建大型外景虛擬環境,支持導演進行鏡頭預覽與數字資產預演。
  • VR/AR體驗設計:生成可自由探索的沉浸式3D空間,用於虛擬旅遊、培訓模擬或展覽。
  • 建築與城市規劃:可視化大規模區域規劃方案,直觀展示地形、建築與公共設施佈局。
  • 3D創意概念藝術:爲設計師提供可編輯的完整場景基底,顯著降低從零手動搭建成本。
© 版權聲明

相關文章

暫無評論

暫無評論...