UniWorld-View – 兔展智能聯合北大等開源的世界模型

AI工具3天前發佈新公告 AI管理員
0 0

UniWorld-View是什麼

UniWorld-View 是兔展智能聯合北京大學、鵬城實驗室推出的開源世界模型,登頂李飛飛團隊 WorldScore 世界模型評測榜單。模型基於單張圖片或一段視頻,可按指定相機軌跡生成新視角畫面,實現單圖 3D 生成與視頻 4D 生成的統一架構,已完成國產昇騰算力適配,代碼與權重均開源。

UniWorld-View – 兔展智能聯合北大等開源的世界模型

UniWorld-View的主要功能

  • 單圖新視角合成:輸入單張圖片,按指定相機路徑生成多視角畫面,支持推、拉、搖、移及 360° 環繞。
  • 動態視頻新視角合成:輸入單目視頻,推斷未拍攝空間並生成新視角動態視頻,保持時序一致性。
  • 統一生成框架:同一套模型與代碼同時支持靜態圖像與動態視頻的新視角生成任務。
  • 相機軌跡控制:支持精確的相機位姿控制,實現大基線視角切換。

UniWorld-View的技術原理

  • 遮擋感知點雲渲染:針對點雲渲染中前景背景撕裂與背面漏光問題,提出雙重投影與法向過濾機制。
  • 雙重投影(Double-Reprojection):將源畫面投影至目標視角後原路回投,無法回返的像素即爲被遮擋區域,逐幀累積爲遮擋 mask,避免錯誤紋理誤導生成模型。
  • 法向過濾(Normal-Filtering):用法向信息剔除背麪點雲,防止相機繞至物體背後時正面像素穿透泄漏。
  • 幾何與生成融合:先用幾何模型構建 3D 點雲並渲染目標視角條件圖,再輸入視頻擴散模型完成生成,兼顧相機控制精度與畫面質量。

UniWorld-View – 兔展智能聯合北大等開源的世界模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用UniWorld-View

  • 環境準備:克隆 GitHub 倉庫,配置 Python 環境並安裝依賴。
  • 模型下載:從 Hugging Face 或 GitHub Release 下載開源權重。
  • 數據輸入:準備單張圖片或一段視頻作爲源素材,並定義目標相機軌跡。
  • 運行推理:執行推理腳本,模型將自動生成指定視角的新畫面或視頻。
  • 昇騰部署:如需國產算力,按官方文檔完成昇騰 NPU 適配與推理加速。

UniWorld-View的項目地址

  • GitHub倉庫:https://github.com/PKU-YuanGroup/UniWorld-View
  • HuggingFace模型庫:https://huggingface.co/Drexubery/UniView

UniWorld-View的同類競品對比

維度 UniWorld-View WorldScape-0.2(MoE)
WorldScore 總分 多項第一(靜態 85.53 / 相機控制 97.72 / 3D 一致性 91.63) 動態 76.23 略高,其餘維度落後
技術路線 遮擋感知點雲渲染 + 視頻擴散模型 MoE 架構生成路線
開源情況 代碼與權重全開源 未明確全開源
國產算力 已適配昇騰 未提及
任務統一性 單模型覆蓋單圖 3D 與視頻 4D 專注世界生成

UniWorld-View的應用場景

  • 影視與廣告製作:快速生成場景的多機位預覽,降低實拍與三維重建成本。
  • 虛擬現實與遊戲:基於單張概念圖或視頻生成可交互的 360° 環繞場景。
  • 機器人與自動駕駛仿真:構建真實世界的新視角數據,用於訓練視覺感知與路徑規劃模型。
  • 文化遺產數字化:對文物或古建築進行單圖/單視頻採集後,生成環繞視角的數字化展示。
  • 電商與房地產:通過單張商品圖或房間視頻,生成多角度展示內容,提升用戶沉浸感。
© 版權聲明

相關文章

暫無評論

暫無評論...