UniWorld-View是什麼
UniWorld-View 是兔展智能聯合北京大學、鵬城實驗室推出的開源世界模型,登頂李飛飛團隊 WorldScore 世界模型評測榜單。模型基於單張圖片或一段視頻,可按指定相機軌跡生成新視角畫面,實現單圖 3D 生成與視頻 4D 生成的統一架構,已完成國產昇騰算力適配,代碼與權重均開源。

UniWorld-View的主要功能
-
單圖新視角合成:輸入單張圖片,按指定相機路徑生成多視角畫面,支持推、拉、搖、移及 360° 環繞。
-
動態視頻新視角合成:輸入單目視頻,推斷未拍攝空間並生成新視角動態視頻,保持時序一致性。
-
統一生成框架:同一套模型與代碼同時支持靜態圖像與動態視頻的新視角生成任務。
-
相機軌跡控制:支持精確的相機位姿控制,實現大基線視角切換。
UniWorld-View的技術原理
-
遮擋感知點雲渲染:針對點雲渲染中前景背景撕裂與背面漏光問題,提出雙重投影與法向過濾機制。
-
雙重投影(Double-Reprojection):將源畫面投影至目標視角後原路回投,無法回返的像素即爲被遮擋區域,逐幀累積爲遮擋 mask,避免錯誤紋理誤導生成模型。
-
法向過濾(Normal-Filtering):用法向信息剔除背麪點雲,防止相機繞至物體背後時正面像素穿透泄漏。
-
幾何與生成融合:先用幾何模型構建 3D 點雲並渲染目標視角條件圖,再輸入視頻擴散模型完成生成,兼顧相機控制精度與畫面質量。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用UniWorld-View
-
環境準備:克隆 GitHub 倉庫,配置 Python 環境並安裝依賴。
-
模型下載:從 Hugging Face 或 GitHub Release 下載開源權重。
-
數據輸入:準備單張圖片或一段視頻作爲源素材,並定義目標相機軌跡。
-
運行推理:執行推理腳本,模型將自動生成指定視角的新畫面或視頻。
-
昇騰部署:如需國產算力,按官方文檔完成昇騰 NPU 適配與推理加速。
UniWorld-View的項目地址
- GitHub倉庫:https://github.com/PKU-YuanGroup/UniWorld-View
- HuggingFace模型庫:https://huggingface.co/Drexubery/UniView
UniWorld-View的同類競品對比
| 維度 | UniWorld-View | WorldScape-0.2(MoE) |
|---|---|---|
| WorldScore 總分 | 多項第一(靜態 85.53 / 相機控制 97.72 / 3D 一致性 91.63) | 動態 76.23 略高,其餘維度落後 |
| 技術路線 | 遮擋感知點雲渲染 + 視頻擴散模型 | MoE 架構生成路線 |
| 開源情況 | 代碼與權重全開源 | 未明確全開源 |
| 國產算力 | 已適配昇騰 | 未提及 |
| 任務統一性 | 單模型覆蓋單圖 3D 與視頻 4D | 專注世界生成 |
UniWorld-View的應用場景
-
影視與廣告製作:快速生成場景的多機位預覽,降低實拍與三維重建成本。
-
虛擬現實與遊戲:基於單張概念圖或視頻生成可交互的 360° 環繞場景。
-
機器人與自動駕駛仿真:構建真實世界的新視角數據,用於訓練視覺感知與路徑規劃模型。
-
文化遺產數字化:對文物或古建築進行單圖/單視頻採集後,生成環繞視角的數字化展示。
-
電商與房地產:通過單張商品圖或房間視頻,生成多角度展示內容,提升用戶沉浸感。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...