Xiaomi Auto World Model是什麼
Xiaomi Auto World Model 是小米汽車推出的輔助駕駛世界模型,首次將三維重建(WorldRec)與視頻生成(WorldGen)深度耦合。WorldRec 用稀疏 3D 錨點實現 10 秒視頻 10 秒快速重建,WorldGen 通過兩階段訓練與 ODE 蒸餾實現 4 步去噪、0.19 秒/幀生成,支持最長 1 分鐘視頻。在 Waymo 重建精度(PSNR 28.48)與 nuScenes 生成質量(FVD 64.97)上均達 SOTA,已落地合成數據、仿真測試、輔助駕駛學堂三大業務場景。

Xiaomi Auto World Model的主要功能
-
WorldRec 三維重建模塊:採用稀疏 3D 查詢錨點替代傳統稠密高斯,實現多視角多時刻特徵聚合與可見性加權融合,10 秒視頻重建僅需 10 秒,消除多視角衝突與鬼影問題。
-
WorldGen 視頻生成模塊:基於全雙向時序注意力預訓練+因果微調兩階段訓練,通過 ODE 蒸餾將去噪步數從 50 步壓縮至 4 步,0.19 秒/幀生成未來幀、未觀測視角與遮擋區內容,支持最長 81 幀(約 1 分鐘)連續生成。
-
重建-生成深度耦合:重建側提供 3D 幾何先驗約束生成穩定性,生成側擴展重建邊界至未觀測時空區域,兩者互相校正抑制長時序漂移。
-
極端場景生成:支持暴雨、大雪、濃霧等極端天氣及動物闖入等長尾危險場景的高質量合成,爲感知模型訓練提供稀缺數據。
-
三大業務落地:合成數據生成(已交付 10 萬+ clips)、閉環仿真測試(復現真實事故定向優化)、輔助駕駛學堂(動態生成第一人稱駕駛教學視頻)。
Xiaomi Auto World Model的技術原理
-
WorldRec 稀疏錨點表徵:摒棄逐像素預測高斯範式,改用稀疏三維查詢點作爲場景表徵,每個錨點主動聚合多相機多時刻特徵,通過可見性加權自動篩選可靠觀測,從源頭保證跨視角一致性。
-
4D Gaussian 全局表示:維護隨觀測增量擴展的 4D 高斯場景表示,投影到自車視角後作爲渲染先驗輸入生成模型,爲生成提供確定性幾何約束。
-
WorldGen 兩階段訓練:第一階段全雙向時序注意力預訓練建立駕駛場景時空全局理解;第二階段因果注意力微調+教師強制(Teacher Forcing),配合 ODE 蒸餾提速 12 倍,分佈匹配蒸餾解決暴露偏差。
-
重建-生成閉環約束:重建的確定性幾何先驗持續校正生成過程,生成補全重建覆蓋不到的時空區域,兩者目標函數在結構上互相約束,實現高穩定性、高一致性、高真實性。
如何使用Xiaomi Auto World Model
-
上線平台:已上線小米全車型的「輔助駕駛學堂 – 實景模擬場景」。
-
使用條件:需擁有小米汽車(SU7 等車型),在車載系統中進入輔助駕駛學堂模塊。
Xiaomi Auto World Model的核心優勢
-
SOTA 性能:Waymo 重建 PSNR 28.48(超 DGGT 約 1 個點),nuScenes 零樣本泛化 PSNR 26.54 同樣領先;生成側 FVD 64.97 超越所有雙向與自迴歸基線模型。
-
極速推理:單視角生成 0.19 秒/幀,三視角 0.46 秒/幀,較同類自迴歸方法 Epona(1.06 秒/幀)快 5.6 倍。
-
超長時序:支持 81 幀連續生成(10Hz/30Hz,最長 1 分鐘),遠超公開基線模型的 8-16 幀限制。
-
零樣本泛化:nuScenes 零樣本測試仍保持領先,證明對新場景具備強適應能力。
-
已落地生產:已在小米汽車合成數據、仿真測試、智能座艙三大核心場景完成業務閉環。
Xiaomi Auto World Model的項目地址
- 項目官網:https://JointWM.github.io/
- arXiv技術論文:https://arxiv.org/pdf/2605.18137
Xiaomi Auto World Model的同類競品對比
| 對比維度 | Xiaomi Auto World Model | Waymo World Model |
|---|---|---|
| 所屬公司 | 小米汽車 | Waymo(Alphabet/Google) |
| 發佈時間 | 2026年5月 | 2026年2月 |
| 技術路線 | 重建+生成深度耦合一體化架構(WorldRec + WorldGen 互相約束) | 基於 Genie 3 的生成式世界模型(純生成路線,後訓練適配駕駛場景) |
| 重建模塊 | WorldRec:稀疏 3D 錨點表徵,10秒視頻10秒重建,PSNR 28.48(Waymo數據集) | 無獨立重建模塊,依賴 Genie 3 的預訓練世界知識生成全場景 |
| 生成模塊 | WorldGen:4步去噪,0.19秒/幀,支持81幀(~1分鐘)連續生成 | 基於 Genie 3 生成,支持多傳感器輸出(相機+LiDAR),可模擬極端場景 |
| 架構特點 | 重建給生成”打地基”(幾何約束),生成給重建”擴邊界”(補全未觀測區域) | 純生成式,通過語言/動作/場景佈局三種控制機制調整模擬 |
| 傳感器支持 | 主要面向相機數據(多視角圖像輸入) | 相機 + LiDAR 多傳感器輸出,可將普通行車記錄儀視頻轉爲多傳感器模擬數據 |
| 基準測試 | Waymo PSNR 28.48(超DGGT約1個點);nuScenes FVD 64.97,FID 7.04 | 未公開具體量化指標,強調可模擬”從未見過”的長尾場景 |
| 生成速度 | 單視角 0.19秒/幀,三視角 0.46秒/幀 | 未公開具體推理速度,強調”可擴展推理”與高效變體 |
| 最大生成時長 | 81幀(10Hz/30Hz,最長約1分鐘) | 未明確公開,Genie 3 原生支持數分鐘級別一致生成 |
| 極端場景能力 | 暴雨、大雪、濃霧、動物闖入等長尾場景生成 | 龍捲風、洪水、積雪金門大橋、大象/獅子等罕見物體、 reckless driver 等 |
| 業務落地 | 已落地三大場景:合成數據(10萬+ clips)、仿真測試、輔助駕駛學堂 | 用於 Waymo Driver 訓練與驗證,支撐 robotaxi 擴張(2026年目標100萬周訂單) |
Xiaomi Auto World Model的應用場景
-
合成數據生成:爲輔助駕駛感知模型訓練提供高質量、高多樣性、高危險性的長尾場景合成數據,解決真實世界中稀缺場景樣本不足問題。
-
仿真測試:構建閉環仿真環境,復現真實事故場景進行定向優化,提升測試效率與完備性,降低實車測試成本與風險。
-
輔助駕駛學堂:在智能座艙中動態生成第一人稱駕駛教學視頻,針對複雜路況向用戶展示正確操作,提升人機共駕安全性與用戶體驗。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...