Xiaomi Auto World Model – 小米推出的輔助駕駛世界模型

AI工具3個月前發佈新公告 AI管理員
0 0

Xiaomi Auto World Model是什麼

Xiaomi Auto World Model 是小米汽車推出的輔助駕駛世界模型,首次將三維重建(WorldRec)與視頻生成(WorldGen)深度耦合。WorldRec 用稀疏 3D 錨點實現 10 秒視頻 10 秒快速重建,WorldGen 通過兩階段訓練與 ODE 蒸餾實現 4 步去噪、0.19 秒/幀生成,支持最長 1 分鐘視頻。在 Waymo 重建精度(PSNR 28.48)與 nuScenes 生成質量(FVD 64.97)上均達 SOTA,已落地合成數據、仿真測試、輔助駕駛學堂三大業務場景。

Xiaomi Auto World Model – 小米推出的輔助駕駛世界模型

Xiaomi Auto World Model的主要功能

  • WorldRec 三維重建模塊:採用稀疏 3D 查詢錨點替代傳統稠密高斯,實現多視角多時刻特徵聚合與可見性加權融合,10 秒視頻重建僅需 10 秒,消除多視角衝突與鬼影問題。
  • WorldGen 視頻生成模塊:基於全雙向時序注意力預訓練+因果微調兩階段訓練,通過 ODE 蒸餾將去噪步數從 50 步壓縮至 4 步,0.19 秒/幀生成未來幀、未觀測視角與遮擋區內容,支持最長 81 幀(約 1 分鐘)連續生成。
  • 重建-生成深度耦合:重建側提供 3D 幾何先驗約束生成穩定性,生成側擴展重建邊界至未觀測時空區域,兩者互相校正抑制長時序漂移。
  • 極端場景生成:支持暴雨、大雪、濃霧等極端天氣及動物闖入等長尾危險場景的高質量合成,爲感知模型訓練提供稀缺數據。
  • 三大業務落地:合成數據生成(已交付 10 萬+ clips)、閉環仿真測試(復現真實事故定向優化)、輔助駕駛學堂(動態生成第一人稱駕駛教學視頻)。

Xiaomi Auto World Model的技術原理

  • WorldRec 稀疏錨點表徵:摒棄逐像素預測高斯範式,改用稀疏三維查詢點作爲場景表徵,每個錨點主動聚合多相機多時刻特徵,通過可見性加權自動篩選可靠觀測,從源頭保證跨視角一致性。
  • 4D Gaussian 全局表示:維護隨觀測增量擴展的 4D 高斯場景表示,投影到自車視角後作爲渲染先驗輸入生成模型,爲生成提供確定性幾何約束。
  • WorldGen 兩階段訓練:第一階段全雙向時序注意力預訓練建立駕駛場景時空全局理解;第二階段因果注意力微調+教師強制(Teacher Forcing),配合 ODE 蒸餾提速 12 倍,分佈匹配蒸餾解決暴露偏差。
  • 重建-生成閉環約束:重建的確定性幾何先驗持續校正生成過程,生成補全重建覆蓋不到的時空區域,兩者目標函數在結構上互相約束,實現高穩定性、高一致性、高真實性。

如何使用Xiaomi Auto World Model

  • 上線平台:已上線小米全車型的「輔助駕駛學堂 – 實景模擬場景」。
  • 使用條件:需擁有小米汽車(SU7 等車型),在車載系統中進入輔助駕駛學堂模塊。

Xiaomi Auto World Model的核心優勢

  • SOTA 性能:Waymo 重建 PSNR 28.48(超 DGGT 約 1 個點),nuScenes 零樣本泛化 PSNR 26.54 同樣領先;生成側 FVD 64.97 超越所有雙向與自迴歸基線模型。
  • 極速推理:單視角生成 0.19 秒/幀,三視角 0.46 秒/幀,較同類自迴歸方法 Epona(1.06 秒/幀)快 5.6 倍。
  • 超長時序:支持 81 幀連續生成(10Hz/30Hz,最長 1 分鐘),遠超公開基線模型的 8-16 幀限制。
  • 零樣本泛化:nuScenes 零樣本測試仍保持領先,證明對新場景具備強適應能力。
  • 已落地生產:已在小米汽車合成數據、仿真測試、智能座艙三大核心場景完成業務閉環。

Xiaomi Auto World Model的項目地址

  • 項目官網:https://JointWM.github.io/
  • arXiv技術論文:https://arxiv.org/pdf/2605.18137

Xiaomi Auto World Model的同類競品對比

對比維度 Xiaomi Auto World Model Waymo World Model
所屬公司 小米汽車 Waymo(Alphabet/Google)
發佈時間 2026年5月 2026年2月
技術路線 重建+生成深度耦合一體化架構(WorldRec + WorldGen 互相約束) 基於 Genie 3 的生成式世界模型(純生成路線,後訓練適配駕駛場景)
重建模塊 WorldRec:稀疏 3D 錨點表徵,10秒視頻10秒重建,PSNR 28.48(Waymo數據集) 無獨立重建模塊,依賴 Genie 3 的預訓練世界知識生成全場景
生成模塊 WorldGen:4步去噪,0.19秒/幀,支持81幀(~1分鐘)連續生成 基於 Genie 3 生成,支持多傳感器輸出(相機+LiDAR),可模擬極端場景
架構特點 重建給生成”打地基”(幾何約束),生成給重建”擴邊界”(補全未觀測區域) 純生成式,通過語言/動作/場景佈局三種控制機制調整模擬
傳感器支持 主要面向相機數據(多視角圖像輸入) 相機 + LiDAR 多傳感器輸出,可將普通行車記錄儀視頻轉爲多傳感器模擬數據
基準測試 Waymo PSNR 28.48(超DGGT約1個點);nuScenes FVD 64.97,FID 7.04 未公開具體量化指標,強調可模擬”從未見過”的長尾場景
生成速度 單視角 0.19秒/幀,三視角 0.46秒/幀 未公開具體推理速度,強調”可擴展推理”與高效變體
最大生成時長 81幀(10Hz/30Hz,最長約1分鐘) 未明確公開,Genie 3 原生支持數分鐘級別一致生成
極端場景能力 暴雨、大雪、濃霧、動物闖入等長尾場景生成 龍捲風、洪水、積雪金門大橋、大象/獅子等罕見物體、 reckless driver 等
業務落地 已落地三大場景:合成數據(10萬+ clips)、仿真測試、輔助駕駛學堂 用於 Waymo Driver 訓練與驗證,支撐 robotaxi 擴張(2026年目標100萬周訂單)

Xiaomi Auto World Model的應用場景

  • 合成數據生成:爲輔助駕駛感知模型訓練提供高質量、高多樣性、高危險性的長尾場景合成數據,解決真實世界中稀缺場景樣本不足問題。
  • 仿真測試:構建閉環仿真環境,復現真實事故場景進行定向優化,提升測試效率與完備性,降低實車測試成本與風險。
  • 輔助駕駛學堂:在智能座艙中動態生成第一人稱駕駛教學視頻,針對複雜路況向用戶展示正確操作,提升人機共駕安全性與用戶體驗。
© 版權聲明

相關文章

暫無評論

暫無評論...