Xiaomi-Robotics-U0 – 小米推出的統一具身合成模型

AI工具3周前發佈新公告 AI管理員
0 0

Xiaomi-Robotics-U0是什麼

Xiaomi-Robotics-U0 是小米推出的 380 億參數統一具身合成模型,基於世界基礎模型持續訓練,聯合優化文生圖、圖像編輯、具身場景生成、具身遷移及具身視頻生成五大任務。Xiaomi-Robotics-U0 是首個支持跨多種機器人形態的高質量多視角場景生成模型,在具身場景生成與遷移的人工評估中超越 GPT-Image-2.0,在 World Arena 具身視頻生成榜單排名第一,將 π0.5 在真實世界操控任務的分佈外成功率從 36.9% 提升至 63.2%。

Xiaomi-Robotics-U0 – 小米推出的統一具身合成模型

Xiaomi-Robotics-U0的主要功能

  • 文生圖生成:支持高質量文本到圖像合成,保留基礎世界模型的視覺知識。
  • 圖像編輯:支持 Any-to-Image 編輯,包括相機控制、時間控制、結構提取等細粒度操作。
  • 具身場景生成:根據機器人形態和場景描述,生成多視角一致的初始觀察畫面。
  • 具身遷移:在保持多視角一致性和交互動態的前提下,實現跨場景的結構化可控遷移。
  • 具身視頻生成:支持零樣本多視角具身視頻生成,將靜態場景合成爲時序連貫的操作視頻。

Xiaomi-Robotics-U0的技術原理

  • 統一自迴歸框架:基於 EMU3.5初始化,採用 IBQ Tokenizer 進行 16×16 空間壓縮,所有模態統一爲離散詞表進行 next-token 預測。
  • 聯合持續訓練:在通用域和具身數據集上統一自迴歸目標進行持續訓練,避免用有限機器人數據導致的泛化能力損失。
  • FlashAR+ 推理加速:引入反對角線並行解碼的垂直預測頭,結合 vLLM 優化,1024×1024 分辨率圖像生成速度提升 82.9 倍。
  • 結構化控制分解:將場景解耦爲工作空間、任務對象、無關對象、光照、背景五個獨立控制維度,支持可擴展的具身視頻增強。
  • 子任務-子目標交錯學習:通過 HDBSCAN 聚類對機器人軌跡進行子任務分解,生成交錯的圖像-文本序列,捕捉長程任務進展和細粒度交互動態。

Xiaomi-Robotics-U0 – 小米推出的統一具身合成模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Xiaomi-Robotics-U0

  • 環境配置:訪問小米機器人官網下載模型權重與推理代碼,配置支持 CUDA 和 vLLM 的高性能 GPU 環境。
  • 模型加載:基於 EMU3.5 架構初始化並加載 Xiaomi-Robotics-U0 的 380 億參數檢查點,統一調用 IBQ Tokenizer 處理多模態輸入序列。
  • 文生圖生成:輸入文本描述,通過標準自迴歸 next-token 預測直接生成 1024×1024 分辨率的高質量圖像。
  • 圖像編輯:提供一至三張參考圖像配合文本指令,模型基於 Any-to-Image 能力執行相機控制、時間控制或結構提取等細粒度編輯。
  • 具身場景生成:輸入機器人形態描述與結構化場景文本,模型輸出嚴格滿足多視角一致性和幾何連貫性的初始觀察畫面。
  • 具身遷移:給定當前多視角觀察與目標場景描述,模型在保持交互動態的前提下生成遷移後的多視角 RGB 圖像。
  • 具身視頻生成:提供初始觀察幀與任務指令,模型通過自迴歸展開生成 15 至 25 幀時序連貫的機器人操作視頻。
  • 推理加速:啓用 FlashAR+ 垂直預測頭與 vLLM 優化,實現 1024×1024 分辨率下圖像生成速度提升 82.9 倍。
  • 數據引擎應用:將生成的具身場景或視頻序列直接輸入下游機器人策略網絡,用於提升真實世界操控任務的分佈外泛化能力。

Xiaomi-Robotics-U0的核心優勢

  • 統一性:首個將基礎圖像/視頻生成與具身生成統一在單一框架內的模型,避免後訓練導致的視覺知識遺忘。
  • 多視角一致性:支持跨多種機器人形態的高質量多視角場景生成,嚴格滿足幾何連貫性和相機標定約束。
  • 可控遷移:引入結構化控制機制,可在保持交互動態的前提下對工作空間、背景、光照等維度進行細粒度編輯。
  • 數據引擎能力:生成的具身場景可直接展開爲時序連貫的操作視頻,爲下游策略學習提供可擴展的合成軌跡。
  • SOTA 性能:在具身場景生成與遷移上超越 GPT-Image-2.0,在 World Arena 具身視頻生成排名第一。

Xiaomi-Robotics-U0的項目地址

  • 項目官網:https://robotics.xiaomi.com/xiaomi-robotics-u0.html
  • HuggingFace模型庫https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
  • arXiv技術論文:https://arxiv.org/pdf/2607.11643

Xiaomi-Robotics-U0的同類競品對比

維度 Xiaomi-Robotics-U0 π0.5
定位 統一具身合成世界模型,專注生成可控數據與場景 端到端視覺-語言-動作策略模型,專注直接控制機器人
參數規模 380 億參數自迴歸 Transformer 採用 VLM 主幹 + Action Expert 分層架構
核心能力 多視角場景生成、具身遷移、視頻生成、圖像編輯 端到端機器人控制、家庭泛化任務執行
架構 基於 EMU3.5 初始化,統一 next-token 預測 預訓練離散動作 token,後訓練流匹配生成連續動作
數據引擎 可直接生成具身場景與視頻,將 π0.5 分佈外成功率從 36.9% 提升至 63.2% 本身不具備數據生成能力,依賴真實世界採集
多視角一致性 原生支持跨多種機器人形態的多視角場景生成與幾何連貫遷移 作爲單視角策略模型,不直接處理多視角合成
視覺知識保留 聯合訓練通用生成與具身任務,VLM 基準保持高分(ERQA 40.8、SEED 78.6) VLM 基準得分較低(ERQA 0.0、SEED 21.5),視覺理解受損

Xiaomi-Robotics-U0的應用場景

  • 機器人數據合成:爲真實機器人訓練生成大規模、多樣化的合成操作軌跡,解決真實數據收集成本高、場景受限的問題。
  • 跨形態場景遷移:將同一操作任務從一種機器人形態(如單臂)遷移到另一種形態(如雙臂),保持場景一致性。
  • 仿真環境構建:快速生成高質量多視角機器人操作場景,用於仿真平台訓練和策略驗證。
  • 操作策略增強:利用生成的分佈外數據提升機器人策略的泛化能力,如將 π0.5 的成功率提升 26.3%。
  • 具身智能研究:作爲世界基礎模型,支持長程任務規劃、子任務分解和交互動態預測等基礎研究。
© 版權聲明

相關文章

暫無評論

暫無評論...