UnifoLM-WLA-1.0 – 宇樹科技推出的具身多模態大模型

AI工具3周前發佈新公告 AI管理員
0 0

UnifoLM-WLA-1.0是什麼

UnifoLM-WLA-1.0是宇樹科技推出的6B具身多模態大模型,基於約2500小時真機數據訓練,將視覺、語言與動作統一建模,單模型統籌64項桌面與全身移動操作任務。模型開源了約4B的UnifoLM-ER-1感知推理模型與ER-Flow動作建模模型權重,後者融合未來動態預測與離散動作學習,完整系統與後訓練代碼將陸續開放。

UnifoLM-WLA-1.0 – 宇樹科技推出的具身多模態大模型

UnifoLM-WLA-1.0的主要功能

  • 具身感知與推理:識別物體位置、空間關係及可操作區域,回答”目標在哪、物體間什麼關係”等問題,爲操作決策提供感知基礎。
  • 視覺-語言-動作統一執行:將任務指令直接映射爲機器人可執行動作,單模型統籌54項桌面任務與10項全身移動操作,無需爲每個任務單獨訓練策略。
  • 交互結果預測:在動作執行前預測操作引起的場景變化,減少無效嘗試。
  • 全身協同操作:覆蓋上肢操作與下肢移動的整體控制,可完成鋪牀、疊衣、倒垃圾等需移動+操作配合的複合任務。

UnifoLM-WLA-1.0的技術原理

  • 統一VLA架構:視覺語言模型爲骨幹,將圖像、語言指令與動作放入同一模型聯合建模,用約2500小時真機數據端到端訓練出6B參數模型,避免感知、規劃、控制分模塊造成的誤差累積。
  • 離散動作表示:通過RVQ將統一動作空間,末端姿態、靈巧手關節、下肢關節,分別離散化爲動作token,使連續控制問題轉化爲語言模型擅長的token預測問題,與視覺、文本信息在同一序列中處理。
  • 未來動態預測(ER-Flow層):引入掩碼token機制,在推理時同時預測動作token與未來動態區域token,讓模型在”動手之前”先想象操作引發的場景變化,再據此生成動作序列,實現感知與行動的閉環耦合。
  • 分層模型設計:ER-1負責底層感知推理,ER-Flow在其上增加動作建模,兩者構成WLA系統的感知底座與中間層,完整6B系統在此之上整合後訓練得到全身操作能力。

UnifoLM-WLA-1.0 – 宇樹科技推出的具身多模態大模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用UnifoLM-WLA-1.0

  • 獲取代碼:訪問項目主頁 unigen-x.github.io/unifolm-wla.github.io 或 GitHub 倉庫 unitreerobotics/unifolm-wla,按 README 克隆代碼並安裝依賴環境。
  • 下載權重:從 HuggingFace 拉取已開放的 UnifoLM-ER-1和 UnifoLM-ER-Flow兩款模型權重,用 huggingface-cli download 命令即可。
  • 跑通推理示例:先用項目提供的推理腳本加載 ER-1,輸入機器人當前畫面和任務描述,測試目標定位、空間關係理解等感知推理輸出是否正常。
  • 接入動作預測:加載 ER-Flow,輸入當前圖像+任務指令+候選動作,模型會輸出離散動作token及未來動態區域預測,需按官方提供的 RVQ 解碼方式還原爲連續控制信號。
  • 適配真機控制:將解碼後的動作指令接入宇樹 G1 / H1 等機器人的運動控制接口,並在仿真或真機上小規模驗證後再部署,因爲權重本身不包含完整機器人控制系統。

UnifoLM-WLA-1.0的核心優勢

  • 單模型多任務:6B參數即統籌54項桌面操作與10項全身移動操作共64項任務,無需爲每個任務單獨訓練策略,泛化能力領先。
  • 真機數據紮實:基於約2500小時真機操作數據訓練,而非純仿真數據,動作輸出更貼近真實機器人動力學特性。
  • 感知底座性能強:底層ER-1模型基於Qwen3-VL-4B、經500萬+樣本強化訓練,在RefSpatial-Bench等7項開源模型評測中均取得第一。
  • 會”預判”再行動:ER-Flow通過掩碼token預測操作引發的未來場景變化,先想象動作後果再執行,減少無效嘗試和碰撞風險。
  • 全身統一控制:RVQ將靈巧手、末端姿態、下肢關節編碼爲統一動作token,實現上肢操作與下肢移動在同一模型下的協同決策。

UnifoLM-WLA-1.0的項目地址

  • 項目官網:https://unigen-x.github.io/unifolm-wla.github.io/
  • GitHub倉庫:https://github.com/unitreerobotics/unifolm-wla
  • HuggingFace模型庫:
    • https://huggingface.co/unitreerobotics/UnifoLM-ER-Flow
    • https://huggingface.co/unitreerobotics/UnifoLM-ER-1

UnifoLM-WLA-1.0的同類競品對比

對比維度 UnifoLM-WLA-1.0(宇樹) π0 / π0.5(Physical Intelligence)
發佈方 宇樹科技(中國) Physical Intelligence(美國)
參數規模 6B(完整版),另開放約4B的ER-1/ER-Flow 3B(VLM骨幹+動作專家混合架構)
訓練數據 約2500小時真機數據 多種機器人平台採集的跨本體數據
任務覆蓋 單模型統籌64項任務(54桌面+10全身移動) π0.5主打開放世界泛化與長程任務(如摺疊衣物、清理桌面)
動作表示 RVQ將手/臂/腿動作離散化爲統一token 連續動作流 + 離散動作塊(action chunking)
獨特機制 ER-Flow預測未來動態區域,先”想象”再行動 π0.5用”推理-行動交替”機制處理長程任務
開源程度 完全開源(Apache 2.0權重+技術報告),可本地部署 不開源,僅通過合作方API或租賃機器人使用
硬件綁定 深度適配宇樹G1/H1人形機器人 跨平台(單臂、雙臂、移動操作等多種本體)

UnifoLM-WLA-1.0 應用場景

  • 家庭服務:完成疊衣、鋪牀、倒垃圾等日常家務,是發佈會重點演示的核心場景。
  • 工業製造:在產線上執行零件抓取、工具遞送、簡單裝配等重複性操作任務。
  • 物流倉儲:進行貨物分揀、包裹搬運、貨架整理等需要移動+操作配合的倉儲作業。
  • 科研教育:作爲完全開源的端到端VLA基座,供高校和實驗室研究具身智能算法、訓練具身推理數據。
  • 商業導覽與服務:在展廳、商場等場所執行引導、遞送物品等與人交互的服務型任務。
© 版權聲明

相關文章

暫無評論

暫無評論...