悟界·RoboBrain Orca – 智源研究院推出的通用世界基礎模型

AI工具8小時前發佈新公告 AI管理員
0 0

悟界·RoboBrain Orca是什麼

悟界·RoboBrain Orca 是智源研究院推出的通用世界基礎模型,以下一個狀態預測替代傳統下一個詞/幀/動作預測,讓 AI 在內部構建統一的世界潛在表徵。模型基於 12.5 萬小時視頻與 1.6 億條事件標註,通過無意識學習捕捉自然狀態轉移、有意識學習建模語義因果,將世界狀態濃縮爲統一潛空間,支持文本生成、圖像預測與具身動作等多模態讀出。

悟界·RoboBrain Orca – 智源研究院推出的通用世界基礎模型

悟界·RoboBrain Orca的主要功能

  • 世界狀態建模:將多模態世界信號(視覺、語言)編碼爲統一的世界潛在表徵空間。
  • 文本生成:基於世界潛在表徵,通過 LM head 輸出文本回答與視覺問答。
  • 圖像預測:給定當前圖像與指令,預測真實世界交互後的下一狀態圖像,非單純生成美觀畫面。
  • 具身動作生成:從世界表徵中讀出機器人動作序列,支持雙臂操作等 OOD 任務。

悟界·RoboBrain Orca的技術原理

  • Encoder-Decoder 架構:Encoder 負責學習統一的世界潛在表徵;Decoder 負責將表徵讀出爲具體模態輸出。
  • 無意識學習(Unconscious Learning):從連續視頻中學習密集、自然的狀態轉移,不依賴人工標籤,通過預測下一幀的潛在表示實現。
  • 有意識學習(Conscious Learning):用語言描述的事件和 VQA 數據,學習稀疏但具有語義意義的狀態轉移,建模因果與意圖。
  • 雙路徑預訓練:結合 Observation-only State Transition、Event-conditioned State Transition 與 VQA Response Generation 三大目標。
  • 凍結主幹 + 輕量讀出:預訓練後 Orca 主幹凍結,下游僅訓練 MLP Adaptor、LoRA 或 Action Expert 等輕量模塊。

悟界·RoboBrain Orca – 智源研究院推出的通用世界基礎模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用悟界·RoboBrain Orca

  • 獲取資源:從 GitHub 倉庫 https://github.com/orca-wm下載開源代碼與預訓練模型權重文件。
  • 準備數據:收集多模態世界信號數據,包括連續視頻、語言事件描述及視覺問答對。
  • 接入模塊:凍結 Orca 主幹網絡,根據目標場景接入輕量讀出模塊(LM head、圖像解碼器或 Action Expert)。
  • 部署應用:在機器人操作、視覺問答或狀態預測等下游任務中執行推理,或用少量域內軌跡進行後訓練微調。

悟界·RoboBrain Orca的核心優勢

  • 統一表徵空間:語言、圖像、動作不再是孤立任務,而是同一世界潛在空間的不同出口。
  • 物理一致性預測:圖像預測更關注真實物理過程與狀態轉換,避免傳統生成模型的幻覺與物體憑空出現。
  • 零樣本泛化能力:在動作生成任務中,預訓練未使用任何動作標籤,僅通過 200 條域內軌跡後訓練可超越專用基線。
  • 持續 Scaling 潛力:訓練損失隨數據量與模型規模持續下降,當前僅用約十分之一數據,未來提升空間顯著。

悟界·RoboBrain Orca的項目地址

  • 項目官網:https://orca-wm.github.io/
  • GitHub倉庫:https://github.com/orca-wm/Orca
  • HuggingFace模型庫:https://huggingface.co/papers/2606.30534
  • arXiv技術論文:https://arxiv.org/pdf/2606.30534

悟界·RoboBrain Orca的同類競品對比

維度 Orca V-JEPA 2.1
機構 智源研究院(BAAI) Meta AI
核心範式 Next-State-Prediction(狀態轉移建模) Next-Frame Prediction(視頻預測)
學習路徑 無意識學習 + 有意識學習(雙路徑) 自監督視頻特徵學習
數據規模 12.5萬小時視頻 + 1.6億事件標註 大規模未標註視頻
下游支持 文本、圖像、動作三模態讀出 主要支持視覺與動作表徵
動作生成 主幹凍結,200條軌跡即可OOD泛化 需更多機器人數據微調
狀態轉移理解 顯式建模事件級因果與語義狀態轉移 側重像素級與特徵級一致性

悟界·RoboBrain Orca的應用場景

  • 機器人操作規劃:基於世界狀態轉移理解,爲機械臂生成符合物理規律的操作動作,完成開抽屜、疊衣物等複雜交互任務。
  • 自動駕駛決策:通過預測交通場景中車輛與行人的狀態演化,提前預判潛在風險並規劃安全行駛路徑。
  • 具身智能體訓練:作爲通用世界表徵接口,爲不同機器人平台提供預訓練知識,降低新任務的數據採集成本。
  • 交互式視頻理解:根據自然語言指令預測視頻後續發展,支持因果推理問答與事件發展推演。
  • 物理仿真與數字孿生:構建可推理、可預測的世界狀態模型,用於工業虛擬環境推演與物理過程模擬。
© 版權聲明

相關文章

暫無評論

暫無評論...