悟界·RoboBrain Orca是什麼
悟界·RoboBrain Orca 是智源研究院推出的通用世界基礎模型,以下一個狀態預測替代傳統下一個詞/幀/動作預測,讓 AI 在內部構建統一的世界潛在表徵。模型基於 12.5 萬小時視頻與 1.6 億條事件標註,通過無意識學習捕捉自然狀態轉移、有意識學習建模語義因果,將世界狀態濃縮爲統一潛空間,支持文本生成、圖像預測與具身動作等多模態讀出。

悟界·RoboBrain Orca的主要功能
- 世界狀態建模:將多模態世界信號(視覺、語言)編碼爲統一的世界潛在表徵空間。
- 文本生成:基於世界潛在表徵,通過 LM head 輸出文本回答與視覺問答。
- 圖像預測:給定當前圖像與指令,預測真實世界交互後的下一狀態圖像,非單純生成美觀畫面。
- 具身動作生成:從世界表徵中讀出機器人動作序列,支持雙臂操作等 OOD 任務。
悟界·RoboBrain Orca的技術原理
- Encoder-Decoder 架構:Encoder 負責學習統一的世界潛在表徵;Decoder 負責將表徵讀出爲具體模態輸出。
- 無意識學習(Unconscious Learning):從連續視頻中學習密集、自然的狀態轉移,不依賴人工標籤,通過預測下一幀的潛在表示實現。
- 有意識學習(Conscious Learning):用語言描述的事件和 VQA 數據,學習稀疏但具有語義意義的狀態轉移,建模因果與意圖。
- 雙路徑預訓練:結合 Observation-only State Transition、Event-conditioned State Transition 與 VQA Response Generation 三大目標。
- 凍結主幹 + 輕量讀出:預訓練後 Orca 主幹凍結,下游僅訓練 MLP Adaptor、LoRA 或 Action Expert 等輕量模塊。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用悟界·RoboBrain Orca
- 獲取資源:從 GitHub 倉庫 https://github.com/orca-wm下載開源代碼與預訓練模型權重文件。
- 準備數據:收集多模態世界信號數據,包括連續視頻、語言事件描述及視覺問答對。
- 接入模塊:凍結 Orca 主幹網絡,根據目標場景接入輕量讀出模塊(LM head、圖像解碼器或 Action Expert)。
- 部署應用:在機器人操作、視覺問答或狀態預測等下游任務中執行推理,或用少量域內軌跡進行後訓練微調。
悟界·RoboBrain Orca的核心優勢
- 統一表徵空間:語言、圖像、動作不再是孤立任務,而是同一世界潛在空間的不同出口。
- 物理一致性預測:圖像預測更關注真實物理過程與狀態轉換,避免傳統生成模型的幻覺與物體憑空出現。
- 零樣本泛化能力:在動作生成任務中,預訓練未使用任何動作標籤,僅通過 200 條域內軌跡後訓練可超越專用基線。
- 持續 Scaling 潛力:訓練損失隨數據量與模型規模持續下降,當前僅用約十分之一數據,未來提升空間顯著。
悟界·RoboBrain Orca的項目地址
- 項目官網:https://orca-wm.github.io/
- GitHub倉庫:https://github.com/orca-wm/Orca
- HuggingFace模型庫:https://huggingface.co/papers/2606.30534
- arXiv技術論文:https://arxiv.org/pdf/2606.30534
悟界·RoboBrain Orca的同類競品對比
| 維度 | Orca | V-JEPA 2.1 |
|---|---|---|
| 機構 | 智源研究院(BAAI) | Meta AI |
| 核心範式 | Next-State-Prediction(狀態轉移建模) | Next-Frame Prediction(視頻預測) |
| 學習路徑 | 無意識學習 + 有意識學習(雙路徑) | 自監督視頻特徵學習 |
| 數據規模 | 12.5萬小時視頻 + 1.6億事件標註 | 大規模未標註視頻 |
| 下游支持 | 文本、圖像、動作三模態讀出 | 主要支持視覺與動作表徵 |
| 動作生成 | 主幹凍結,200條軌跡即可OOD泛化 | 需更多機器人數據微調 |
| 狀態轉移理解 | 顯式建模事件級因果與語義狀態轉移 | 側重像素級與特徵級一致性 |
悟界·RoboBrain Orca的應用場景
-
機器人操作規劃:基於世界狀態轉移理解,爲機械臂生成符合物理規律的操作動作,完成開抽屜、疊衣物等複雜交互任務。
-
自動駕駛決策:通過預測交通場景中車輛與行人的狀態演化,提前預判潛在風險並規劃安全行駛路徑。
-
具身智能體訓練:作爲通用世界表徵接口,爲不同機器人平台提供預訓練知識,降低新任務的數據採集成本。
-
交互式視頻理解:根據自然語言指令預測視頻後續發展,支持因果推理問答與事件發展推演。
-
物理仿真與數字孿生:構建可推理、可預測的世界狀態模型,用於工業虛擬環境推演與物理過程模擬。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...