LingBot-VA 2.0 – 螞蟻靈波推出的具身原生世界動作模型

AI工具4天前發佈新公告 AI管理員
0 0

LingBot-VA 2.0是什麼

LingBot-VA 2.0是螞蟻靈波推出的行業首個具身原生世界動作模型,基於自迴歸架構從零預訓練,使機器人具備”邊推演、邊行動”的通用控制能力。模型採用因果DiT+稀疏MoE架構,總參數15.3B、推理僅激活2.5B,在RoboTwin 2.0基準實現93.6%雙臂任務成功率,單GPU推理達150Hz。

LingBot-VA 2.0 – 螞蟻靈波推出的具身原生世界動作模型

LingBot-VA 2.0的主要功能

  • 視覺-動作聯合預測:同步生成未來世界狀態預測與下一步機器人動作,實現”預判式控制”。
  • 長程任務規劃:高維Planner將複雜目標拆解爲結構化子任務,支持雙臂並行執行與狀態記憶。
  • 實時閉環控制:Foresight Reasoning異步推理,在執行當前動作時預計算下一步,消除串行延遲。
  • 跨域泛化:在乾淨與域隨機化場景下均保持93%以上成功率,適應真實環境變化。
  • 精細操作:支持薯片等薄片、易碎物體的高精度力控抓取。

LingBot-VA 2.0的技術原理

  • 語義視覺-動作分詞器:不同於傳統VAE僅追求像素重建,分詞器在視覺壓縮中強制對齊語義與動作信息,通過逆動力學與正向動力學模型從連續幀隱式提取動作監督,使無標註網絡視頻能提供訓練信號。
  • 因果預訓練範式:摒棄對雙向視頻生成模型的後期改造,從第一天起採用自迴歸因果架構訓練,確保模型嚴格按只能看過去的時間線學習,天然匹配機器人閉環控制的單向物理現實。
  • 稀疏MoE架構:視頻主幹採用Mixture-of-Experts,總參數約13B但推理僅激活1.9B,配合一致性蒸餾、低精度編譯等加速技術,將推理延遲從965ms降至142ms/chunk。
  • Foresight Reasoning異步推理:設計預測-執行-糾偏閉環,機器人執行當前動作時模型並行預測下一步,在真實觀測返回時重新校準,避免純腦補導致的物理漂移,異步控制頻率提升至225Hz。

如何使用LingBot-VA 2.0

  • 訪問官網:打開 https://technology.robbyant.com/lingbot-va-v2 瞭解模型架構、演示視頻及技術細節。
  • 獲取代碼:訪問 GitHub 倉庫下載開源代碼與技術報告,熟悉因果DiT、稀疏MoE及Foresight Reasoning的實現細節。
  • 環境部署:在配備高性能GPU的服務器或工作站上配置推理環境,安裝依賴並加載模型權重。
  • 硬件接入:將模型接入機器人本體,連接相機觀測流與機械臂/夾爪執行器,確保傳感器數據實時輸入。
  • 配置異步管線:啓用Foresight Reasoning異步推理機制,使模型在執行當前動作片段時並行預測下一步狀態。
  • 閉環校準:設置真實觀測反饋通道,讓模型在每次新觀測返回時重新校正預測,避免物理漂移。
  • 任務適配:如需執行新任務,採集少量機器人操作數據,基於預訓練權重進行高效微調。

LingBot-VA 2.0的核心優勢

  • 具身原生:從架構、數據到訓練目標均爲物理世界量身定製,而非數字視頻生成模型微調。
  • 實時高效:單GPU 150Hz推理,滿足實時閉環控制需求。
  • 因果一致:嚴格單向時間建模,避免雙向注意力造成的動作精度損失與災難性遺忘。
  • 數據高效:MCP多步預測目標使訓練收斂速度提升2.3倍,降低對機器人標註數據的依賴。
  • 全棧協同:與LingBot-Depth、LingBot-VLA、LingBot-Video等形成感知-預測-執行完整閉環。

LingBot-VA 2.0的項目地址

  • 項目官網:https://technology.robbyant.com/lingbot-va-v2
  • 技術論文:https://github.com/Robbyant/lingbot-va/blob/main/LingBot_VA2_paper.pdf

LingBot-VA 2.0的同類競品對比

維度 LingBot-VA 2.0 ACE-Ego
發佈方 螞蟻靈波 大曉機器人 × 港中文 MMLab
模型定位 具身原生世界動作模型(VA) “一腦多型”具身操作 VLA 模型
架構路線 自迴歸因果 DiT + 稀疏 MoE Qwen3-VL-4B + Flow-Matching Diffusion Action Expert
預訓練方式 從零具身原生預訓練,不依賴數字視頻生成模型 混合人類第一視角視頻 + 機器人/仿真數據聯合預訓練
核心機制 Foresight Reasoning 異步推理、語義視覺-動作分詞器 相機空間動作對齊、形態條件編碼、時間對齊分塊、可靠性感知損失
總參數 / 激活參數 15.3B / 2.5B(稀疏激活) VLM 4B + Action Expert 約 600M(全激活)
推理速度 單 GPU 150Hz(異步 225Hz) 未公開具體頻率,依賴 4 步 flow-matching 解碼
RoboTwin 2.0 平均成功率 93.6%(Clean 93.8% / Randomized 93.4%) Easy 91.12% / Hard 90.62%

LingBot-VA 2.0的應用場景

  • 家庭服務機器人:執行桌面整理、物品歸位、餐具擺放等長程家務任務,利用長程記憶與雙臂協調能力完成複雜日常操作。
  • 工業動態抓取:在傳送帶、流水線上對移動目標進行實時抓取,模型預測物體未來位置並同步動作節奏,替代傳統光電觸發方案。
  • 精密裝配作業:完成芯片、薄片、易碎零部件的柔性力控抓取與裝配,依靠細粒度視覺伺服保護物料完整性。
  • 人機交互娛樂:支持冰球對戰、桌面遊戲等需要實時預判對手動作的高頻交互場景,實現毫秒級反應與策略調整。
  • 倉儲物流分揀:在動態變化的倉儲環境中進行貨物分揀、搬運與碼垛,適應不同尺寸、形狀包裹的泛化抓取需求。
© 版權聲明

相關文章

暫無評論

暫無評論...