LingBot-Video – 螞蟻靈波開源面向具身智能的視頻模型

AI工具3周前發佈新公告 AI管理員
0 0

LingBot-Video是什麼

LingBot-Video 是螞蟻靈波科技開源的全球首個面向具身智能的 MoE 視頻生成基礎模型。模型基於 DiT + MoE 架構,總參數 30B 僅激活約 3B,兼顧大容量與高效推理。模型整合 7 萬小時互聯網及機器人數據,通過多維強化學習獎勵對齊物理合理性與任務完成度,在 RBench 和 Physics-IQ 評測中均排名第一,可生成符合真實物理規律的機器人操作與交互視頻。

LingBot-Video – 螞蟻靈波開源面向具身智能的視頻模型

LingBot-Video的主要功能

  • 文本/圖像生成視頻:支持 T2V、TI2V、T2I 統一生成,覆蓋開放世界場景與具身任務。
  • 機器人動作預測:生成機械臂、人形機器人、四足機器人等的動作序列與接觸狀態。
  • 物理仿真視頻生成:模擬材料形變、流體運動、光照反射等真實物理現象。
  • 仿真數據合成:爲機器人策略訓練提供大規模、低成本的物理合理視頻數據。
  • 世界模型研究:作爲物理世界模擬器,支持策略評估與動作規劃。

LingBot-Video的技術原理

  • DiT + Sparse MoE 架構:模型採用 Single-Stream Diffusion Transformer 統一處理視覺潛碼與條件 token,以 MoE 替代 Dense FFN,總參數 30B 僅激活約 3B,實現約 3 倍推理加速。128 個細粒度 routed experts 配合共享專家,通過 top-K 路由捕獲不同物理模式,避免子任務干擾。
  • 數據畫像引擎與 7 萬小時具身數據:在海量互聯網視頻基礎上,引入 VLA、VLN、Ego 等機器人數據,覆蓋靈巧操作、導航與第一視角交互,使模型學習動作與環境變化的內在關係。
  • 多維強化學習獎勵對齊:訓練階段除美學、prompt 跟隨和運動一致性外,額外引入物理合理性與任務完成度獎勵,並使用真實世界視頻作爲偏好信號,使生成結果符合真實物理規律與機器人任務需求。
  • 統一輸入與 3D RoPE:T2I/T2V/TI2V 任務統一爲單序列 token,通過多模態 3D MM-RoPE 將條件 token 與視覺 token 映射到非重疊時空座標,消除任務特定架構需求,同時保持空間局部性與時序順序。
  • 級聯生成與穩定訓練:模型採用 base generator + refiner 級聯設計,base 生成緊湊潛碼,refiner 提升細節。配合 QK-Norm、AdaLN-Single 調製及無輔助損失的序列級負載均衡策略,保障長序列、高分辨率訓練穩定。

LingBot-Video – 螞蟻靈波開源面向具身智能的視頻模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用LingBot-Video

  • 環境準備:確保本地或服務器已配置 Python 3.10+ 及 CUDA 環境,並預留足夠顯存。
  • 克隆倉庫:從 GitHub 拉取 LingBot-Video 官方代碼庫到本地工作目錄。
  • 安裝依賴:根據項目 requirements.txt 安裝所需的深度學習與推理庫。
  • 下載權重:從 HuggingFace 或 ModelScope 獲取對應規模的模型 checkpoint 文件。
  • 準備提示:將文本描述、參考圖像或結構化控制信號整理爲模型支持的輸入格式。
  • 運行推理:加載模型並執行生成腳本,輸出具身智能或開放世界視頻。

LingBot-Video的核心優勢

  • 全球首個開源具身視頻 MoE 模型:填補面向機器人的開源視頻基礎模型空白。
  • 容量與效率解耦:30B 參數規模下僅激活 3B,推理速度約爲同規模 Dense 架構的 3 倍,適配實時交互需求。
  • 物理合理性領先:在 RBench(0.620)和 Physics-IQ Verified 均排名第一,超越 Wan2.6、Seedance 1.5 Pro、Cosmos 3 等。
  • 數據專門化:7 萬小時機器人數據注入,使模型理解動作-環境因果關係,而非僅視覺風格。
  • 統一任務框架:T2I/T2V/TI2V 單模型統一處理,降低多任務部署成本。

LingBot-Video的項目地址

  • 項目官網:https://technology.robbyant.com/lingbot-video
  • GitHub倉庫:https://github.com/Robbyant/lingbot-video
  • HuggingFace模型庫:https://huggingface.co/collections/robbyant/lingbot-video
  • arXiv技術論文:https://arxiv.org/pdf/2607.07675

LingBot-Video的同類競品對比

維度 LingBot-Video NVIDIA Cosmos 3 Super
研發背景 螞蟻靈波科技(Robbyant)開源發佈,專注具身智能視頻生成。 NVIDIA 2026 年 6 月發佈,面向物理 AI 與機器人訓練的全模態世界模型。
架構設計 基於 DiT 的 Single-Stream Sparse MoE,統一處理 T2I/T2V/TI2V。 Mixture-of-Transformers(MoT)雙塔架構,自迴歸 Transformer 處理文本,擴散 Transformer 處理連續模態。
參數規模 總參數 30B,激活約 3B,實現容量與效率解耦。 總參數 64B(Super),Nano 版本爲 16B,全參數激活。
模態支持 文本、圖像、視頻,專注視覺生成與動作條件建模。 文本、圖像、視頻、音頻、動作序列統一處理,支持全模態輸入輸出。
訓練數據 7 萬小時互聯網視頻加 VLA/VLN/Ego 機器人數據,注入動作與環境動態先驗。 20 trillion tokens,含約 10 億圖像、4 億真實與合成視頻及環境音頻,覆蓋機器人、駕駛、倉儲等場景。
開源程度 模型權重、代碼、技術報告完全開源,社區可自由下載與二次開發。 模型權重與代碼以 OpenMDW 1.1 協議開源,允許商用,配套提供合成數據集與評測基準。
RBench 表現 得分 0.620,在公開對比中排名第一。 得分 0.581,在部分評測中位列開源模型前列。
Physics-IQ 在 Physics-IQ Verified 評測中排名第一。 I2V 43.8 分、V2V 59.7 分,在對應榜單中達到 SOTA。
推理效率 30B 總參數僅激活 3B,推理速度約爲同規模 Dense 架構的 3 倍。 64B 全參數激活,需 H100 級硬件支持,Nano 版本針對更快推理優化。

LingBot-Video的應用場景

  • 機器人仿真訓練:爲機械臂、人形機器人生成物理合理的操作視頻,替代昂貴真實數據採集。
  • 仿真數據合成:批量生成多樣化場景與動作軌跡,用於策略預訓練與數據增強。
  • 世界模型研究:作爲物理世界預測器,支持基於想象的機器人規劃與決策。
  • 自動駕駛仿真:生成符合物理規律的道路交互與 ego 視角視頻,用於感知算法驗證。
  • 服務與製造:在倉儲、醫療、家庭服務場景中模擬人機交互流程,優化任務策略。
© 版權聲明

相關文章

暫無評論

暫無評論...