LingBot-Depth 2.0 – 螞蟻靈波科技推出的空間感知模型

AI工具1周前發佈新公告 AI管理員
0 0

LingBot-Depth 2.0是什麼

LingBot-Depth 2.0 是螞蟻靈波科技推出面向真實場景的空間感知模型,同步開源視覺基座模型 LingBot-Vision。訓練數據從 300 萬擴充至 1.5 億,在 16 項深度補全基準測評中獲 12 項第一,室內大面積深度缺失場景 RMSE 誤差從 0.132 降至 0.062。模型在玻璃、鏡面等透明物體場景表現突出,已通過奧比中光專業認證,構建機器人從”看懂”到”看準”的能力鏈路。

LingBot-Depth 2.0 – 螞蟻靈波科技推出的空間感知模型

LingBot-Depth 2.0的主要功能

  • 深度補全:基於 RGB 圖像與稀疏深度輸入,補全生成高精度稠密深度圖。
  • 透明物體感知:針對玻璃、鏡面、水龍頭等透明/反光物體實現完整三維結構重建。
  • 邊緣精細識別:具備亞像素級邊界定位能力,精準識別物體輪廓與細小結構。
  • 時序穩定性:在視頻流中保持深度估計的時域一致性與空間精度。
  • 跨場景泛化:覆蓋室內、室外、複雜光照及多種材質的真實場景。

LingBot-Depth 2.0的技術原理

  • 雙模型協同架構:LingBot-Depth 2.0 並非單一網絡採用”基座模型 + 任務頭”的兩級協同架構,底層的 LingBot-Vision 負責從 RGB 圖像中提取邊界與空間結構特徵,上層的 LingBot-Depth 則基於這些特徵完成從稀疏或噪聲深度到稠密深度圖的補全映射,解耦設計讓視覺表徵與深度估計各自專注於最擅長的環節,構建起機器人從”看懂”到”看準”的完整能力鏈路。
  • LingBot-Vision:邊界結構預訓練:LingBot-Vision 是業內首個將”邊界結構”作爲顯式預訓練目標的視覺基礎模型,採用幾何建模方式學習”物體在哪裏、邊緣如何分佈、空間如何組織”的結構性知識,使模型具備亞像素級的邊界定位能力;在僅使用 1.6 億張圖像進行預訓練的情況下,其對物體輪廓、表面交界及細小結構的識別清晰度與穩定性均優於依賴十億級數據的通用視覺基礎模型。
  • 深度補全機制:LingBot-Depth 2.0 的深度補全網絡基於 LingBot-Vision 提供的邊界感知特徵,通過編碼器識別深度不連續區域,再經由解碼器進行多尺度特徵融合,在保持物體邊緣銳利的同時對平滑區域進行合理插值;關鍵在於模型利用顯式的邊界結構特徵作爲深度傳播的約束條件,有效防止傳統深度補全中常見的”深度溢出”問題,確保前景與背景在物體邊界處實現正確截斷,同時引入時序特徵對齊機制以保障視頻流輸入下的幀間深度一致性。

LingBot-Depth 2.0 – 螞蟻靈波科技推出的空間感知模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用LingBot-Depth 2.0

  • 獲取模型:從 HuggingFace 或 ModelScope 下載 LingBot-Vision 開源權重。
  • 克隆代碼:通過 GitHub 倉庫 https://github.com/robbyant/lingbot-vision 獲取代碼與技術報告。
  • 環境配置:根據文檔配置依賴環境,準備 RGB-D 輸入數據。
  • 調用推理:加載模型進行深度補全推理,或基於 LingBot-Vision 訓練下游視覺任務。
  • 端側集成:用奧比中光 Gemini 330 系列相機,通過 SDK 接入 LingBot-Depth 商業版能力。

LingBot-Depth 2.0的核心優勢

  • 數據規模領先:訓練數據達 1.5 億,較上一代擴充 50 倍,覆蓋更豐富的真實場景。
  • 測評成績優異:在 16 項深度補全基準測評中斬獲 12 項第一。
  • 誤差顯著降低:室內大面積深度缺失場景 RMSE 誤差較上一代減半。
  • 透明場景突破:在玻璃、鏡面等傳統深度相機失靈場景中表現尤爲突出。
  • 硬件認證加持:通過奧比中光深度視覺實驗室專業認證,邊緣清晰度與魯棒性顯著提升。

LingBot-Depth 2.0的項目地址

  • 項目官網:https://technology.robbyant.com/lingbot-vision
  • GitHub倉庫:https://github.com/robbyant/lingbot-vision
  • HuggingFace模型庫:https://huggingface.co/collections/robbyant/lingbot-vision

LingBot-Depth 2.0的同類競品對比

對比維度 LingBot-Depth 2.0 Depth Anything V2
技術路線 基於邊界結構預訓練的視覺基座模型 + 深度補全 基於 DINOv2 的判別模型 + 合成數據與僞標籤訓練
數據規模 1.5 億真實場景訓練數據 59.5 萬合成圖像 + 6200 萬僞標註真實圖像
核心優勢 透明/反光物體、邊緣精細識別、機器人場景優化 單目深度估計、多尺度模型、推理速度快
開源情況 LingBot-Vision 四版本(ViT-G/L/B/S)已開源 四版本開源(Small 爲 Apache 2.0,其餘 CC-BY-NC-4.0)
產業落地 與奧比中光深度合作,推出 SDK 及一體化相機 學術研究與通用場景爲主

LingBot-Depth 2.0的應用場景

  • 家庭服務機器人:在廚房、衛生間等存在玻璃、鏡面、水龍頭的環境中實現精準導航與操作。
  • 工業質檢:對透明包裝、反光金屬件進行三維尺寸測量與缺陷檢測。
  • 倉儲物流:在複雜光照倉庫中識別貨物邊緣與細小物體,輔助機械臂抓取。
  • 自動駕駛:補全道路場景深度信息,提升透明障礙物(如玻璃幕牆)感知能力。
  • 數採設備:集成於奧比中光 EGO 等 RGB-D 採集設備,爲具身智能訓練提供精準真實世界數據。
© 版權聲明

相關文章

暫無評論

暫無評論...