X-Prompt – 用於多模態視頻目標分割的通用框架

AI工具2年前 (2025)發佈新公告 AI管理員
0 0

X-Prompt是什麼

X-Prompt是用於多模態視頻目標分割的通用框架,解決傳統方法在極端光照、快速運動和背景干擾等複雜場景下的侷限性。通過預訓練一個基於 RGB 數據的視頻目標分割基礎模型,使用額外的模態信息(如熱成像、深度或事件相機數據)作爲視覺提示,將基礎模型適應到下游的多模態任務中。

X-Prompt – 用於多模態視頻目標分割的通用框架

X-Prompt的主要功能

  • 多模態適應:X-Prompt 基於多模態視覺提示器(MVP)將額外模態信息編碼爲視覺提示,結合 RGB 數據,增強基礎模型在多模態任務中的分割能力。
  • 保持泛化能力:通過多模態自適應專家(MAEs),X-Prompt 在不損害基礎模型泛化能力的情況下,爲每個模態提供特定的知識,避免了全參數微調可能導致的模型崩潰。
  • 高效任務遷移:能在有限的多模態標註數據下,快速適應新的下游任務,減少了針對每個任務單獨設計和訓練模型的研究工作量和硬件成本。
  • 多任務整合:X-Prompt 支持多種多模態任務(如 RGB-T、RGB-D 和 RGB-E),通過統一的框架實現任務整合,顯著提高了模型在複雜場景下的性能。

X-Prompt的技術原理

  • 基礎模型預訓練:X-Prompt 的基礎模型是基於 Vision Transformer 的視頻目標分割模型,使用大量的 RGB 視頻序列進行預訓練,獲得強大的分割能力和泛化能力。預訓練階段的目標是讓模型能根據參考幀及其分割掩碼,對當前幀中的目標對象進行分割。
  • 多模態視覺提示器(MVP):MVP 的作用是將額外模態的信息(如熱成像、深度或事件相機數據)編碼爲視覺提示,將其整合到基礎模型中。通過多尺度卷積嵌入層,MVP 將 RGB 和 X 模態的圖像塊嵌入到多尺度提示中,這些提示被用於引導基礎模型進行目標分割。
  • 多模態適應專家(MAE):MAE 通過低秩適應機制,爲每個模態提供特定的知識,同時保留基礎模型的通用能力。MAE 的設計支持在不損害基礎模型泛化能力的情況下,對模型進行微調,適應特定的多模態任務。

X-Prompt的項目地址

  • arXiv技術論文:https://arxiv.org/pdf/2409.19342

X-Prompt的應用場景

  • 自動駕駛:通過結合熱成像和深度信息,X-Prompt 可以更準確地識別和分割道路上的目標,提高自動駕駛系統的安全性。
  • 機器人視覺:在複雜環境中,多模態信息可以幫助機器人更準確地識別和操作目標物體。
  • 視頻監控:在低光照或複雜背景的監控場景中,X-Prompt 能用多模態數據提高目標檢測和分割的準確性。
© 版權聲明

相關文章

暫無評論

暫無評論...