MatAnyone – 南洋理工和商湯科技推出的人像視頻摳圖框架

AI工具2年前 (2025)發佈新公告 AI管理員
0 0

MatAnyone是什麼

MatAnyone是南洋理工大學S-Lab實驗室和商湯科技推出的,針對複雜背景人像視頻摳圖的先進框架,專注於目標指定的視頻摳圖任務。MatAnyone基於一致的內存傳播模塊和區域自適應內存融合技術,確保在視頻序列中核心區域的語義穩定性和邊界細節的精細度。MatAnyone引入新的訓練策略,用大規模分割數據直接監督摳圖頭,顯著提升模型在真實場景下的穩定性和泛化能力。MatAnyone配備了高質量、多樣化的訓練數據集VM800和更具挑戰性的測試數據集YoutubeMatte,爲模型訓練和評估提供堅實基礎。

MatAnyone – 南洋理工和商湯科技推出的人像視頻摳圖框架

MatAnyone的主要功能

  • 穩定的目標跟蹤:在整個視頻中穩定地跟蹤目標對象,在複雜或模糊的背景中保持目標的完整性。
  • 精細的邊界細節提取:支持生成高質量的alpha遮罩,尤其是在邊界區域(如頭髮、邊緣等)表現出色,提供圖像級的細節精度。
  • 適應多種視頻類型:MatAnyone能處理不同類型的視頻,包括電影、遊戲、智能手機視頻等,適應多種幀尺寸和媒體格式。
  • 交互性增強:用戶能在第一幀指定目標分割掩碼引導整個視頻的摳圖過程,實現更精準的交互式視頻編輯。

MatAnyone的技術原理

  • 一致內存傳播
    • 內存融合:CMP模塊基於估計當前幀與前一幀之間的alpha值變化,自適應地融合來自前一幀的信息。對於“大變化”區域(通常位於邊界),更多依賴當前幀的信息;對於“小變化”區域(通常位於核心區域),保留前一幀的內存。
    • 區域自適應:基於輕量級的邊界區域預測模塊,估計每個查詢令牌的變化概率,實現區域自適應的內存融合,顯著提高核心區域的語義穩定性和邊界區域的細節精度。
  • 核心區域監督
    • 分割數據的直接監督:爲克服真實視頻摳圖數據稀缺的問題,MatAnyone用大規模真實分割數據直接監督摳圖頭。基於在覈心區域使用像素級損失(Lcore)和在邊界區域使用改進的DDC損失(Lboundary),確保語義穩定性和細節精度。
    • 改進的DDC損失:基於調整DDC損失的計算方式,使其更適合視頻摳圖任務,避免傳統DDC損失在邊界區域產生的鋸齒狀和階梯狀邊緣。
  • 新數據集和訓練策略
    • 高質量訓練數據集:引入新的訓練數據集VM800,規模是現有數據集VideoMatte240K的兩倍,且在覈心和邊界區域的質量更高,顯著提升模型的訓練效果。
    • 多階段訓練:採用多階段訓練策略,先在視頻摳圖數據上初始化模型,基於分割數據進行核心區域監督,最後用圖像摳圖數據進一步優化邊界細節。
  • 網絡架構
    • 編碼器:採用ResNet-50作爲編碼器,提取特徵並生成查詢和鍵。
    • 對象變換器:基於對象變換器模塊,將像素級內存按對象語義進行分組,減少低層次像素匹配帶來的噪聲。
    • 解碼器:解碼器基於多級上採樣和跳躍連接,生成高精度的alpha遮罩。
    • 值編碼器:將預測的alpha遮罩和圖像特徵編碼爲值,用在更新內存庫。

MatAnyone的項目地址

  • 項目官網:https://pq-yang.github.io/projects/MatAnyone/
  • GitHub倉庫:https://github.com/pq-yang/MatAnyone
  • arXiv技術論文:https://arxiv.org/pdf/2501.14677

MatAnyone的應用場景

  • 影視後期製作:用在背景替換和特效合成,將演員從原始背景中精準摳出,替換爲虛擬或特效背景,提升畫面的視覺效果和創意空間。
  • 視頻會議與直播:在視頻會議和直播中,實時將人物從複雜背景中分離出來,替換爲虛擬背景或模糊背景,增強隱私保護和視覺效果。
  • 廣告與營銷:在廣告視頻製作中,將產品或人物從拍攝背景中摳出,替換爲更具吸引力的背景,提升廣告的視覺衝擊力和吸引力。
  • 遊戲開發:用在遊戲中的視頻內容製作,如角色動畫、過場動畫等,將角色從拍攝背景中精準摳出,替換爲遊戲場景,增強遊戲的沉浸感。
  • 虛擬現實與增強現實:在VR和AR應用中,將用戶或物體從現實場景中摳出,融合到虛擬環境中,提升用戶體驗和交互效果。
© 版權聲明

相關文章

暫無評論

暫無評論...