Audio-Visual Flamingo – 英偉達等開源的音頻視覺語言模型

AI工具1周前發佈新公告 AI管理員
0 0

Audio-Visual Flamingo是什麼

Audio-Visual Flamingo(簡稱 AV-Flamingo)是 NVIDIA 與馬里蘭大學聯合推出的開源音頻-視覺大語言模型,專爲長視頻與複雜真實世界音視頻內容的聯合理解與推理而設計。模型能同時處理視覺與聽覺輸入,還支持語音交互輸出,在 15 項以上音視頻、全模態及視覺基準測試中,用 7B 參數規模超越衆多更大尺寸的開源與閉源模型。

Audio-Visual Flamingo – 英偉達等開源的音頻視覺語言模型

Audio-Visual Flamingo的主要功能

  • 長視頻音視頻聯合理解:支持最長 15 分鐘的視頻輸入,同步解析畫面、語音、環境聲與音樂。
  • 跨模態推理:回答需同時結合視覺與聽覺信息的問題(如”視頻中某個聲音對應什麼畫面”)。
  • 時間定位推理:通過 TAVIT 框架將推理步驟顯式錨定到視頻時間戳,提升時間對齊與可解釋性。
  • 語音對話輸出:集成流式 TTS,支持基於音視頻內容的實時語音回覆。
  • 多技能覆蓋:涵蓋關係推理、情緒變化追蹤、因果推理、時空感知、幻覺檢測、事件計數等 13 類能力。

Audio-Visual Flamingo的技術原理

  • 架構:採用 SigLip 視覺編碼器 + AF-Whisper 音頻編碼器,分別提取圖像/視頻幀特徵與音頻特徵;通過 2 層 MLP 投影器將兩者映射到 LLM 嵌入空間。
  • 跨模態時序對齊:將視覺與音頻 token 按時間窗口交錯排列,並引入約束性旋轉時間嵌入(CRTE),使模型能感知多模態事件的絕對時序與相對順序。
  • 三階段訓練課程:(1) 預訓練:使用 AV-Skills 短上下文數據;(2) 中訓練:使用 AV-Skills 長上下文數據;(3) 後訓練:用鏈式思維數據,逐步從短程感知過渡到長程多事件推理。
  • 數據集:Audio-Visual-Skills包含約 700 萬條訓練實例,覆蓋 24 萬小時視頻,專門強調時序、組合與跨模態推理。
  • 基座模型:基於 Qwen2.5-7B,採用混合序列並行與全分片數據並行策略處理長上下文。

Audio-Visual Flamingo – 英偉達等開源的音頻視覺語言模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Audio-Visual Flamingo

  • 獲取模型:訪問 AV-Flamingo 的 GitHub 倉庫或 Hugging Face 頁面,下載開源的模型權重、推理代碼及配置文件。
  • 環境配置:配置 Python 環境並安裝項目依賴,確保 GPU 顯存足以加載 7B 參數模型及其多模態編碼器。
  • 準備輸入:將待分析的圖像、視頻或音頻文件作爲輸入,同時編寫具體的文本問題或指令。
  • 視覺編碼:視覺輸入由 SigLip 編碼器提取多尺度空間特徵,經 Dynamic S² 模塊壓縮爲緊湊的視覺 token 序列。
  • 音頻編碼:音頻輸入經重採樣後由 AF-Whisper 編碼器以 30 秒滑動窗口方式提取特徵,支持任意長度的音頻流。
  • 跨模態對齊:模型自動通過投影層將音視頻特徵映射到 LLM 嵌入空間,並按時間窗口交錯排列,附加旋轉時間嵌入保留絕對時序。
  • 推理生成:將處理後的多模態 token 與文本提示詞拼接,輸入 Qwen2.5-7B 進行自迴歸推理,生成文本回答。

Audio-Visual Flamingo的核心優勢

  • 長視頻專精:針對 1 分鐘以上甚至 15 分鐘的長視頻優化,解決現有模型在長視頻上性能驟降的問題。
  • 真正的聯合推理:數據集與訓練目標均針對跨模態設計,非簡單拼接單模態能力。
  • 時序可解釋性:TAVIT 讓模型在回答長視頻問題時,能顯式引用”第 22 秒到 45 秒”等具體時間區間作爲推理依據。
  • 完全開源:相比 GPT-4o、Gemini 等閉源方案,AV-Flamingo 在模型、數據、代碼層面全面開放。

Audio-Visual Flamingo的項目地址

  • 項目官網:https://avflamingo.pages.dev/
  • GitHub倉庫:https://github.com/NVIDIA/audio-flamingo
  • HuggingFace模型庫:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
  • arXiv技術論文:https://arxiv.org/pdf/2607.16107

Audio-Visual Flamingo的同類競品對比

對比維度 AV-Flamingo Qwen3.5-Omni
研發方 NVIDIA + 馬里蘭大學 阿里巴巴
開源程度 完全開源(權重、代碼、數據方法均公開) 僅開源權重,訓練數據與方法未公開
參數規模 7B 未公開(推測更大)
核心定位 長視頻音視頻聯合理解與顯式時序推理 全模態實時對話與生成
長視頻優化 專門支持最長 15 分鐘,三階段課程訓練 支持長序列,但無針對長視頻的專門課程
時序推理 TAVIT 框架將推理步驟顯式錨定到時間戳 無顯式時間戳 grounding 機制
訓練數據 AV-Skills(約 700 萬實例、24 萬小時、13 類技能) 未公開
語音輸出 流式 TTS,基於文本 token 實時解碼 支持語音輸出,具體機制未公開
長視頻基準 在 MMOU 長視頻推理上超越更大模型 長視頻性能隨時長增加而下降

Audio-Visual Flamingo的應用場景

  • 影視內容分析:自動生成長電影/電視劇的帶時間戳的詳細解說,定位關鍵情節與音效。
  • 教育與在線課程:對長講座視頻進行跨模態問答,學生可詢問”老師在第幾分鐘提到了某個公式”。
  • 體育與賽事覆盤:結合畫面與現場解說,分析戰術變化、進球瞬間與評論員觀點。
  • 播客與訪談處理:爲純音頻或音視頻播客生成結構化摘要,並支持基於時間戳的精確檢索。
  • 安防與監控審查:在長時間監控錄像中,通過聲音(如玻璃破碎)+ 畫面聯合定位異常事件。
© 版權聲明

相關文章

暫無評論

暫無評論...