Audio-Visual Flamingo是什麼
Audio-Visual Flamingo(簡稱 AV-Flamingo)是 NVIDIA 與馬里蘭大學聯合推出的開源音頻-視覺大語言模型,專爲長視頻與複雜真實世界音視頻內容的聯合理解與推理而設計。模型能同時處理視覺與聽覺輸入,還支持語音交互輸出,在 15 項以上音視頻、全模態及視覺基準測試中,用 7B 參數規模超越衆多更大尺寸的開源與閉源模型。

Audio-Visual Flamingo的主要功能
-
長視頻音視頻聯合理解:支持最長 15 分鐘的視頻輸入,同步解析畫面、語音、環境聲與音樂。
-
跨模態推理:回答需同時結合視覺與聽覺信息的問題(如”視頻中某個聲音對應什麼畫面”)。
-
時間定位推理:通過 TAVIT 框架將推理步驟顯式錨定到視頻時間戳,提升時間對齊與可解釋性。
-
語音對話輸出:集成流式 TTS,支持基於音視頻內容的實時語音回覆。
-
多技能覆蓋:涵蓋關係推理、情緒變化追蹤、因果推理、時空感知、幻覺檢測、事件計數等 13 類能力。
Audio-Visual Flamingo的技術原理
-
架構:採用 SigLip 視覺編碼器 + AF-Whisper 音頻編碼器,分別提取圖像/視頻幀特徵與音頻特徵;通過 2 層 MLP 投影器將兩者映射到 LLM 嵌入空間。
-
跨模態時序對齊:將視覺與音頻 token 按時間窗口交錯排列,並引入約束性旋轉時間嵌入(CRTE),使模型能感知多模態事件的絕對時序與相對順序。
-
三階段訓練課程:(1) 預訓練:使用 AV-Skills 短上下文數據;(2) 中訓練:使用 AV-Skills 長上下文數據;(3) 後訓練:用鏈式思維數據,逐步從短程感知過渡到長程多事件推理。
-
數據集:Audio-Visual-Skills包含約 700 萬條訓練實例,覆蓋 24 萬小時視頻,專門強調時序、組合與跨模態推理。
-
基座模型:基於 Qwen2.5-7B,採用混合序列並行與全分片數據並行策略處理長上下文。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Audio-Visual Flamingo
-
獲取模型:訪問 AV-Flamingo 的 GitHub 倉庫或 Hugging Face 頁面,下載開源的模型權重、推理代碼及配置文件。
-
環境配置:配置 Python 環境並安裝項目依賴,確保 GPU 顯存足以加載 7B 參數模型及其多模態編碼器。
-
準備輸入:將待分析的圖像、視頻或音頻文件作爲輸入,同時編寫具體的文本問題或指令。
-
視覺編碼:視覺輸入由 SigLip 編碼器提取多尺度空間特徵,經 Dynamic S² 模塊壓縮爲緊湊的視覺 token 序列。
-
音頻編碼:音頻輸入經重採樣後由 AF-Whisper 編碼器以 30 秒滑動窗口方式提取特徵,支持任意長度的音頻流。
-
跨模態對齊:模型自動通過投影層將音視頻特徵映射到 LLM 嵌入空間,並按時間窗口交錯排列,附加旋轉時間嵌入保留絕對時序。
-
推理生成:將處理後的多模態 token 與文本提示詞拼接,輸入 Qwen2.5-7B 進行自迴歸推理,生成文本回答。
Audio-Visual Flamingo的核心優勢
-
長視頻專精:針對 1 分鐘以上甚至 15 分鐘的長視頻優化,解決現有模型在長視頻上性能驟降的問題。
-
真正的聯合推理:數據集與訓練目標均針對跨模態設計,非簡單拼接單模態能力。
-
時序可解釋性:TAVIT 讓模型在回答長視頻問題時,能顯式引用”第 22 秒到 45 秒”等具體時間區間作爲推理依據。
-
完全開源:相比 GPT-4o、Gemini 等閉源方案,AV-Flamingo 在模型、數據、代碼層面全面開放。
Audio-Visual Flamingo的項目地址
- 項目官網:https://avflamingo.pages.dev/
- GitHub倉庫:https://github.com/NVIDIA/audio-flamingo
- HuggingFace模型庫:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
- arXiv技術論文:https://arxiv.org/pdf/2607.16107
Audio-Visual Flamingo的同類競品對比
| 對比維度 | AV-Flamingo | Qwen3.5-Omni |
|---|---|---|
| 研發方 | NVIDIA + 馬里蘭大學 | 阿里巴巴 |
| 開源程度 | 完全開源(權重、代碼、數據方法均公開) | 僅開源權重,訓練數據與方法未公開 |
| 參數規模 | 7B | 未公開(推測更大) |
| 核心定位 | 長視頻音視頻聯合理解與顯式時序推理 | 全模態實時對話與生成 |
| 長視頻優化 | 專門支持最長 15 分鐘,三階段課程訓練 | 支持長序列,但無針對長視頻的專門課程 |
| 時序推理 | TAVIT 框架將推理步驟顯式錨定到時間戳 | 無顯式時間戳 grounding 機制 |
| 訓練數據 | AV-Skills(約 700 萬實例、24 萬小時、13 類技能) | 未公開 |
| 語音輸出 | 流式 TTS,基於文本 token 實時解碼 | 支持語音輸出,具體機制未公開 |
| 長視頻基準 | 在 MMOU 長視頻推理上超越更大模型 | 長視頻性能隨時長增加而下降 |
Audio-Visual Flamingo的應用場景
-
影視內容分析:自動生成長電影/電視劇的帶時間戳的詳細解說,定位關鍵情節與音效。
-
教育與在線課程:對長講座視頻進行跨模態問答,學生可詢問”老師在第幾分鐘提到了某個公式”。
-
體育與賽事覆盤:結合畫面與現場解說,分析戰術變化、進球瞬間與評論員觀點。
-
播客與訪談處理:爲純音頻或音視頻播客生成結構化摘要,並支持基於時間戳的精確檢索。
-
安防與監控審查:在長時間監控錄像中,通過聲音(如玻璃破碎)+ 畫面聯合定位異常事件。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...