SALMONN-2 – 清華等開源的通用音頻大語言模型

AI工具9小時前發佈新公告 AI管理員
0 0

SALMONN-2是什麼

SALMONN-2 是清華大學、上海人工智能實驗室與劍橋大學聯合開源的通用音頻大語言模型,基於字節跳動 SPEAR 統一自監督音頻編碼器與多層特徵融合適配器構建,以 Qwen3 爲文本基座,用約 1.8 萬小時監督數據便在 MMAU-Pro、MMAR、MMSU 三大綜合基準上取得同規模開源模型最佳表現,首次在通用 ALLM 中系統實現聲音事件檢測、音頻僞造檢測、語音質量評估與多模態上下文語音識別等進階能力。

SALMONN-2 – 清華等開源的通用音頻大語言模型

SALMONN-2的主要功能

  • 通用音頻理解:支持語音識別、音頻描述、音樂理解、情緒識別、說話人驗證等跨域任務。
  • 聲音事件檢測(SED):可定位並輸出環境聲事件的起止時間段,如狗叫、腳步聲等。
  • 音頻深度僞造檢測:判斷語音真僞,並定位疑似合成或編輯的局部片段時間區間。
  • 語音質量評估(SQA):感知噪聲、失真、清晰度等低層聲學特徵,給出質量評分與解釋。
  • 多模態上下文語音識別(MICL):結合文字拼寫與參考發音音頻,提升生僻詞與罕見人名的識別準確率。

SALMONN-2的技術原理

  • 統一自監督音頻編碼器:SALMONN-2 採用 SPEAR 作爲單一音頻前端,編碼器在大規模無標註音頻數據上通過自監督學習訓練,能同時捕捉語義、發音、音色、說話人及聲學環境信息,替代傳統 Whisper+BEATs 雙編碼器方案,在簡化架構的同時保持更均衡的跨域能力。
  • 多層特徵融合(MLF)適配器:SPEAR 各層編碼的信息層次不同——淺層保留聲學/發音細節,中層攜帶音色/說話人信息,深層積累語義概念;MLF 適配器先對各層隱狀態做層歸一化與拼接,再經可學習的下投影與幀分組壓縮,最終將融合後的層次化表徵映射到語言模型嵌入空間,使模型能根據任務需求靈活調用不同層級的聲學線索。
  • 時間戳注入機制:模型將時間戳以自然語言文本形式(如 <2.0 seconds>)直接插入音頻序列,與音頻嵌入交錯輸入語言模型,使模型在統一生成框架內完成時間定位任務,無需額外的時間戳專用嵌入層。
  • 多模態上下文學習(MICL)訓練:在上下文語音識別任務中,模型不僅接收文本偏置詞表,同時同步獲取這些詞的參考發音音頻作爲多模態上下文;訓練時引入干擾詞與目標詞隨機丟棄策略,防止過偏置,使模型學會在聲學證據支持下合理利用上下文線索。

SALMONN-2 – 清華等開源的通用音頻大語言模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用SALMONN-2

  • 訪問倉庫並克隆代碼:訪問 GitHub 倉庫 https://github.com/bytedance/SALMONN/tree/salmonn2,用 git clone 將代碼下載到本地。
  • 創建運行環境:執行 conda create -n salmonn2 python=3.10 創建虛擬環境並激活,升級 pip、setuptools 與 wheel。
  • 安裝依賴與項目:在倉庫根目錄運行 pip install -r requirements.txtpip install -e . --no-deps,完成 SALMONN-2 及其運行時依賴的安裝。
  • 下載預訓練權重:通過 HuggingFace CLI 下載模型檢查點:hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf
  • 加載模型並推理:用 AutoProcessorAutoModelForCausalLM 加載本地權重,傳入音頻文件與指令文本,調用 model.generate() 可獲取音頻理解結果。

SALMONN-2的核心優勢

  • 數據高效:用約 1.8 萬小時監督數據,遠低於同規模競品常用的數十萬至數百萬小時,顯著降低標註成本。
  • 統一前端更均衡:單一 SPEAR 自監督編碼器替代雙編碼器,在語音、環境聲、音樂及副語言任務間取得更均衡的表現。
  • 層次化信息完整利用:MLF 適配器融合所有編碼器層特徵,避免僅使用末層而丟失聲學/音色等關鍵細節。
  • 擴展音頻分析能力:在通用 ALLM 中首次系統支持 SED、僞造檢測、SQA 等以往被忽視的聲音分析任務。
  • 規模可擴展:將文本基座從 8B 擴展至 30B-A3B 後,三大綜合基準分數均持續提升,驗證架構具備良好的 scale-up 潛力。

SALMONN-2的項目地址

  • GitHub倉庫:https://github.com/bytedance/SALMONN/tree/salmonn2
  • HuggingFace模型庫:https://huggingface.co/marcoyang/SALMONN-2-8B
  • arXiv技術論文:https://arxiv.org/pdf/2607.17079

SALMONN-2的同類競品對比

對比維度 SALMONN-2 MOSS-Audio
模型規模 9B(Qwen3-8B 基座) 9B
監督訓練數據 約 1.8 萬小時 超過 100 萬小時
音頻編碼器 SPEAR 統一自監督編碼器 + MLF 監督式單編碼器
MMAU-Pro 58.5 57.5
MMAR 64.5 64.4
MMSU 69.5 66.4
SED / 僞造檢測 / SQA 原生支持 未系統支持
多模態上下文 ASR 支持(音頻+文本偏置) 未支持
開源協議 開源(GitHub + HuggingFace) 開源

SALMONN-2的應用場景

  • 智能會議助手:實時轉錄會議內容,結合參會人發音示例準確識別外籍人名與專業術語。
  • 音頻內容審覈:自動檢測直播或播客中的異常聲音事件,並識別深度僞造語音以防範詐騙。
  • 語音質量監控:對客服通話、錄音棚素材進行自動化質量評分,定位噪聲與失真片段。
  • 多媒體檔案檢索:爲歷史音頻、廣播節目生成帶時間戳的事件描述,實現基於內容的精準檢索。
  • 輔助聽障設備:將環境聲事件(如門鈴、警報)以文字與時間戳形式實時提示聽障用戶。
© 版權聲明

相關文章

暫無評論

暫無評論...