Xiaomi-CocktailASR-1 – 小米開源的說話人語音識別模型

AI工具14小時前發佈新公告 AI管理員
0 0

Xiaomi-CocktailASR-1是什麼

Xiaomi-CocktailASR-1是小米開源的目標說話人語音識別大模型,基於LLM端到端架構,用參考語音作爲聲紋提示,無需語音分離可從多人混合語音中精準轉錄目標說話人。模型在多說話人基準上達SOTA水平,同時兼容單說話人場景,具備負樣本拒識與思維鏈可解釋推理能力,採用Apache 2.0協議開源。

Xiaomi-CocktailASR-1 – 小米開源的說話人語音識別模型

Xiaomi-CocktailASR-1的主要功能

  • 目標說話人語音識別:給定參考語音與多人混合音頻,直接轉錄目標說話人的內容,無需語音分離。
  • 單說話人兼容:同一模型即可處理單人場景,性能媲美主流單說話人 ASR,無需切換模型。
  • 負樣本拒識:目標說話人不在音頻中時輸出空文本,有效降低誤觸發。
  • 思維鏈推理:CoT 模式輸出說話人數、性別、聲紋相似度等推理過程,兼顧可解釋性與識別精度。

Xiaomi-CocktailASR-1的技術原理

  • 端到端統一架構:模型由三部分組成:基於 Data2Vec2 改進的 0.6B 音頻編碼器、輕量級線性 Adapter,及 Qwen3-8B 大語言模型骨幹。輸入按「參考語音 + 1 秒靜音 + 混合語音」的順序拼接,編碼器輸出幀級特徵後,經 Adapter 對齊到 LLM 隱空間,與文本 Prompt 共同送入 LLM 生成目標說話人的轉錄。
  • 參考語音作爲條件提示:編碼器用 Data2Vec2 自監督掩碼預測機制,在單一網絡內融合語義與說話人信息,無需獨立聲紋編碼器;參考語音被視作條件 Prompt,使編碼器在特徵提取階段即自適應聚焦目標說話人、抑制干擾語音,從源頭避免傳統「分離+識別」級聯繫統的誤差累積。
  • 多能力平衡的多階段訓練:通過約百萬小時數據配比訓練統一四種能力:約 40 萬小時多說話人數據訓練目標提取,約 60 萬小時同說話人蔘考-目標對防止單場景過度抑制,約 1 萬小時錯配參考的負樣本內化拒識能力且推理無需閾值,另有 CoT 數據教會模型先輸出推理鏈再給出答案。
  • 雙模式 Prompt 與拒識機制:標準模式用統一 Prompt 同時覆蓋單人識別、多人目標識別與負樣本拒識三類任務,目標缺失時模型自然輸出空文本;CoT 模式則以獨立 Prompt 觸發 <think> 推理標籤,輸出說話人數量、性別與聲紋相似度等中間步驟後再給出 <answer> 最終轉錄,提升可解釋性並小幅降低 WER。

如何使用Xiaomi-CocktailASR-1

  • 安裝依賴:執行 pip install torch torchaudio transformers soundfile 安裝所需環境。
  • 下載模型:從 HuggingFace(Ease3/Xiaomi-CocktailASR-1)下載模型權重文件。
  • 加載模型:通過 AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval() 加載模型。
  • 準備音頻:準備一段 16k 單聲道參考語音(目標說話人聲紋)和一段待識別的單人/多人音頻(非 16k 會自動重採樣)。
  • 單條推理:調用 model("target.wav", "ref_speaker.wav") 即可返回目標說話人的轉錄文本(負樣本時自動輸出空文本,無需額外參數)。
  • 思維鏈推理:追加 cot=True 參數,模型會在 <think> 中輸出推理過程、在 <answer> 中輸出最終結果。
  • 批量推理:將數據整理爲 5 列 TSV(utt_id, wav, text, ref_wav, ref_id),運行 tools/test_batch_scp.py 並指定模型路徑、輸入 TSV 和輸出文件即可批量轉錄。

Xiaomi-CocktailASR-1的核心優勢

  • 多說話人 SOTA 性能:在 AliMeeting、AMI、LibriMix 等多個主流多說話人基準上達到最優識別水平(如 AliMeeting Far WER 20.63%,此前 SOTA 爲 27.5%)。
  • 單多人場景統一:同一模型在單說話人場景下性能媲美主流 ASR,無需按說話人數切換模型。
  • 負樣本拒識能力:目標說話人缺席時輸出空文本,拒識率達 68%-80%,而 Qwen3-ASR、StepAudio 等模型拒識率爲 0。
  • 思維鏈可解釋推理:CoT 模式輸出說話人數、性別、聲紋相似度等推理過程,既提升可解釋性又能小幅降低 WER。
  • 端到端簡潔架構:參考語音直接作爲聲紋 Prompt,免去傳統語音分離模塊,避免級聯繫統的誤差累積。
  • 使用門檻低:一行代碼調用、支持自動重採樣與批量推理、提供正負樣本 Demo,開箱即用。

Xiaomi-CocktailASR-1的項目地址

  • GitHub倉庫:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
  • HuggingFace模型庫:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
  • arXiv技術論文:https://arxiv.org/pdf/2609.11274

Xiaomi-CocktailASR-1的同類競品對比

對比維度 Xiaomi-CocktailASR-1 Qwen3-ASR
產品定位 目標說話人語音識別(TS-ASR),專攻多人混合場景 通用語音識別大模型(LALM),覆蓋多語言與方言
多說話人識別 🏆 SOTA:LibriMix 2mix WER 4.11%,AliMeeting Far 20.63% 基本失效:LibriMix 2mix WER 68.75%,AliMeeting Far 39.64%
單說話人識別 強勁:LibriSpeech WER 1.73%,CommonVoice(zh) 4.95% 相當:LibriSpeech WER 1.87%,CommonVoice(zh) 5.39%
負樣本拒識 ✅ 拒識率 68%-80%(LibriSpeech neg 79.59%) ❌ 拒識率 0%,目標缺席時仍會誤轉錄
可解釋推理 ✅ 支持 CoT 思維鏈,輸出聲紋相似度等推理過程 ❌ 不支持
技術架構 Data2Vec2 編碼器 + Adapter + Qwen3-8B,參考語音作 Prompt 免語音分離 通用音頻編碼 + LLM 端到端架構
使用方式 model(target, ref) 一行調用,需目標說話人蔘考音頻 常規 ASR 調用,無需參考音頻

Xiaomi-CocktailASR-1的應用場景

  • 智能會議定向轉寫:在多人會議中只聽轉指定發言人的內容,自動過濾其他與會者的插話與討論。
  • 語音助手機主指令識別:手機/音箱/車載場景下只對機主語音響應,背景人聲不會誤觸發指令。
  • 客服與質檢錄音分析:從多人通話錄音中精準提取指定一方的完整話術,用於合規質檢與服務評估。
  • 智能家居語音控制:電視喧鬧、多人交談的家庭環境中,準確識別遙控器持有者的語音指令,避免誤操作。
  • 無障礙助聽與記錄設備:爲聽障人士或記錄者定向提取特定說話人的語音內容並實時轉文字,嘈雜社交場合中專注「聽清」想聽的人。
© 版權聲明

相關文章

暫無評論

暫無評論...