Xiaomi-CocktailASR-1是什麼
Xiaomi-CocktailASR-1是小米開源的目標說話人語音識別大模型,基於LLM端到端架構,用參考語音作爲聲紋提示,無需語音分離可從多人混合語音中精準轉錄目標說話人。模型在多說話人基準上達SOTA水平,同時兼容單說話人場景,具備負樣本拒識與思維鏈可解釋推理能力,採用Apache 2.0協議開源。

Xiaomi-CocktailASR-1的主要功能
-
目標說話人語音識別:給定參考語音與多人混合音頻,直接轉錄目標說話人的內容,無需語音分離。
-
單說話人兼容:同一模型即可處理單人場景,性能媲美主流單說話人 ASR,無需切換模型。
-
負樣本拒識:目標說話人不在音頻中時輸出空文本,有效降低誤觸發。
-
思維鏈推理:CoT 模式輸出說話人數、性別、聲紋相似度等推理過程,兼顧可解釋性與識別精度。
Xiaomi-CocktailASR-1的技術原理
- 端到端統一架構:模型由三部分組成:基於 Data2Vec2 改進的 0.6B 音頻編碼器、輕量級線性 Adapter,及 Qwen3-8B 大語言模型骨幹。輸入按「參考語音 + 1 秒靜音 + 混合語音」的順序拼接,編碼器輸出幀級特徵後,經 Adapter 對齊到 LLM 隱空間,與文本 Prompt 共同送入 LLM 生成目標說話人的轉錄。
- 參考語音作爲條件提示:編碼器用 Data2Vec2 自監督掩碼預測機制,在單一網絡內融合語義與說話人信息,無需獨立聲紋編碼器;參考語音被視作條件 Prompt,使編碼器在特徵提取階段即自適應聚焦目標說話人、抑制干擾語音,從源頭避免傳統「分離+識別」級聯繫統的誤差累積。
- 多能力平衡的多階段訓練:通過約百萬小時數據配比訓練統一四種能力:約 40 萬小時多說話人數據訓練目標提取,約 60 萬小時同說話人蔘考-目標對防止單場景過度抑制,約 1 萬小時錯配參考的負樣本內化拒識能力且推理無需閾值,另有 CoT 數據教會模型先輸出推理鏈再給出答案。
- 雙模式 Prompt 與拒識機制:標準模式用統一 Prompt 同時覆蓋單人識別、多人目標識別與負樣本拒識三類任務,目標缺失時模型自然輸出空文本;CoT 模式則以獨立 Prompt 觸發
<think>推理標籤,輸出說話人數量、性別與聲紋相似度等中間步驟後再給出<answer>最終轉錄,提升可解釋性並小幅降低 WER。
如何使用Xiaomi-CocktailASR-1
-
安裝依賴:執行
pip install torch torchaudio transformers soundfile安裝所需環境。 -
下載模型:從 HuggingFace(
Ease3/Xiaomi-CocktailASR-1)下載模型權重文件。 -
加載模型:通過
AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval()加載模型。 -
準備音頻:準備一段 16k 單聲道參考語音(目標說話人聲紋)和一段待識別的單人/多人音頻(非 16k 會自動重採樣)。
-
單條推理:調用
model("target.wav", "ref_speaker.wav")即可返回目標說話人的轉錄文本(負樣本時自動輸出空文本,無需額外參數)。 -
思維鏈推理:追加
cot=True參數,模型會在<think>中輸出推理過程、在<answer>中輸出最終結果。 -
批量推理:將數據整理爲 5 列 TSV(
utt_id, wav, text, ref_wav, ref_id),運行tools/test_batch_scp.py並指定模型路徑、輸入 TSV 和輸出文件即可批量轉錄。
Xiaomi-CocktailASR-1的核心優勢
-
多說話人 SOTA 性能:在 AliMeeting、AMI、LibriMix 等多個主流多說話人基準上達到最優識別水平(如 AliMeeting Far WER 20.63%,此前 SOTA 爲 27.5%)。
-
單多人場景統一:同一模型在單說話人場景下性能媲美主流 ASR,無需按說話人數切換模型。
-
負樣本拒識能力:目標說話人缺席時輸出空文本,拒識率達 68%-80%,而 Qwen3-ASR、StepAudio 等模型拒識率爲 0。
-
思維鏈可解釋推理:CoT 模式輸出說話人數、性別、聲紋相似度等推理過程,既提升可解釋性又能小幅降低 WER。
-
端到端簡潔架構:參考語音直接作爲聲紋 Prompt,免去傳統語音分離模塊,避免級聯繫統的誤差累積。
-
使用門檻低:一行代碼調用、支持自動重採樣與批量推理、提供正負樣本 Demo,開箱即用。
Xiaomi-CocktailASR-1的項目地址
- GitHub倉庫:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
- HuggingFace模型庫:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
- arXiv技術論文:https://arxiv.org/pdf/2609.11274
Xiaomi-CocktailASR-1的同類競品對比
| 對比維度 | Xiaomi-CocktailASR-1 | Qwen3-ASR |
|---|---|---|
| 產品定位 | 目標說話人語音識別(TS-ASR),專攻多人混合場景 | 通用語音識別大模型(LALM),覆蓋多語言與方言 |
| 多說話人識別 | 🏆 SOTA:LibriMix 2mix WER 4.11%,AliMeeting Far 20.63% | 基本失效:LibriMix 2mix WER 68.75%,AliMeeting Far 39.64% |
| 單說話人識別 | 強勁:LibriSpeech WER 1.73%,CommonVoice(zh) 4.95% | 相當:LibriSpeech WER 1.87%,CommonVoice(zh) 5.39% |
| 負樣本拒識 | ✅ 拒識率 68%-80%(LibriSpeech neg 79.59%) | ❌ 拒識率 0%,目標缺席時仍會誤轉錄 |
| 可解釋推理 | ✅ 支持 CoT 思維鏈,輸出聲紋相似度等推理過程 | ❌ 不支持 |
| 技術架構 | Data2Vec2 編碼器 + Adapter + Qwen3-8B,參考語音作 Prompt 免語音分離 | 通用音頻編碼 + LLM 端到端架構 |
| 使用方式 | model(target, ref) 一行調用,需目標說話人蔘考音頻 |
常規 ASR 調用,無需參考音頻 |
Xiaomi-CocktailASR-1的應用場景
-
智能會議定向轉寫:在多人會議中只聽轉指定發言人的內容,自動過濾其他與會者的插話與討論。
-
語音助手機主指令識別:手機/音箱/車載場景下只對機主語音響應,背景人聲不會誤觸發指令。
-
客服與質檢錄音分析:從多人通話錄音中精準提取指定一方的完整話術,用於合規質檢與服務評估。
-
智能家居語音控制:電視喧鬧、多人交談的家庭環境中,準確識別遙控器持有者的語音指令,避免誤操作。
-
無障礙助聽與記錄設備:爲聽障人士或記錄者定向提取特定說話人的語音內容並實時轉文字,嘈雜社交場合中專注「聽清」想聽的人。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...