Omnilingual ASR – Meta AI推出的自動語音識別系統

AI工具10個月前發佈新公告 AI管理員
0 0

Omnilingual ASR是什麼

Omnilingual ASR 是 Meta AI 推出的自動語音識別系統,支持超過1600種語言,包括500種低資源語言。Omnilingual ASR通過擴展 wav2vec 2.0 編碼器到70億參數,引入兩種解碼器,實現卓越的性能,78%的語言字符錯誤率低於10%。Omnilingual ASR 框架社區驅動,用戶只需提供少量樣本能擴展到新語言。同時,Meta 開源了 Omnilingual ASR Corpus 數據集和 Omnilingual wav2vec 2.0全新的自監督式大規模多語言語音表示模型,助力全球語音技術發展,推動語言平等與文化交流。

Omnilingual ASR – Meta AI推出的自動語音識別系統

Omnilingual ASR的主要功能

  • 多語言語音轉錄:Omnilingual ASR 能將超過 1600 種語言的語音轉換爲文本,包括許多低資源語言和從未被 AI 轉錄過的語言。
  • 社區擴展能力:用戶能通過提供少量音頻和文本樣本,將模型擴展到新的語言,無需大量訓練數據或專業知識。
  • 高性能與低錯誤率:在 78% 的語言中,字符錯誤率(CER)低於 10%,達到行業領先水平。
  • 多種模型選擇:提供從輕量級 300M 到強大的 7B 模型,適用於不同設備和用例。
  • 開源與數據共享:開源 Omnilingual wav2vec 2.0 模型和 Omnilingual ASR Corpus 數據集,支持全球開發者和研究者進行進一步開發和研究。

Omnilingual ASR的技術原理

  • wav2vec 2.0 擴展:將 wav2vec 2.0 編碼器擴展到 70 億參數,能從原始語音數據中提取豐富的多語言語義表徵。
  • 雙解碼器架構:使用兩種解碼器,傳統的連接主義時間分類(CTC)和基於 Transformer 的解碼器,後者借鑑大型語言模型(LLM)的技術,顯著提升長尾語言的性能。
  • 上下文學習能力:受 LLM 啓發,模型能通過少量上下文樣本快速適應新語言,無需大規模訓練數據或複雜調整。
  • 大規模多語言數據集:訓練語料庫整合公開數據集和社區提供的語音記錄,覆蓋大量低資源語言,爲模型提供廣泛的語言基礎。

Omnilingual ASR的項目地址

  • 項目官網:https://ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition/
  • GitHub倉庫:https://github.com/facebookresearch/omnilingual-asr
  • HuggingFace模型庫:https://huggingface.co/datasets/facebook/omnilingual-asr-corpus
  • 技術論文:https://ai.meta.com/research/publications/omnilingual-asr-open-source-multilingual-speech-recognition-for-1600-languages/

Omnilingual ASR的應用場景

  • 跨語言交流:幫助不同語言背景的人進行實時語音交流,打破語言障礙,促進國際合作與文化交流。
  • 低資源語言保護:爲瀕臨滅絕或低資源語言提供高質量語音轉錄工具,助力語言保護和傳承。
  • 教育與學習:在多語言教育中輔助教學,幫助學生練習發音,或爲語言學習者提供即時語音翻譯。
  • 語音助手擴展:爲智能語音助手添加更多語言支持,使其能服務更廣泛的用戶羣體。
  • 內容創作與媒體:自動轉錄多語言視頻、音頻內容,提高內容創作效率,支持多語言字幕生成。
© 版權聲明

相關文章

暫無評論

暫無評論...