Hy ASR 3.0 preview – 騰訊混元推出的新一代語音識別模型

AI工具2天前發佈新公告 AI管理員
0 0

Hy ASR 3.0 preview是什麼

Hy ASR 3.0 preview是騰訊混元推出的新一代語音識別模型,基於 Hy3 大語言模型,融合高精度語音識別與深度語義理解。模型支持中文、英語、粵語及10大方言片區,具備上下文智能糾錯、熱詞注入及高噪/耳語等複雜場景魯棒性。開源評測集WER控制在3%左右,自建評測集全面領先競品。

Hy ASR 3.0 preview – 騰訊混元推出的新一代語音識別模型

Hy ASR 3.0 preview的主要功能

  • 通用精準識別: 支持中文普通話、英語、粵語及中英混說,減少錯字漏字與長音頻錯誤累積。
  • 上下文語義理解: 結合 Context 精準捕捉用戶語境,智能糾錯同音詞,消除語義歧義。
  • 熱詞注入適配: 支持品牌名、人名、行業術語等熱詞增強,降低業務接入與維護成本。
  • 複雜環境魯棒: 針對高噪、耳語、悄悄話等聲學場景專項優化,保持穩定識別表現。
  • 方言廣泛覆蓋: 支持10大方言片區、20餘個二級小片區,含東北官話、粵語、吳語、閩南語等。

Hy ASR 3.0 preview的技術原理

  • 架構升級: 採用 MoE 架構,基座模型升級至 Hy3;自研無監督語音 Encoder,基於數千萬小時語音數據訓練,提取高質量聲學表徵。
  • 預訓練 Scaling: Encoder 與 LLM 聯合訓練,引入數千萬小時多來源語音數據(有聲讀物、對話、視頻/廣播等),通過多階段能力注入獲得方言理解與上下文建模能力。
  • 後訓練增強: 構建覆蓋複雜音頻、Any Context 上下文、通用能力的高質量 SFT Recipe;通過多階段強化學習分別優化通用轉寫準確性、上下文長程依賴及複雜長尾場景表現。

如何使用Hy ASR 3.0 preview

通過騰訊雲 API 接入或打開騰訊元寶按住說話即可免費體驗。

Hy ASR 3.0 preview的核心優勢

  • 語義理解升級: 基於 Hy3 大語言模型,融合高精度語音識別與深度語義理解,從逐字轉寫進化爲理解語境、一鍵直出。
  • 評測全面領先: 開源評測集 WER 控制在 3% 左右,自建評測集在通用、方言、上下文、複雜聲學場景均優於競品。
  • 上下文智能糾錯: 結合 Context 精準捕捉語境,智能糾錯同音詞,消除語義歧義,支持長程依賴建模。
  • 熱詞快速適配: 支持品牌名、人名、行業術語等熱詞注入,降低專業場景業務接入與維護成本。
  • 方言與複雜環境覆蓋: 支持 10 大方言片區及 20 餘個二級小片區,在高噪、耳語等複雜聲學環境下保持穩定表現。

Hy ASR 3.0 preview的同類競品對比

對比維度 Hy ASR 3.0 preview(騰訊混元) Doubao-Seed-ASR 2.0(字節跳動)
基座模型 基於 Hy3 大語言模型,MoE 架構 基於 Seed 大語言模型
語音 Encoder 自研無監督語音 Encoder,數千萬小時數據訓練 未公開詳細架構
核心能力 上下文語義理解 + 高精度識別 + 熱詞注入 高精度通用識別
中文 WER 3.34% 3.70%
英文 WER 2.62% 5.65%
粵語 WER 3.12% 5.25%

Hy ASR 3.0 preview的應用場景

  • 智能客服: 電話與在線客服場景下,Hy ASR 3.0 preview 通過熱詞注入精準識別品牌名稱與業務術語,實現語音實時轉寫,顯著提升服務響應效率。
  • 內容創作: 在播客、會議、訪談等長音頻內容生產中,模型結合上下文語義理解智能消除歧義,一鍵輸出連貫可讀的高質量文本,降低後期編輯成本。
  • 語音搜索: 支持用戶使用方言語音進行查詢,並在嘈雜環境下準確識別語音指令,有效降低多語種、多口音用戶的輸入門檻。
  • 辦公協作: 會議紀要實時轉寫場景中,即使面對耳語、悄悄話等低音量輸入,模型依然保持穩定識別,助力團隊實現高效溝通與信息沉澱。
  • 智能終端: 在車載導航、智能家居等 IoT 設備交互中,模型針對高噪聲學環境進行專項優化,保障複雜場景下的語音識別魯棒性與用戶體驗。
© 版權聲明

相關文章

暫無評論

暫無評論...