Hy ASR 3.0 preview是什麼
Hy ASR 3.0 preview是騰訊混元推出的新一代語音識別模型,基於 Hy3 大語言模型,融合高精度語音識別與深度語義理解。模型支持中文、英語、粵語及10大方言片區,具備上下文智能糾錯、熱詞注入及高噪/耳語等複雜場景魯棒性。開源評測集WER控制在3%左右,自建評測集全面領先競品。

Hy ASR 3.0 preview的主要功能
-
通用精準識別: 支持中文普通話、英語、粵語及中英混說,減少錯字漏字與長音頻錯誤累積。
-
上下文語義理解: 結合 Context 精準捕捉用戶語境,智能糾錯同音詞,消除語義歧義。
-
熱詞注入適配: 支持品牌名、人名、行業術語等熱詞增強,降低業務接入與維護成本。
-
複雜環境魯棒: 針對高噪、耳語、悄悄話等聲學場景專項優化,保持穩定識別表現。
-
方言廣泛覆蓋: 支持10大方言片區、20餘個二級小片區,含東北官話、粵語、吳語、閩南語等。
Hy ASR 3.0 preview的技術原理
-
架構升級: 採用 MoE 架構,基座模型升級至 Hy3;自研無監督語音 Encoder,基於數千萬小時語音數據訓練,提取高質量聲學表徵。
-
預訓練 Scaling: Encoder 與 LLM 聯合訓練,引入數千萬小時多來源語音數據(有聲讀物、對話、視頻/廣播等),通過多階段能力注入獲得方言理解與上下文建模能力。
-
後訓練增強: 構建覆蓋複雜音頻、Any Context 上下文、通用能力的高質量 SFT Recipe;通過多階段強化學習分別優化通用轉寫準確性、上下文長程依賴及複雜長尾場景表現。
如何使用Hy ASR 3.0 preview
通過騰訊雲 API 接入或打開騰訊元寶按住說話即可免費體驗。
Hy ASR 3.0 preview的核心優勢
-
語義理解升級: 基於 Hy3 大語言模型,融合高精度語音識別與深度語義理解,從逐字轉寫進化爲理解語境、一鍵直出。
-
評測全面領先: 開源評測集 WER 控制在 3% 左右,自建評測集在通用、方言、上下文、複雜聲學場景均優於競品。
-
上下文智能糾錯: 結合 Context 精準捕捉語境,智能糾錯同音詞,消除語義歧義,支持長程依賴建模。
-
熱詞快速適配: 支持品牌名、人名、行業術語等熱詞注入,降低專業場景業務接入與維護成本。
-
方言與複雜環境覆蓋: 支持 10 大方言片區及 20 餘個二級小片區,在高噪、耳語等複雜聲學環境下保持穩定表現。
Hy ASR 3.0 preview的同類競品對比
| 對比維度 | Hy ASR 3.0 preview(騰訊混元) | Doubao-Seed-ASR 2.0(字節跳動) |
|---|---|---|
| 基座模型 | 基於 Hy3 大語言模型,MoE 架構 | 基於 Seed 大語言模型 |
| 語音 Encoder | 自研無監督語音 Encoder,數千萬小時數據訓練 | 未公開詳細架構 |
| 核心能力 | 上下文語義理解 + 高精度識別 + 熱詞注入 | 高精度通用識別 |
| 中文 WER | 3.34% | 3.70% |
| 英文 WER | 2.62% | 5.65% |
| 粵語 WER | 3.12% | 5.25% |
Hy ASR 3.0 preview的應用場景
-
智能客服: 電話與在線客服場景下,Hy ASR 3.0 preview 通過熱詞注入精準識別品牌名稱與業務術語,實現語音實時轉寫,顯著提升服務響應效率。
-
內容創作: 在播客、會議、訪談等長音頻內容生產中,模型結合上下文語義理解智能消除歧義,一鍵輸出連貫可讀的高質量文本,降低後期編輯成本。
-
語音搜索: 支持用戶使用方言語音進行查詢,並在嘈雜環境下準確識別語音指令,有效降低多語種、多口音用戶的輸入門檻。
-
辦公協作: 會議紀要實時轉寫場景中,即使面對耳語、悄悄話等低音量輸入,模型依然保持穩定識別,助力團隊實現高效溝通與信息沉澱。
-
智能終端: 在車載導航、智能家居等 IoT 設備交互中,模型針對高噪聲學環境進行專項優化,保障複雜場景下的語音識別魯棒性與用戶體驗。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...