Qwen-Audio-3.0-TTS是什麼
Qwen-Audio-3.0-TTS 是阿里通義千問推出的語音合成大模型,包含面向實時交互的 Flash 版與面向高質量生成的 Plus 版。模型在 Artificial Analysis 全球 TTS 榜單中斬獲冠軍,支持細粒度標籤控制、自然語言指令定義聲音風格,覆蓋 16 種語言與 20 種中文方言,音頻輸出提升至 48KHz 錄音棚級品質,單次合成最長 3 分鐘。

Qwen-Audio-3.0-TTS的主要功能
-
細粒度標籤控制:文本中嵌入
[gasp]、[giggles]、[angry]等結構化標籤,精準調控語氣、情緒與呼吸細節。 -
Free-style 指令控制:用自然語言描述角色、情緒、場景、語速,無需專業聲學知識即可定義聲音風格。
-
多語種與方言:覆蓋中英日韓德等 16 種語言,支持廣東、重慶、東北、上海等 20 種中文方言,10 種語言詞錯誤率 SOTA。
-
複雜聲學魯棒性:原生嵌入語音增強能力,在高噪聲、高混響環境下仍能準確克隆音色。
-
精品音色庫:提供指令風格音色、方言音色、細粒度控制音色及 14+ 小語種音色,開箱即用。
-
48KHz 高品質輸出:從 24KHz 升級至 48KHz,單次合成最長 3 分鐘。
Qwen-Audio-3.0-TTS的技術原理
- 雙軌混合流式生成架構:採用 Dual-Track LM 架構,單一模型同時支持流式與非流式生成,輸入單個字符可立即輸出首包音頻,端到端合成延遲低至 97ms。
- 離散多碼本語言模型:基於離散多碼本 LM 實現全信息端到端語音建模,完全繞過傳統 LM+DiT 方案中的信息瓶頸與級聯錯誤,顯著提升泛化能力與生成效率。
- 雙分詞器設計:
-
25Hz 分詞器:單碼本編解碼器,強調語義內容,與 Qwen-Audio 無縫集成,通過塊級 DiT 實現流式波形重建,適合高質量非流式場景。
-
12Hz 分詞器:12.5Hz、16 層多碼本設計,實現極端比特率壓縮,配合輕量級因果 ConvNet 完成超低延遲流式重建,適合實時交互。
-
- 大規模多語種訓練:在超過 500 萬小時、覆蓋 10 種語言的語音數據上訓練,支持 3 秒極速語音克隆與基於文本描述的聲音設計(Voice Design)。
- 指令驅動的聲學控制:將語音控制視爲語言建模任務,通過 ChatML 格式的自然語言指令,靈活操控音色、情緒、語速、角色等多維聲學屬性,實現所想即所聽。
如何使用Qwen-Audio-3.0-TTS
- 選擇版本:
-
Plus 版:追求極致音質與表現力,適合影視配音、有聲讀物等場景。
-
Flash 版:追求低延時實時交互,適合直播、對話機器人等場景。
-
- 接入平台:訪問阿里雲百鍊控制檯,搜索並開通
qwen-audio-3.0-tts-plus或qwen-audio-3.0-tts-flash服務。 - 調用 API:通過標準 API 傳入文本,可附加結構化標籤或自然語言指令,獲取 48KHz 合成音頻。
- 選用音色 :從精品音色庫中選擇預設音色,或上傳參考音頻進行音色克隆。
Qwen-Audio-3.0-TTS的核心優勢
- 榜單性能領先:在 Artificial Analysis 全球 TTS 榜單中奪冠,16 種語言說話人相似度評測 Plus 版全勝,10 種語言詞錯誤率 SOTA。
- 雙版本覆蓋全場景:Flash 版首包延時 97ms,滿足實時交互;Plus 版 48KHz 輸出,滿足影視級品質需求。
- 細粒度表現力:支持
[angry]、[gasp]等結構化標籤與 Free-style 自然語言指令,精準控制情緒、呼吸、語速與角色。 - 多語種與方言:覆蓋 16 種語言與 20 種中文方言,通過專項訓練緩解”方言特色弱化”問題,還原母語者真實韻味。
- 聲學魯棒性:原生嵌入語音增強能力,在高噪聲、高混響環境下仍能準確克隆音色,無需安靜錄音環境。
- 極速克隆:僅需 3 秒參考音頻可完成語音克隆,支持基於文本描述的聲音設計(Voice Design)。
Qwen-Audio-3.0-TTS的項目地址
- 項目官網:https://funaudiollm.github.io/qwen-audio-3.0-tts/
Qwen-Audio-3.0-TTS的同類競品對比
| 維度 | Qwen-Audio-3.0-TTS-Plus | ElevenLabs v3 |
|---|---|---|
| 榜單排名 | Artificial Analysis 第 1 | 未進前 3 |
| 採樣率 | 48KHz | 通常 44.1KHz |
| 標籤控制 | 原生支持結構化標籤 | 需通過 Prompt 間接控制 |
| 方言支持 | 20 種中文方言 | 有限 |
| 多語種 SOTA | 10 種語言詞錯誤率最優 | 部分語種領先 |
| 噪聲魯棒性 | 原生語音增強 | 依賴乾淨參考音頻 |
| API 定價 | $27.6 / 1M 字符 | 約 $11 / 1M 字符 |
Qwen-Audio-3.0-TTS的應用場景
- 影視與遊戲配音:通過結構化標籤精確控制情緒起伏與呼吸節奏,實現角色化表演級語音合成,滿足動畫、影視劇及遊戲角色的高表現力需求。
- 有聲讀物與播客:用自然語言指令定義旁白風格與講述節奏,單次最長 3 分鐘的高品質 48KHz 輸出,支持批量生成長篇音頻內容。
- 智能客服與助手:Flash 版 97ms 超低首包延時配合 20 種方言支持,實現自然流暢的實時語音交互,顯著提升用戶服務體驗。
- 在線教育:克隆教師音色並配合語速與情緒控制,生成個性化教學語音,支持多語種課程內容的本地化語音生產。
- 直播與實時互動:Flash 版低延遲特性適用於實時彈幕朗讀、虛擬主播口播及直播帶貨等需要即時語音反饋的場景。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...