Qwen-Audio-3.0-TTS – 阿里通義千問推出的語音合成模型

AI工具3周前發佈新公告 AI管理員
1 0

Qwen-Audio-3.0-TTS是什麼

Qwen-Audio-3.0-TTS 是阿里通義千問推出的語音合成大模型,包含面向實時交互的 Flash 版與面向高質量生成的 Plus 版。模型在 Artificial Analysis 全球 TTS 榜單中斬獲冠軍,支持細粒度標籤控制、自然語言指令定義聲音風格,覆蓋 16 種語言與 20 種中文方言,音頻輸出提升至 48KHz 錄音棚級品質,單次合成最長 3 分鐘。

Qwen-Audio-3.0-TTS – 阿里通義千問推出的語音合成模型

Qwen-Audio-3.0-TTS的主要功能

  • 細粒度標籤控制:文本中嵌入 [gasp][giggles][angry] 等結構化標籤,精準調控語氣、情緒與呼吸細節。
  • Free-style 指令控制:用自然語言描述角色、情緒、場景、語速,無需專業聲學知識即可定義聲音風格。
  • 多語種與方言:覆蓋中英日韓德等 16 種語言,支持廣東、重慶、東北、上海等 20 種中文方言,10 種語言詞錯誤率 SOTA。
  • 複雜聲學魯棒性:原生嵌入語音增強能力,在高噪聲、高混響環境下仍能準確克隆音色。
  • 精品音色庫:提供指令風格音色、方言音色、細粒度控制音色及 14+ 小語種音色,開箱即用。
  • 48KHz 高品質輸出:從 24KHz 升級至 48KHz,單次合成最長 3 分鐘。

Qwen-Audio-3.0-TTS的技術原理

  • 雙軌混合流式生成架構:採用 Dual-Track LM 架構,單一模型同時支持流式與非流式生成,輸入單個字符可立即輸出首包音頻,端到端合成延遲低至 97ms。
  • 離散多碼本語言模型:基於離散多碼本 LM 實現全信息端到端語音建模,完全繞過傳統 LM+DiT 方案中的信息瓶頸與級聯錯誤,顯著提升泛化能力與生成效率。
  • 雙分詞器設計
    • 25Hz 分詞器:單碼本編解碼器,強調語義內容,與 Qwen-Audio 無縫集成,通過塊級 DiT 實現流式波形重建,適合高質量非流式場景。
    • 12Hz 分詞器:12.5Hz、16 層多碼本設計,實現極端比特率壓縮,配合輕量級因果 ConvNet 完成超低延遲流式重建,適合實時交互。
  • 大規模多語種訓練:在超過 500 萬小時、覆蓋 10 種語言的語音數據上訓練,支持 3 秒極速語音克隆與基於文本描述的聲音設計(Voice Design)。
  • 指令驅動的聲學控制:將語音控制視爲語言建模任務,通過 ChatML 格式的自然語言指令,靈活操控音色、情緒、語速、角色等多維聲學屬性,實現所想即所聽。

如何使用Qwen-Audio-3.0-TTS

  • 選擇版本
    • Plus 版:追求極致音質與表現力,適合影視配音、有聲讀物等場景。
    • Flash 版:追求低延時實時交互,適合直播、對話機器人等場景。
  • 接入平台:訪問阿里雲百鍊控制檯,搜索並開通 qwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash 服務。
  • 調用 API:通過標準 API 傳入文本,可附加結構化標籤或自然語言指令,獲取 48KHz 合成音頻。
  • 選用音色 :從精品音色庫中選擇預設音色,或上傳參考音頻進行音色克隆。

Qwen-Audio-3.0-TTS的核心優勢

  • 榜單性能領先:在 Artificial Analysis 全球 TTS 榜單中奪冠,16 種語言說話人相似度評測 Plus 版全勝,10 種語言詞錯誤率 SOTA。
  • 雙版本覆蓋全場景:Flash 版首包延時 97ms,滿足實時交互;Plus 版 48KHz 輸出,滿足影視級品質需求。
  • 細粒度表現力:支持 [angry][gasp] 等結構化標籤與 Free-style 自然語言指令,精準控制情緒、呼吸、語速與角色。
  • 多語種與方言:覆蓋 16 種語言與 20 種中文方言,通過專項訓練緩解”方言特色弱化”問題,還原母語者真實韻味。
  • 聲學魯棒性:原生嵌入語音增強能力,在高噪聲、高混響環境下仍能準確克隆音色,無需安靜錄音環境。
  • 極速克隆:僅需 3 秒參考音頻可完成語音克隆,支持基於文本描述的聲音設計(Voice Design)。

Qwen-Audio-3.0-TTS的項目地址

  • 項目官網:https://funaudiollm.github.io/qwen-audio-3.0-tts/

Qwen-Audio-3.0-TTS的同類競品對比

維度 Qwen-Audio-3.0-TTS-Plus ElevenLabs v3
榜單排名 Artificial Analysis 第 1 未進前 3
採樣率 48KHz 通常 44.1KHz
標籤控制 原生支持結構化標籤 需通過 Prompt 間接控制
方言支持 20 種中文方言 有限
多語種 SOTA 10 種語言詞錯誤率最優 部分語種領先
噪聲魯棒性 原生語音增強 依賴乾淨參考音頻
API 定價 $27.6 / 1M 字符 約 $11 / 1M 字符

Qwen-Audio-3.0-TTS的應用場景

  • 影視與遊戲配音:通過結構化標籤精確控制情緒起伏與呼吸節奏,實現角色化表演級語音合成,滿足動畫、影視劇及遊戲角色的高表現力需求。
  • 有聲讀物與播客:用自然語言指令定義旁白風格與講述節奏,單次最長 3 分鐘的高品質 48KHz 輸出,支持批量生成長篇音頻內容。
  • 智能客服與助手:Flash 版 97ms 超低首包延時配合 20 種方言支持,實現自然流暢的實時語音交互,顯著提升用戶服務體驗。
  • 在線教育:克隆教師音色並配合語速與情緒控制,生成個性化教學語音,支持多語種課程內容的本地化語音生產。
  • 直播與實時互動:Flash 版低延遲特性適用於實時彈幕朗讀、虛擬主播口播及直播帶貨等需要即時語音反饋的場景。
© 版權聲明

相關文章

暫無評論

暫無評論...