Luna-TTS – 宇生月伴推出的文本轉語音大模型

AI工具4周前發佈新公告 AI管理員
0 0

Luna-TTS是什麼

Luna-TTS 是上海交大系初創公司宇生月伴(VUI Labs)自研的文本轉語音大模型。模型摒棄主流自迴歸路線,採用 Masked Diffusion 掩碼擴散架構,基於 Qwen3-0.6B 訓練,配合自研 Luna-Codec,在中英日韓 100 萬小時語音數據上預訓練。模型在 Hugging Face TTS Arena V2 盲聽榜登頂全球第一,Artificial Analysis 權威榜位列第三、超越谷歌。

Luna-TTS – 宇生月伴推出的文本轉語音大模型

Luna-TTS的主要功能

  • 多語言語音合成:支持中英日韓四種語言的高質量語音合成,音色自然、韻律流暢,適用於有聲書與播客等長文本場景。
  • 情緒與副語言控制:可精確控制 neutral、sad、surprised 等情緒,及呼吸、停頓、笑聲、嘆氣等副語言細節。
  • 實時流式輸出:Luna-TTS Realtime 支持塊級流式生成,首塊延遲僅 41.6ms,端到端 RTF 低至 0.024。
  • 音色一致與克隆:支持音色克隆與保持,長文本生成過程中音色穩定不漂移。

Luna-TTS的技術原理

  • Masked Diffusion 架構:放棄主流自迴歸路線,將語音 RVQ Token 網格作爲整體,通過多輪迭代並行預測被掩碼的位置,生成順序由模型動態決定,避免誤差沿前綴累積。
  • 自研 Luna-Codec:將 24kHz 波形編碼爲 25Hz、8 碼本的離散 Token 網格,碼率僅 2.2kbps,採用因果編解碼器實現流式、幀同步輸出。
  • Qwen3 主幹模型:基於 Qwen3-0.6B 繼續訓練,標準版使用雙向注意力,Realtime 版改用塊級因果注意力並配合 KV Cache 實現流式生成。
  • 大規模訓練與強化學習:在中英日韓四種語言上進行約 100 萬小時預訓練與 10 萬小時高質量退火,將 GRPO 強化學習遷移到擴散去噪軌跡上,優化內容正確性與說話人一致性。

Luna-TTS的項目地址

  • 項目官網:https://vuilabs-ai.github.io/luna-tts/
  • arXiv技術論文:https://arxiv.org/pdf/2608.11593

Luna-TTS的同類競品對比

對比維度 Luna-TTS ElevenLabs Eleven v3
開發團隊 宇生月伴 VUI Labs(中國) ElevenLabs(美國)
技術路線 Masked Diffusion 掩碼擴散 自迴歸生成
模型參數 0.6B 未公開
語言支持 中英日韓 多語言(32+)
情緒控制 精細控制(neutral/sad/surprised 等) 支持情緒與風格調節
副語言細節 呼吸、停頓、笑聲、嘆氣 支持部分副語言
實時版本 Luna-TTS Realtime(RTF 0.024) Turbo v2.5(低延遲)
API 定價 $80.0 / 1M chars $100.0 / 1M chars
TTS Arena V2 第1名(Rating 1574) 第10名(Rating 1176)
Artificial Analysis 第3名(Elo 1220) 第10名(Elo 1176)

Luna-TTS的應用場景

  • 智能客服與電銷:替代傳統語音機器人,提供自然、帶情緒變化的對話體驗,支持實時流式響應,降低用戶掛斷率。
  • 有聲內容與播客:爲有聲書、新聞播報、知識類播客生成高質量長文本語音,保持音色一致性與敘事韻律,支持多情緒段落切換。
  • 在線教育與培訓:爲課程講解、語言學習提供清晰標準的多語言發音,支持情緒調節以匹配教學內容(如鼓勵、嚴肅、溫和)。
  • 車載與智能硬件:通過 Luna-TTS Realtime 低延遲特性,爲車載導航、智能家居、耳機助手提供即時、自然的語音交互入口。
  • 實時同傳與會議助手:結合語音理解能力,在跨語言會議場景中實現低延遲、高自然度的語音翻譯輸出,提升溝通效率。
© 版權聲明

相關文章

暫無評論

暫無評論...