Luna-TTS是什麼
Luna-TTS 是上海交大系初創公司宇生月伴(VUI Labs)自研的文本轉語音大模型。模型摒棄主流自迴歸路線,採用 Masked Diffusion 掩碼擴散架構,基於 Qwen3-0.6B 訓練,配合自研 Luna-Codec,在中英日韓 100 萬小時語音數據上預訓練。模型在 Hugging Face TTS Arena V2 盲聽榜登頂全球第一,Artificial Analysis 權威榜位列第三、超越谷歌。

Luna-TTS的主要功能
- 多語言語音合成:支持中英日韓四種語言的高質量語音合成,音色自然、韻律流暢,適用於有聲書與播客等長文本場景。
- 情緒與副語言控制:可精確控制 neutral、sad、surprised 等情緒,及呼吸、停頓、笑聲、嘆氣等副語言細節。
- 實時流式輸出:Luna-TTS Realtime 支持塊級流式生成,首塊延遲僅 41.6ms,端到端 RTF 低至 0.024。
- 音色一致與克隆:支持音色克隆與保持,長文本生成過程中音色穩定不漂移。
Luna-TTS的技術原理
-
Masked Diffusion 架構:放棄主流自迴歸路線,將語音 RVQ Token 網格作爲整體,通過多輪迭代並行預測被掩碼的位置,生成順序由模型動態決定,避免誤差沿前綴累積。
-
自研 Luna-Codec:將 24kHz 波形編碼爲 25Hz、8 碼本的離散 Token 網格,碼率僅 2.2kbps,採用因果編解碼器實現流式、幀同步輸出。
-
Qwen3 主幹模型:基於 Qwen3-0.6B 繼續訓練,標準版使用雙向注意力,Realtime 版改用塊級因果注意力並配合 KV Cache 實現流式生成。
-
大規模訓練與強化學習:在中英日韓四種語言上進行約 100 萬小時預訓練與 10 萬小時高質量退火,將 GRPO 強化學習遷移到擴散去噪軌跡上,優化內容正確性與說話人一致性。
Luna-TTS的項目地址
- 項目官網:https://vuilabs-ai.github.io/luna-tts/
- arXiv技術論文:https://arxiv.org/pdf/2608.11593
Luna-TTS的同類競品對比
| 對比維度 | Luna-TTS | ElevenLabs Eleven v3 |
|---|---|---|
| 開發團隊 | 宇生月伴 VUI Labs(中國) | ElevenLabs(美國) |
| 技術路線 | Masked Diffusion 掩碼擴散 | 自迴歸生成 |
| 模型參數 | 0.6B | 未公開 |
| 語言支持 | 中英日韓 | 多語言(32+) |
| 情緒控制 | 精細控制(neutral/sad/surprised 等) | 支持情緒與風格調節 |
| 副語言細節 | 呼吸、停頓、笑聲、嘆氣 | 支持部分副語言 |
| 實時版本 | Luna-TTS Realtime(RTF 0.024) | Turbo v2.5(低延遲) |
| API 定價 | $80.0 / 1M chars | $100.0 / 1M chars |
| TTS Arena V2 | 第1名(Rating 1574) | 第10名(Rating 1176) |
| Artificial Analysis | 第3名(Elo 1220) | 第10名(Elo 1176) |
Luna-TTS的應用場景
- 智能客服與電銷:替代傳統語音機器人,提供自然、帶情緒變化的對話體驗,支持實時流式響應,降低用戶掛斷率。
- 有聲內容與播客:爲有聲書、新聞播報、知識類播客生成高質量長文本語音,保持音色一致性與敘事韻律,支持多情緒段落切換。
- 在線教育與培訓:爲課程講解、語言學習提供清晰標準的多語言發音,支持情緒調節以匹配教學內容(如鼓勵、嚴肅、溫和)。
- 車載與智能硬件:通過 Luna-TTS Realtime 低延遲特性,爲車載導航、智能家居、耳機助手提供即時、自然的語音交互入口。
- 實時同傳與會議助手:結合語音理解能力,在跨語言會議場景中實現低延遲、高自然度的語音翻譯輸出,提升溝通效率。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...