dots.tts是什麼
dots.tts 是小紅書 dots 團隊與上海交大 X-LANCE 實驗室聯合開源的 20 億參數全連續自迴歸語音合成基座模型。模型直接在連續隱空間中逐塊生成 48kHz 音頻,在 Seed-TTS-Eval 等基準上取得 SOTA 的音色相似度與內容準確度,支持零樣本克隆、流式輸出及低延遲雙工對話。項目全量開源代碼與權重,並擴展了 dots.tts.edit 精確語音編輯能力。

dots.tts的主要功能
- 零樣本音色克隆:僅需 3–10 秒參考音頻,可復刻該音色朗讀任意新文本,支持跨語言克隆,在 Seed-TTS-Eval 基準上取得內容準確度與說話人相似度的 SOTA 表現。
- 文本轉語音合成:提供從隨機音色採樣到指定說話人的高質量語音生成,基於 2B 參數連續自迴歸模型直接輸出 48 kHz 音頻。
- 流式生成與低延遲交互:天然支持流式輸出,文本前綴輸入後即可逐塊生成音頻;1T1A 雙流模式下,上游 LLM 每輸出一個文本 Token 語音側即刻響應,音頻首包延遲低至 54.4 毫秒,適用實時語音 Agent 與雙工對話。
- 精確語音編輯:支持對已有錄音進行文本替換、情緒調節、音高與語速修改、停頓插入或刪除,且支持多項操作組合在一條指令中一次性完成,未編輯區域保持原樣。
- 多語言支持:覆蓋 24 種語言,在 MiniMax 多語言評測中平均說話人相似度達 83.9,其中 19 個語種取得單項第一。
- 多檔推理速度:提供 Base、SOAR、MeanFlow(4 步)、兩步 sCM、單步 DMD 等多個檢查點,用戶可在音質與推理速度之間按需選擇。
dots.tts的技術原理
- 全連續自迴歸架構:dots.tts 摒棄傳統方案中將語音量化爲離散 Token 的做法,整條生成鏈路完全在連續隱空間中運行:模型以自迴歸方式逐塊預測聲學片段,通過 BigVGAN 風格解碼器還原爲 48 kHz 波形,從根本上避免離散量化帶來的信息瓶頸與音色細節損失。
- 語義化連續表徵:模型採用基於 HoliTok 設計的 AudioVAE 將原始波形壓縮爲 25 FPS 的連續潛變量,編碼器通過語義化訓練在重建保真度與隱空間結構化之間取得平衡,使重建後的說話人相似度達到 0.969,爲後續自迴歸生成保留豐富的音色與聲學細節上限。
- 誤差控制機制:針對連續自迴歸中前步微小偏差會向後累積擴散的固有問題,dots.tts 引入因果語義編碼器,將已生成的 VAE patch 實時壓縮爲緊湊的語義歷史並回灌給大語言模型;通過剝離高方差局部聲學變化、僅保留長程語義摘要,有效抑制長序列生成中的誤差傳播、嘯叫與音色漂移。
- 生成流程:生成過程以大語言模型爲中樞,其基於 Qwen2.5-1.5B 初始化,直接消費 BPE 文本 Token 並輸出每步隱藏狀態;隨後由自迴歸流匹配頭(18 層 DiT)在 LLM 隱狀態與自迴歸前綴的條件下,對下一個聲學 patch 執行去噪生成,同時用凍結的 CAM++ 說話人編碼器提供的全局 x-vector 保障音色一致性。
- 後訓練加速:團隊通過 SOAR 自糾正對齊讓模型在訓練時模擬真實推理中的偏離狀態並學習自我修正,無需獎勵模型即可提升穩定性;用 MeanFlow 蒸餾將教師多步軌跡壓縮爲平均速度,實現 4 步高質量生成;經簡化一致性模型(sCM)壓縮至 2 步;通過獎勵感知分佈匹配蒸餾(DMD)配合雙時間尺度更新策略,得到自然清晰的高質量單步模型。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用dots.tts
-
安裝:執行
pip install dots.tts即可安裝,或從 GitHub 克隆源碼後以pip install -e .進行本地開發安裝,高併發場景可額外部署 SGLang Omni 以獲得 CUDA Graph 加速與連續批處理支持。 -
命令行合成:使用
dots.tts入口並指定--model-name-or-path、--text和目標--prompt-audio與--prompt-text,即可實現零樣本音色克隆;省略--prompt-text則退化爲 x-vector 克隆,省略--prompt-audio則進行隨機音色採樣。 -
命令行編輯:使用
dots.tts.edit入口,提供--source-audio和 XML 風格的--instruction,即可對已有錄音執行文本替換、情緒或韻律修改等精確編輯。 -
Python API 基礎調用:通過
DotsTtsRuntime.from_pretrained()加載模型後調用generate(),傳入文本與可選的參考音頻即可獲取合成音頻張量並保存爲文件。 -
Python API 流式輸出:調用
generate_stream()可逐塊獲取音頻張量,實時推送到播放器或 WebSocket,實現邊生成邊播放的低延遲體驗。 -
Python API 雙流對話:使用
DotsTtsRuntimeDoubleStreaming啓動會話後逐 Token 推送文本,語音側即刻開始生成,音頻首包延遲可低至 54.4 毫秒,適用於實時語音 Agent。 -
微調:運行
accelerate launch scripts/train_dots_tts.py並配置自有數據路徑,即可在公開檢查點基礎上進行音色或領域適配微調。 -
蒸餾加速:通過
scripts/train_dots_tts_meanflow.py以 SOAR 檢查點爲教師進行 MeanFlow 蒸餾,可獲得 4 步、2 步或 1 步的高質量學生模型,以適配不同延遲與併發需求。 -
Web 界面:運行
python apps/gradio/app.py啓動可視化合成界面,或運行apps/edit_playground/app.py啓動 Edit Playground,在瀏覽器中上傳音頻、標註編輯區間並實時預覽結果。
dots.tts的核心優勢
- 全連續隱空間建模:摒棄離散聲學 Token,直接在連續隱空間自迴歸生成,保留頻譜質感與氣聲等豐富音色細節,重建說話人相似度高達 0.969。
- SOTA 合成質量:在 Seed-TTS-Eval 基準同時取得內容準確度與音色相似度 SOTA,24 語種 MiniMax 評測平均 SIM 達 83.9,綜合性能超越主流方案。
- 原生流式低延遲:1T1A 雙流模式音頻首包低至 54.4 毫秒,配合 SGLang Omni 單卡 H100 併發 16 路吞吐達 4.76 req/s,滿足實時語音 Agent 需求。
- 統一編輯能力:dots.tts.edit 基於同一基座,支持 XML 結構化指令精確編輯文本、情緒、韻律與停頓,在 doteBench 評測中整體領先其他開源系統。
dots.tts的項目地址
- GitHub倉庫:https://github.com/studio-dots-ai/dots.tts
- arXiv技術論文:https://arxiv.org/pdf/2608.02673
dots.tts的同類競品對比
| 對比維度 | dots.tts | CosyVoice 3 |
|---|---|---|
| 技術路線 | 全連續隱空間自迴歸,無離散 Token | 離散與連續混合表徵,依賴聲學 Token |
| 參數量 | 2B | 1.5B |
| Seed-TTS-Eval 平均 WER/CER | 2.95% | 3.06% |
| Seed-TTS-Eval 平均 SIM | 79.2 | 75.3 |
| 多語言評測 | MiniMax 24 語種平均 SIM 83.9,19 個語種第一 | 側重中英雙語,未公開 24 語種結果 |
| 實時交互 | 原生流式 + 1T1A 雙流,首包低至 54.4ms | 並行生成,延遲優化有限 |
| 推理加速 | MeanFlow 4 步 / sCM 2 步 / DMD 單步 | 標準多步生成 |
| 開源範圍 | Apache 2.0 開源 6 個檢查點 + 訓練/微調/蒸餾全套代碼 | 模型與推理代碼開源 |
dots.tts的應用場景
- 實時語音Agent:1T1A 雙流模式首包延遲低至 54.4 毫秒,適用 LLM 驅動的實時雙工對話與語音助手。
- 零樣本音色克隆:僅需數秒參考音頻可復刻任意音色,支持跨語言克隆,適用有聲書、配音與個性化內容創作。
- 多語言內容生成:覆蓋 24 種語言且保持高說話人相似度,適用全球化產品的多語種語音播報與本地化服務。
- 精確語音編輯:通過 dots.tts.edit 對現有錄音進行文本替換、情緒調節、韻律修改與停頓調整,適用播客後期與音頻內容精修。
- 直播與實時播報:配合 LLM 流式輸出實現邊生成邊播放,適用於新聞播報、直播帶貨與實時信息播報場景。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...