FireRedTTS3是什麼
FireRedTTS3 是小紅書 FireRed 團隊開源的統一語音生成與編輯模型。模型基於 RedAE 語義增強連續表示與 LLM-DiT 架構,單一模型可實現24 種語言 + 21 種中文方言的零樣本音色克隆、自然語言描述的聲音設計,以及指定區域的精準語音編輯。模型在四個公開評測集上均取得最優結果,已全面開源可本地部署。

FireRedTTS3的主要功能
-
零樣本音色克隆:給定幾秒參考音頻,即可用該音色合成 24 種語言及 21 種中文方言的語音。
-
聲音設計:通過自然語言描述即可生成此前不存在的全新音色,無需參考音頻。
-
語音編輯:對已有語音的指定區域進行精準修改,包括改詞、調速、變調、調音量,其餘部分保持不變。
FireRedTTS3的技術原理
- RedAE 語義增強連續表示:在 tokenizer 訓練階段引入語義教師模型進行特徵蒸餾,將語義信息注入連續 latent,既保留聲學細節又緩解自迴歸誤差累積,無需額外語義模塊或多階段訓練。
- LLM-DiT 生成框架:以 Qwen3-1.7B 爲 Backbone 繼承文本理解與指令跟隨能力,通過 Aggregator 壓縮序列後自迴歸建模,再由 DiT 模塊在 Backbone 條件下做 patch 級去噪生成,保持時間連貫性。
- 先規劃再合成(Instruct 版):將自然語言指令解析爲結構化聲學方案或編輯掩碼,再映射到 RedAE 表示進行合成,實現對聲音設計和語音編輯的精準控制,不破壞未指定區域。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用FireRedTTS3
-
環境準備:克隆 GitHub 倉庫並安裝
requirements.txt中的依賴。 -
模型下載:通過 ModelScope 下載
FireRedTeam/FireRedTTS3預訓練模型到本地目錄。 -
語種識別(可選):下載 FastText 語言識別模型,讓 Base 版自動判斷輸入文本的語種。
-
零樣本克隆:加載 Base 版模型,傳入參考音頻、參考文本和目標文本即可生成對應音色語音。
-
聲音設計:調用 Instruct 版的
generate_voice_design,僅傳入自然語言描述和目標文本即可生成全新音色。 -
語義編輯:調用
generate_semantic_edit,用自然語言指令指定插入、刪除或替換內容,修改指定區域。 -
聲學編輯:調用
generate_acoustic_edit,使用固定模板指令(如adjust the speed to 0.5x)調整語速、音高或音量。 -
方言合成:傳入帶
ZH_前綴的方言標籤(如ZH_Sichuan),並儘量使用同方言參考音頻以獲得最佳效果。
FireRedTTS3的核心優勢
- 三任務統一建模:將音色克隆、聲音設計、語音編輯整合到單一模型,無需爲不同任務分別訓練或切換模型,降低系統複雜度。
- RedAE 語義增強連續表示:在 tokenizer 訓練階段即注入語義信息,既避免了離散 token 的聲學細節損失,又緩解了連續自迴歸的誤差累積,兼顧音質與穩定性。
- 頂尖的多語言/方言能力:支持 24 種語言與 21 種中文方言的零樣本克隆,在 MiniMax-MLS-Test 的 24 語種評測中 22 個語言位列前二。
- 四個公開榜單全面領先:在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval、Ming-Freeform-Audio-Edit 上,字錯率與說話人相似度均取得最優或次優成績。
- 精準可控的先規劃、再合成:Instruct 版將自然語言指令解析爲結構化聲學方案後再渲染,確保編輯隻影響指定區域,其餘內容和音色保持不變。
FireRedTTS3的項目地址
- GitHub倉庫:https://github.com/FireRedTeam/FireRedTTS3
- HuggingFace模型庫:https://modelscope.cn/models/FireRedTeam/FireRedTTS3
FireRedTTS3的同類競品對比
| 對比維度 | FireRedTTS3 | CosyVoice3 |
|---|---|---|
| 開發團隊 | 小紅書 FireRed 團隊 | 阿里通義實驗室 |
| 開源狀態 | 模型 + 代碼 + Demo 全面開源 | 部分版本開源 |
| 核心能力 | 克隆 / 設計 / 編輯 統一建模 | 側重語音克隆與指令控制 |
| 語言與方言 | 24 種語言 + 21 種中文方言 | 多語言支持,方言覆蓋較少 |
| 技術路線 | RedAE 連續表示 + LLM-DiT | 離散 Token + Flow Matching |
| 零樣本克隆 | Seed-TTS-Eval 相似度 78.8% | Seed-TTS-Eval 相似度 75.3% |
| 聲音設計 | 自然語言描述生成全新音色 | 主要支持風格 / 情感控制 |
| 語音編輯 | 支持精準局部編輯(改詞/調速/變調) | 編輯能力有限,非核心功能 |
| 推理部署 | 支持本地 GPU 部署,提供完整 API | 支持本地部署 |
FireRedTTS3的應用場景
-
多語言有聲內容製作:用幾秒參考音頻克隆音色,快速生成 24 種語言的有聲書或播客,無需聘請多語種配音員。
-
遊戲與虛擬角色配音:通過自然語言描述設計專屬角色音色,或精準編輯已有台詞中的個別字詞,避免整句重錄。
-
視頻與播客後期剪輯:在成品語音中直接替換錯誤詞彙、調整語速或刪除冗餘片段,無需回到錄音棚重新錄製。
-
品牌智能客服:零樣本克隆企業專屬客服音色,保持一致的品牌聲音形象,同時支持多語言服務。
-
方言內容創作:用 21 種中文方言合成本地化內容,如方言短視頻、地方文化節目,大幅降低方言配音門檻。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...