FireRedAudio是什麼
FireRedAudio 是小紅書 FireRed 團隊推出的通用音頻語言模型,基於 9B 參數 Qwen3.5 自迴歸 LLM。模型理解與生成分別使用獨立的連續表徵通道(Audio Encoder 與 RedAE),再匯入共享 LLM 統一推理。模型同時支持 ASR、音頻問答、長達1小時的錄音理解、Zero-shot TTS、指令 TTS 及語音編輯,在 MMAU、MMSU、多語種 ASR 和 Instruct TTS 等評測中均取得領先表現。

FireRedAudio的主要功能
-
音頻理解:在 MMAU、MMSU 等綜合音頻問答評測中取得表內最佳成績,覆蓋語音、音樂與環境聲理解。
-
多語種 ASR:支持 102 種語言識別,FLEURS-102 平均錯誤率 14.94%,低資源語種表現尤爲突出。
-
Zero-shot TTS:給定任意參考語音即可合成新內容,中英文內容準確率表內領先。
-
Instruct TTS:遵循”用更慢的語速朗讀”等自然語言指令,六項評測指標全部領跑。
-
語音編輯:支持語義層面的刪除/插入/替換,以及聲學層面的變速/變調/變音量。
-
長音頻處理:支持最長 1 小時錄音,能生成秒級精度的時間線結構化摘要。
FireRedAudio的技術原理
- 解耦連續表徵:FireRedAudio 的不強迫理解與生成共享同一種音頻表示,爲兩者分別設計獨立的連續向量通道:理解側需要緊湊語義特徵以支持長上下文建模,生成側需要可重建的精細聲學特徵以保留音色與韻律,兩者在共享 LLM 中完成統一推理。
- 理解路徑:音頻由 Whisper-large-v3 初始化的 Audio Encoder 編碼,經 Adapter 壓縮爲每秒 12.5 個連續表徵後輸入 9B LLM,直接輸出識別文本或理解答案,適配 ASR、音頻問答與長音頻結構化任務。
- 生成路徑:條件音頻先經 RedAE(確定性自編碼器)壓縮爲 25Hz、64 維連續 latent,預訓練時通過凍結教師編碼器進行語義蒸餾以保留內容線索;由 Patch Encoder 每 4 幀聚合成一個 audio step(6.25Hz)送入 LLM;LLM 每預測一個 audio-step token,以其隱藏狀態驅動 flow-matching DiT 生成新 latent,最終由 RedAE Decoder 還原爲 24kHz 波形。
- 五階段漸進訓練:訓練依次完成 Adapter 對齊、Audio Encoder 適配、理解與生成聯合訓練、多任務後訓練、以及 200k 長上下文擴展,累計約 2.66T 非填充多模態 token,逐步疊加能力而非一次性混合所有任務。
- 共享推理中樞:9B Qwen3.5 自迴歸 LLM 作爲唯一可訓練主幹,負責跨模態推理、任務規劃與上下文建模;理解與生成僅在輸入表徵層解耦,在推理層統一,使模型既能”聽懂”又能”開口”而不犧牲各側的信息保真度。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用FireRedAudio
-
環境配置:從 GitHub 倉庫閱讀環境與依賴安裝說明,準備好運行環境。
-
獲取權重:從 Hugging Face 官方頁面下載模型權重與配置文件。
-
跑通樣例:先執行官方提供的最小推理樣例,驗證模型版本、音頻採樣率與輸出路徑。
-
驗證理解:分別測試 ASR 和音頻問答功能,確認理解路徑正常工作。
-
驗證生成:分別測試 Zero-shot TTS 和指令 TTS,確認生成路徑正常工作。
-
音頻格式:生成任務中保持輸入輸出爲 24 kHz 採樣率,並記錄 DiT 採樣步數與顯存峯值。
-
TTS 設置:Zero-shot TTS 時,用參考語音的最後兩個 audio step 初始化聲學歷史,其他生成任務使用零初始化。
-
硬件評估:根據 9B 主幹權重、KV cache 及 DiT 採樣開銷評估顯存需求,長音頻任務需額外預留上下文緩存空間。
FireRedAudio的核心優勢
-
統一架構:一個 9B 自迴歸 LLM 同時承載音頻理解與生成,避免多模塊拼接帶來的能力分散。
-
解耦表徵:理解與生成分別使用最適合自身的連續表徵通道,既保留語義緊湊性又不丟失聲學細節。
-
性能領先:在 MMAU、MMSU、102 語種 ASR 及 Instruct TTS 六項指標上均取得表內最佳成績。
-
長音頻支持:通過 200k 上下文擴展,可處理最長 1 小時錄音並輸出秒級精度結構化時間線。
-
全棧覆蓋:單模型支持 ASR、音頻問答、Zero-shot TTS、指令 TTS、語義/聲學語音編輯六大任務。
FireRedAudio的項目地址
- GitHub倉庫:https://github.com/FireRedTeam/FireRedAudio
- HuggingFace模型庫:https://huggingface.co/FireRedTeam/FireRedAudio
- arXiv技術論文:https://arxiv.org/pdf/2608.24168
FireRedAudio的同類競品對比
| 對比維度 | FireRedAudio | Qwen3.5-Omni-Plus |
|---|---|---|
| 定位 | 專注音頻領域的通用理解與生成模型 | 覆蓋文本/圖像/音頻/視頻的全模態通用模型 |
| 架構 | 9B 自迴歸 LLM + 解耦連續表徵(Audio Encoder / RedAE) | 更大規模端到端多模態架構,所有模態統一處理 |
| 理解評測 | MMAU test 80.9、MMSU 83.3,均爲表內最佳 | MMAU test 79.9、MMSU 80.7,略低於 FireRedAudio |
| 多語種 ASR | FLEURS-102 平均 WER 14.94%,低資源語種優勢顯著 | FLEURS-102 平均 WER 23.66%,多語種覆蓋稍弱 |
| 生成能力 | 支持 Zero-shot TTS、Instruct TTS、語音編輯,DiT 輸出 24kHz 波形 | 支持語音合成與理解,但不側重語音編輯與細粒度聲學控制 |
| 長音頻 | 200k 上下文支持 1 小時錄音,strict@0 通過率 73.6% | 具備長音頻處理能力,但論文中未展示同量級 1 小時結構化評測 |
FireRedAudio的應用場景
-
智能會議助理:將 1 小時會議錄音自動轉寫爲帶秒級時間戳的結構化紀要,並提取關鍵決策與待辦事項。
-
多語種內容本地化:輸入中文視頻,自動識別原聲並生成英語、日語等多語種配音,保持原說話人音色與情感風格。
-
播客/有聲書後期製作:通過自然語言指令調整語速、音量或替換特定語句,無需重新錄製即可完成語音編輯。
-
智能客服語音交互:實時理解用戶語音諮詢(含環境噪音與口音),並以指定音色、語速生成回覆語音,實現端到端語音對話。
-
音頻內容審覈與檢索:對長音頻平台的海量內容做結構化理解,支持”找出所有提到價格欺詐的片段”等語義級檢索與標註。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...