AuK – 騰訊混元開源的語音生成與編輯基礎模型

AI工具2天前發佈新公告 AI管理員
0 0

AuK是什麼

AuK是騰訊混元開源的15億參數語音生成與編輯基礎模型,採用流匹配擴散架構而非自迴歸。模型能通過統一的自然語言指令接口完成16種語音任務,包括零樣本/指令式TTS、語音內容編輯、聲學調節、副語言編輯及降噪和人聲分離等。模型提供4步推理的AuK-Flash快速版本,速度約提升4.5倍。

AuK – 騰訊混元開源的語音生成與編輯基礎模型

AuK的主要功能

  • Zero-shot TTS:用幾秒參考音頻克隆音色併合成新語音。
  • Instruct TTS:純文字描述聲音特徵即可生成對應語音,無需參考音頻。
  • 語音內容編輯:在不改變音色語調的前提下替換、插入或刪除錄音中的文字。
  • 歌詞編輯:保留旋律與歌聲特質,只改寫歌詞。
  • 音高/語速/音量編輯:以半音、倍速、分貝爲單位精確調節聲學屬性。
  • 情緒與音色編輯:不換字改變情感色彩,或保留內容轉換音色。
  • 口音編輯與去噪:去除口音、降噪去混響,提升清晰度。
  • 副語言事件編輯:添加或移除呼吸聲、笑聲、咳嗽,實現正常語音與耳語互轉。
  • 語音分離:按說話順序拆分多人音頻,或按內容描述提取目標說話人。
  • 音樂分離:從歌曲中提取人聲、去除伴奏。

AuK的技術原理

  • 整體範式: AuK 採用 flow-matching 擴散架構生成音頻隱空間表示,天然適合”編輯”類任務,把原始音頻的隱表示作爲去噪起點,只修改指令要求的部分,從而更好地保留原始音色、旋律和未編輯內容,這也是它能覆蓋編輯任務族的技術基礎。
  • 三組件流水線架構:系統由三部分組成:多模態大模型負責讀取自然語言指令和參考音頻、生成語義條件;音頻 VAE 將 24kHz 波形編碼爲 50Hz 的聲學隱空間;核心的混合 Transformer 由 10 層雙流 MMDiT加 20 層單流 DiT 堆疊而成,模型寬度 1536,總參數 15 億。
  • 大規模指令對齊訓練:訓練數據約 30.3 億條”指令—音頻”配對,累計約 195 萬小時有效監督。關鍵是所有任務都統一爲同一種”指令 + 輸入音頻 → 輸出音頻”的格式,使模型通過單一接口泛化到 16 種任務。
  • 後訓練與人類偏好優化:模型在基礎訓練後經過人類偏好優化和強化學習後訓練(RL post-training),提升生成語音的自然度、指令遵循度和聽覺質量。

AuK – 騰訊混元開源的語音生成與編輯基礎模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用AuK

  • 確認硬件環境:準備一台顯存約 24GB 級別的 NVIDIA GPU(如 RTX 3090/4090)。
  • 克隆代碼倉庫:從 GitHub 克隆 Tencent-Hunyuan/AuK 倉庫到本地。
  • 安裝依賴環境:按倉庫要求配置 Python 環境並安裝所需的依賴包。
  • 下載模型權重:從 Hugging Face 或 ModelScope 下載 AuK權重及配套的 VAE 文件。
  • 下載語義條件模型:單獨下載並配置多模態大模型 Qwen2.5-Omni-3B,用於解析指令和參考音頻。
  • 準備輸入素材:準備好目標文本、參考音頻或待編輯的原始音頻文件。
  • 編寫自然語言指令:根據任務需求撰寫指令,如描述聲音特徵、指定要替換的句子或調節的音高/語速等。
  • 運行推理:通過命令行(CLI)輸入指令和素材,執行生成或編輯並等待輸出。
  • 試聽與調整:檢查結果音頻,不滿意時調整指令措辭、採樣步數或 CFG 強度重新生成。

AuK的核心優勢

  • 統一接口,任務全覆蓋:模型通過自然語言指令可勝任 TTS、編輯、增強、分離等 16 種語音任務,無需爲每個任務單獨部署模型。
  • 編輯能力業界稀缺:支持改詞、插句、調音高、改情緒等精細編輯,且能最大限度保留原始音色和語調。
  • Instruct TTS 免參考音頻:憑文字描述聲音特徵可生成語音,降低使用門檻。
  • 流匹配架構更保真:採用擴散式生成而非逐 token 預測,編輯時用原音頻爲起點去噪,未修改部分幾乎零損傷。

AuK的項目地址

  • 項目官網:https://auk-project.github.io/
  • GitHub倉庫:https://github.com/Tencent-Hunyuan/AuK
  • HuggingFace模型庫:https://huggingface.co/tencent/AuK
  • arXiv技術論文:https://arxiv.org/pdf/2609.08936

AuK的同類競品對比

對比維度 AuK(騰訊混元) CosyVoice 3(阿里通義)
核心定位 統一的語音生成 + 編輯基礎模型 多語言語音合成(TTS)模型
任務覆蓋 16 種任務,橫跨生成、內容/聲學/副語言編輯、增強、分離 5 大族 聚焦 TTS、零樣本克隆、指令式情感/方言控制,不支持語音編輯和分離
架構路線 流匹配擴散架構(非自迴歸),適合”在原音頻上修改” LLM + 分塊流匹配(FM)雙向流式架構
參數規模 1.5B(另有 4 步推理的 AuK-Flash 蒸餾版) 開源版 0.5B,完整版 1.5B
語音編輯能力 核心強項:改詞、插句、刪句、調音高/語速/音量、改情緒、去口音 不支持(僅能控制新生成語音的屬性)
聲音克隆 Zero-shot TTS(參考音頻克隆)+ Instruct TTS(文字描述造聲) 3 秒音頻零樣本克隆,支持跨語言音色復刻
語言/方言覆蓋 官方未公佈完整語言列表(示例以中英爲主) 9 種語言 + 18 種中文方言
實時性 非流式設計,需約 24GB 顯存,偏離線生產 流式推理,首包延遲低至 150ms,適合實時對話場景

AuK的應用場景

  • 影視/短劇後期台詞修復:演員唸錯詞或劇本微調時,直接替換錄音中的個別詞句,無需重新進棚配音,保留原表演情緒。
  • 播客與採訪製作:刪除口誤和廢話、調整語速節奏、去除背景噪音和混響,把粗剪素材一鍵整理成成片。
  • 有聲書與 AI 配音生產:用 Instruct TTS 按角色描述生成差異化音色,同一 narrator 還能後期調整情緒和語調,降低多角色製作成本。
  • 音樂創作與二創:改寫翻唱歌詞而保留原旋律和歌聲特質,或從歌曲中提取人聲做 remix 素材。
  • 語言訓練與無障礙應用:爲有口音或語言障礙的使用者去口音、調節語速和音量,生成更清晰易懂的語音內容。
© 版權聲明

相關文章

暫無評論

暫無評論...