YuE2 – 港科技大聯合 M-A-P 團隊開源的音樂生成模型

AI工具9小時前發佈新公告 AI管理員
0 0

YuE2是什麼

YuE2是香港科技大學與M-A-P團隊開源的音樂生成模型。模型能根據歌詞和風格生成可編輯的ABC樂譜(旋律+和絃),再渲染爲48kHz完整歌曲,讓創作過程白盒可控。模型支持從零創作、零樣本翻唱、Agent對話式編輯樂譜。在WildSongBench基準上SongBench Avg達6.9632,超越Suno v5等商業模型。

YuE2 – 港科技大聯合 M-A-P 團隊開源的音樂生成模型

YuE2的主要功能

  • 符號規劃創作:輸入歌詞與風格提示,先生成可編輯的旋律+和絃 ABC 樂譜,再渲染爲帶人聲與伴奏的完整歌曲。
  • 零樣本翻唱:用 SheetSage2 將原曲錄音轉錄爲樂譜,再以新風格或新歌詞重新演繹,無需針對翻唱任務微調。
  • Agent 對話式編輯:圍繞樂譜與 Agent 對話,修改和聲、旋律、速度或曲式後重新渲染出新版本。
  • 音頻轉譜(SheetSage2):將任意錄音轉錄爲可檢視、可修改的樂譜,是翻唱與編輯功能的入口。
  • 音樂理解(MERT2):提供全曲級音樂表徵,支撐轉譜等下游任務,本身也在 MARBLE 基準 15 項中拿下 14 項 SOTA。

YuE2的技術原理

  • 符號規劃中間層:YuE2 的核心設計是在文本/音頻條件與最終波形之間插入一層顯式的符號樂譜(ABC 記譜,含旋律與和絃)。樂譜作爲”白盒”接口,既可被人或 Agent 讀取、修改,又決定了後續聲學生成的結構,使創作從黑盒”抽卡”變爲可控的作曲過程。
  • AR–NAR 混合專家架構:模型採用單一的 Mixture-of-Transformers 骨幹:AR 專家以因果注意力自迴歸預測樂譜 token 與語義 token,保證音樂的結構與歌詞對齊;NAR 專家以雙向注意力對聲學 latent 做 flow matching 預測(25 Hz × 64),保證音頻質量。兩類專家共享混合自注意力層與 FFN,在一個 checkpoint 內統一處理規劃與渲染。
  • VAE 聲學生成管線:NAR 專家輸出的聲學 latent 經 VAE 解碼器還原爲 48 kHz 立體聲音頻,全程無量化損失。訓練時由離線模塊構建目標:SheetSage2 從音頻提取樂譜目標,MERT2+CVQ 生成語義 token 目標,VAE 編碼器生成 latent 目標。
  • 三模式統一於同一權重:創作、翻唱、編輯共用同一生成 checkpoint,唯一區別在於樂譜的來源不同,分別由模型自生成、SheetSage2 轉錄、或人工/Agent 修改後提供;翻唱時改用”僅旋律”模式,讓伴奏自由適配新風格。
  • 分階段推理 API:推理被拆爲 plan() → generate_semantic() → synthesize() → decode() 四個階段,樂譜、語義 token、聲學 latent 及生成參數都會落盤保留。用戶可在任意階段介入:導出樂譜編輯後重渲染,或複用已生成的 plan 僅更換解碼器,兼顧靈活性與可復現性。

YuE2 – 港科技大聯合 M-A-P 團隊開源的音樂生成模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用YuE2

  • 環境準備:需要 Linux 系統、Python 3.12,及一塊支持 BF16 的 NVIDIA GPU,模型權重首次運行時會自動從 Hugging Face 下載。
  • 安裝部署:git clone 倉庫後創建虛擬環境,執行 pip install . 即可完成安裝。
  • 快速生成第一首歌:運行 python examples/generate.py --output outputs/first-song,可從內置示例生成歌曲,輸出目錄包含音頻(flac)、樂譜及全部中間產物。
  • Python API 調用:通過 YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B") 加載管線,傳入風格、歌詞即可生成;cot 參數控制模式——"full" 生成可編輯樂譜(默認)、"melody" 僅旋律規劃、"off" 直接生成。
  • 翻唱一首歌:先用 SheetSage2 將原曲錄音轉錄爲旋律 ABC 譜,再以 cot="melody" 傳入新歌詞或目標風格重新生成。
  • 編輯已有作品:調用 pipe.plan() 導出樂譜,人工或讓 Agent 修改 ABC 文件後,用 --abc-file edited.abc --cot full 重新渲染出新版本。
  • Agent skill 用法:將倉庫中的 skills/yue2-music/ 導入支持 SKILL.md 的 Agent,即可通過自然對話完成寫歌、轉譜、改譜和版本對比。

YuE2的核心優勢

  • 質量對標商業模型:WildSongBench 上 SongBench Avg 達 6.9632(best-of-8),超越 Suno v5、Mureka 9 等商業產品,刷新開源音樂生成上限。
  • 白盒可控創作:首創”符號規劃”管線,旋律與和絃以 ABC 樂譜形式顯式呈現,人和 Agent 都能在渲染前讀取、修改作品。
  • 三模式統一權重:創作、零樣本翻唱、對話式編輯共用同一 checkpoint,翻唱無需專門微調即可實現 0.647 CLEWS mAP 的源曲保持度。
  • 完全本地開源:代碼遵循 Apache 2.0,3.6B 權重開放下載,單卡 24GB 顯存即可離線運行,數據不出本機。
  • 生態配套完整:同步開源 SheetSage2 轉譜、MERT2 理解模型、WildSongBench 評測集及 yue2-music Agent skill,覆蓋”轉譜→創作→編輯→評測”全鏈路。
  • 分階段可干預:plan() → generate_semantic() → synthesize() → decode() 四段式 API,樂譜、語義 token、latent 全部落盤,支持複用計劃、中途換解碼器。

YuE2的項目地址

  • 項目官網:https://map-yue2.github.io/
  • GitHub倉庫:https://github.com/multimodal-art-projection/YuE

YuE2的同類競品對比

對比維度 YuE2(M-A-P / 港科大)  Suno v5.5(Suno Inc.)
產品性質 開源研究模型(約 3.6B 參數) 閉源商業音樂生成服務
生成質量 SongBench Avg 6.9632(best-of-8)/ 6.7316(標準版),17 個設置中排第一與第四 SongBench Avg 6.7150,排第五,低於 YuE2 兩個版本
核心機制 符號規劃:先生成可編輯 ABC 樂譜(旋律+和絃),再渲染爲 48kHz 音頻,白盒可控 端到端音頻生成,無中間樂譜層,黑盒模式
可控性 樂譜可讀、可改、可複用;支持 Agent 對話式編輯和聲、旋律、速度、曲式 主要通過提示詞控制,無法逐音符干預,修改只能整曲重抽
翻唱能力 零樣本翻唱:SheetSage2 轉譜後換風格/歌詞,CLEWS mAP 0.647(948 作品) 無顯式轉譜-重演繹管線,翻唱依賴 prompt 引導,旋律保持度不可控
歌詞清晰度 PER 發音錯誤率 9.79%(Bo8)/ 8.44%(標準版) PER 5.96%,明顯優於 YuE2,是參測系統中歌詞咬字最準的之一
文本對齊 MuLan 0.5051 MuLan 0.5089,略高於 YuE2
開源與部署 代碼 Apache 2.0、權重開放下載,本地單卡 24GB 顯存可跑,數據不出機 閉源,僅雲端調用,無法本地部署,歌詞與作品數據託管於廠商

YuE2的應用場景

  • 個人音樂創作:不會作曲編曲的素人輸入歌詞+風格即可成歌,能通過改樂譜精細調整旋律走向,把”靈感”變成完整作品。
  • 翻唱與二次創作:用 SheetSage2 將原曲轉譜後,一鍵把歌曲改編成爵士、搖滾等新風格,或替換歌詞做多語言版本,適配粉絲二創與短視頻改編需求。
  • 影視 / 遊戲 / 廣告配樂 Demo:製片方快速生成帶人聲或純伴奏的候選配樂,低成本試錯後再決定是否聘請真人製作,大幅壓縮前期溝通成本。
  • 音樂教育與和聲分析:教師用其生成指定和絃走向、曲式結構的示例樂曲,學生可對照 ABC 樂譜學習作曲技法,實現”聽得見、看得見、改得動”的教學閉環。
© 版權聲明

相關文章

暫無評論

暫無評論...