YuE2是什麼
YuE2是香港科技大學與M-A-P團隊開源的音樂生成模型。模型能根據歌詞和風格生成可編輯的ABC樂譜(旋律+和絃),再渲染爲48kHz完整歌曲,讓創作過程白盒可控。模型支持從零創作、零樣本翻唱、Agent對話式編輯樂譜。在WildSongBench基準上SongBench Avg達6.9632,超越Suno v5等商業模型。

YuE2的主要功能
- 符號規劃創作:輸入歌詞與風格提示,先生成可編輯的旋律+和絃 ABC 樂譜,再渲染爲帶人聲與伴奏的完整歌曲。
- 零樣本翻唱:用 SheetSage2 將原曲錄音轉錄爲樂譜,再以新風格或新歌詞重新演繹,無需針對翻唱任務微調。
- Agent 對話式編輯:圍繞樂譜與 Agent 對話,修改和聲、旋律、速度或曲式後重新渲染出新版本。
- 音頻轉譜(SheetSage2):將任意錄音轉錄爲可檢視、可修改的樂譜,是翻唱與編輯功能的入口。
- 音樂理解(MERT2):提供全曲級音樂表徵,支撐轉譜等下游任務,本身也在 MARBLE 基準 15 項中拿下 14 項 SOTA。
YuE2的技術原理
- 符號規劃中間層:YuE2 的核心設計是在文本/音頻條件與最終波形之間插入一層顯式的符號樂譜(ABC 記譜,含旋律與和絃)。樂譜作爲”白盒”接口,既可被人或 Agent 讀取、修改,又決定了後續聲學生成的結構,使創作從黑盒”抽卡”變爲可控的作曲過程。
- AR–NAR 混合專家架構:模型採用單一的 Mixture-of-Transformers 骨幹:AR 專家以因果注意力自迴歸預測樂譜 token 與語義 token,保證音樂的結構與歌詞對齊;NAR 專家以雙向注意力對聲學 latent 做 flow matching 預測(25 Hz × 64),保證音頻質量。兩類專家共享混合自注意力層與 FFN,在一個 checkpoint 內統一處理規劃與渲染。
- VAE 聲學生成管線:NAR 專家輸出的聲學 latent 經 VAE 解碼器還原爲 48 kHz 立體聲音頻,全程無量化損失。訓練時由離線模塊構建目標:SheetSage2 從音頻提取樂譜目標,MERT2+CVQ 生成語義 token 目標,VAE 編碼器生成 latent 目標。
- 三模式統一於同一權重:創作、翻唱、編輯共用同一生成 checkpoint,唯一區別在於樂譜的來源不同,分別由模型自生成、SheetSage2 轉錄、或人工/Agent 修改後提供;翻唱時改用”僅旋律”模式,讓伴奏自由適配新風格。
- 分階段推理 API:推理被拆爲
plan()→generate_semantic()→synthesize()→decode()四個階段,樂譜、語義 token、聲學 latent 及生成參數都會落盤保留。用戶可在任意階段介入:導出樂譜編輯後重渲染,或複用已生成的 plan 僅更換解碼器,兼顧靈活性與可復現性。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用YuE2
- 環境準備:需要 Linux 系統、Python 3.12,及一塊支持 BF16 的 NVIDIA GPU,模型權重首次運行時會自動從 Hugging Face 下載。
- 安裝部署:
git clone倉庫後創建虛擬環境,執行pip install .即可完成安裝。 - 快速生成第一首歌:運行
python examples/generate.py --output outputs/first-song,可從內置示例生成歌曲,輸出目錄包含音頻(flac)、樂譜及全部中間產物。 - Python API 調用:通過
YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B")加載管線,傳入風格、歌詞即可生成;cot參數控制模式——"full"生成可編輯樂譜(默認)、"melody"僅旋律規劃、"off"直接生成。 - 翻唱一首歌:先用 SheetSage2 將原曲錄音轉錄爲旋律 ABC 譜,再以
cot="melody"傳入新歌詞或目標風格重新生成。 - 編輯已有作品:調用
pipe.plan()導出樂譜,人工或讓 Agent 修改 ABC 文件後,用--abc-file edited.abc --cot full重新渲染出新版本。 - Agent skill 用法:將倉庫中的
skills/yue2-music/導入支持 SKILL.md 的 Agent,即可通過自然對話完成寫歌、轉譜、改譜和版本對比。
YuE2的核心優勢
- 質量對標商業模型:WildSongBench 上 SongBench Avg 達 6.9632(best-of-8),超越 Suno v5、Mureka 9 等商業產品,刷新開源音樂生成上限。
- 白盒可控創作:首創”符號規劃”管線,旋律與和絃以 ABC 樂譜形式顯式呈現,人和 Agent 都能在渲染前讀取、修改作品。
- 三模式統一權重:創作、零樣本翻唱、對話式編輯共用同一 checkpoint,翻唱無需專門微調即可實現 0.647 CLEWS mAP 的源曲保持度。
- 完全本地開源:代碼遵循 Apache 2.0,3.6B 權重開放下載,單卡 24GB 顯存即可離線運行,數據不出本機。
- 生態配套完整:同步開源 SheetSage2 轉譜、MERT2 理解模型、WildSongBench 評測集及 yue2-music Agent skill,覆蓋”轉譜→創作→編輯→評測”全鏈路。
- 分階段可干預:
plan() → generate_semantic() → synthesize() → decode()四段式 API,樂譜、語義 token、latent 全部落盤,支持複用計劃、中途換解碼器。
YuE2的項目地址
- 項目官網:https://map-yue2.github.io/
- GitHub倉庫:https://github.com/multimodal-art-projection/YuE
YuE2的同類競品對比
| 對比維度 | YuE2(M-A-P / 港科大) | Suno v5.5(Suno Inc.) |
|---|---|---|
| 產品性質 | 開源研究模型(約 3.6B 參數) | 閉源商業音樂生成服務 |
| 生成質量 | SongBench Avg 6.9632(best-of-8)/ 6.7316(標準版),17 個設置中排第一與第四 | SongBench Avg 6.7150,排第五,低於 YuE2 兩個版本 |
| 核心機制 | 符號規劃:先生成可編輯 ABC 樂譜(旋律+和絃),再渲染爲 48kHz 音頻,白盒可控 | 端到端音頻生成,無中間樂譜層,黑盒模式 |
| 可控性 | 樂譜可讀、可改、可複用;支持 Agent 對話式編輯和聲、旋律、速度、曲式 | 主要通過提示詞控制,無法逐音符干預,修改只能整曲重抽 |
| 翻唱能力 | 零樣本翻唱:SheetSage2 轉譜後換風格/歌詞,CLEWS mAP 0.647(948 作品) | 無顯式轉譜-重演繹管線,翻唱依賴 prompt 引導,旋律保持度不可控 |
| 歌詞清晰度 | PER 發音錯誤率 9.79%(Bo8)/ 8.44%(標準版) | PER 5.96%,明顯優於 YuE2,是參測系統中歌詞咬字最準的之一 |
| 文本對齊 | MuLan 0.5051 | MuLan 0.5089,略高於 YuE2 |
| 開源與部署 | 代碼 Apache 2.0、權重開放下載,本地單卡 24GB 顯存可跑,數據不出機 | 閉源,僅雲端調用,無法本地部署,歌詞與作品數據託管於廠商 |
YuE2的應用場景
- 個人音樂創作:不會作曲編曲的素人輸入歌詞+風格即可成歌,能通過改樂譜精細調整旋律走向,把”靈感”變成完整作品。
- 翻唱與二次創作:用 SheetSage2 將原曲轉譜後,一鍵把歌曲改編成爵士、搖滾等新風格,或替換歌詞做多語言版本,適配粉絲二創與短視頻改編需求。
- 影視 / 遊戲 / 廣告配樂 Demo:製片方快速生成帶人聲或純伴奏的候選配樂,低成本試錯後再決定是否聘請真人製作,大幅壓縮前期溝通成本。
- 音樂教育與和聲分析:教師用其生成指定和絃走向、曲式結構的示例樂曲,學生可對照 ABC 樂譜學習作曲技法,實現”聽得見、看得見、改得動”的教學閉環。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...