MuScriptor – Kyutai 聯合 Mirelo 開源的多樂器音樂轉錄模型

AI工具1天前發佈新公告 AI管理員
0 0

MuScriptor是什麼

MuScriptor 是 Kyutai 與 Mirelo 聯合推出的開源多樂器音樂轉錄模型,可將真實世界多種流派的音樂音頻自動轉錄爲 MIDI。MuScriptor是首個在涵蓋 17 萬首歌曲的大規模真實數據集上訓練的同類模型,採用純解碼器 Transformer 架構,提供 60M 至 1.4B 四種參數規模,支持樂器條件控制,代碼以 MIT 協議開源。

MuScriptor – Kyutai 聯合 Mirelo 開源的多樂器音樂轉錄模型

MuScriptor的主要功能

  • 多樂器音頻轉錄:將包含多種樂器的真實世界音樂音頻自動轉換爲標準 MIDI 格式,支持鋼琴、吉他、鼓、貝斯等 36 類樂器。
  • 多流派音樂支持:覆蓋流行、古典、搖滾、重金屬等多種音樂流派,適配複雜的真實混音場景。
  • 樂器條件控制:支持用戶指定需要轉錄的目標樂器集合,實現定製化輸出並穩定跨片段的樂器識別一致性。
  • 多規格模型選擇:提供 60M、103M、307M 及 1.4B 四種參數規模,兼顧輕量部署與高精度需求。
  • 端到端自動處理:用5 秒音頻切片爲單位輸入,模型自動完成分幀、特徵提取、音符檢測與 MIDI 生成全流程。

MuScriptor的技術原理

  • 純解碼器 Transformer 架構:模型用 5 秒音頻切片爲輸入,將 16kHz 單聲道音頻轉換爲 mel-spectrogram,通過自迴歸方式預測 MIDI-like token 序列,實現端到端的多樂器轉錄。
  • 三階段訓練策略:模型首先在 150 萬合成 MIDI 數據上進行預訓練,隨後在 17 萬首真實音樂上微調,最後用 300 首高質量標註數據通過 GRPO 風格的強化學習進行後訓練,對齊高質量輸出。
  • 樂器條件控制:模型支持通過前綴嵌入指定目標樂器集合,用戶可自定義需要轉錄的樂器種類,同時用 classifier-free guidance 穩定跨片段的樂器分配一致性。
  • 數據合成與增強管線:預訓練階段採用動態合成流程,對 MIDI 進行音高偏移、速度變化、樂器隨機化等符號級增強,用 250 多種 soundfont 合成音頻,加入隨機失諧提升泛化能力。

MuScriptor – Kyutai 聯合 Mirelo 開源的多樂器音樂轉錄模型微信關注回覆“開源”,加入AI開源項目交流羣

如何使用MuScriptor

  • 環境準備:克隆 GitHub 倉庫並安裝依賴,確保系統支持 Python 及 PyTorch 等深度學習框架。
  • 下載權重:從官方渠道獲取對應參數規模(103M、307M 或 1.4B)的模型權重文件。
  • 加載模型:用提供的推理代碼初始化模型,可選擇是否啓用樂器條件控制。
  • 輸入音頻:將待轉錄的音頻文件(支持多種格式)輸入模型,模型自動切分爲 5 秒片段進行處理。
  • 獲取 MIDI:模型輸出標準 MIDI 文件,可直接導入 DAW 或樂譜軟件進行後續編輯。

MuScriptor的核心優勢

  • 真實世界泛化能力最強:相比依賴合成數據訓練的模型(如 MT3),MuScriptor 在 17 萬首真實多樂器音樂上訓練,在複雜真實混音場景下錯誤率顯著降低,官方稱其爲迄今最佳開源多樂器轉錄模型。
  • 強化學習對齊高質量輸出:通過後訓練階段的 GRPO 風格強化學習,模型在音符 onset、offset 和 frame 級別的 F1 分數均獲得進一步提升,減少漏檢和誤檢。
  • 靈活的樂器條件控制:用戶可指定需要轉錄的樂器種類,能精簡輸出,也能跨音頻片段保持樂器識別的一致性,避免片段間樂器分配波動。
  • 多規格開源:提供從 60M 到 1.4B 的四種模型規模,兼顧邊緣設備部署與高精度需求,代碼 MIT 開源,權重 CC BY-NC 4.0 可獲取。

MuScriptor的項目地址

  • GitHub倉庫:https://github.com/muscriptor/muscriptor
  • HuggingFace模型庫:https://huggingface.co/MuScriptor
  • arXiv技術論文:https://arxiv.org/pdf/2607.08168v1

MuScriptor的同類競品對比

對比維度 MuScriptor YourMT3+
發佈方 Kyutai / Mirelo 學術研究團隊
架構 純解碼器 Transformer 分層注意力 Transformer + MoE
訓練數據 150萬合成 MIDI + 17萬真實音樂 + 300首 RL 數據 小規模合成數據 + 有限真實數據
核心策略 真實數據微調 + 強化學習後訓練 架構改進 + 跨數據集增強
樂器控制 支持顯式樂器條件控制 不支持
開源協議 代碼 MIT / 權重 CC BY-NC 4.0 部分開源
真實音頻表現 Multi F1 約 41.6,顯著領先 作爲 baseline 被超越
力度信息 分詞器暫不支持 視具體實現而定

MuScriptor的應用場景

  • 音樂製作輔助:製作人可將無 MIDI 的現有音頻快速轉換爲可編輯的 MIDI 軌道,用於重新編曲、混音或採樣。
  • 樂譜自動生成:音樂教育機構和出版方可將錄音自動轉換爲樂譜,降低人工扒譜成本。
  • 音樂信息檢索:爲和絃識別、調性分析、風格分類等下游任務提供高質量的符號化輸入。
  • 生成式音樂建模:爲音樂生成模型提供大規模、高質量的 MIDI 訓練數據,推動符號音樂生成研究。
  • 音樂考古與存檔:將歷史錄音、現場演出等非結構化音頻轉化爲結構化 MIDI 數據,便於數字化保存與分析。
© 版權聲明

相關文章

暫無評論

暫無評論...