Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

📄 arXiv: 2608.06165v2 📥 PDF

作者: Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

分类: cs.SD, cs.AI, cs.MM

发布日期: 2026-08-06 (更新: 2026-08-07)

备注: Accepted at the 34th ACM International Conference on Multimedia (MM '26)

DOI: 10.1145/3767308.3835653

🔗 代码/项目: GITHUB


💡 一句话要点

提出SheetSage-A2S数据集以解决流行音乐音频转谱问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音频到乐谱 流行音乐 数据增强 特征提取 MuQ模型 SheetSage-A2S数据集 符号错误率 音乐研究

📋 核心要点

  1. 现有的音频到乐谱系统主要集中于古典音乐,流行音乐的研究相对不足,导致相关数据和方法的缺乏。
  2. 本文提出了SheetSage-A2S数据集,并结合数据增强和MuQ模型,旨在提升音频特征提取和模型的泛化能力。
  3. 实验结果显示,提出的模型在古典音乐和流行音乐上均取得了显著的性能提升,提供了新的研究基准。

📝 摘要(中文)

现有的音频到乐谱(A2S)系统主要集中于古典音乐,而对流行音乐的应用研究仍然较少。本文首次提出了SheetSage-A2S数据集,包含61小时的音频和来自6066首独特歌曲的9468个片段的**kern乐谱编码,旨在促进流行音乐的A2S研究。此外,论文通过数据增强和MuQ预训练特征提取模型来提升现有A2S方法的泛化能力和音频特征提取效果。实验结果表明,所提出的A2S模型在古典音乐的Quartets集合上达到了4.98%的符号错误率(SER),显著优于现有的15.3% SER。此外,在SheetSage-A2S数据集上,该模型在流行音乐上达到了20.92%的SER,为未来研究提供了强有力的基准。

🔬 方法详解

问题定义:本文旨在解决音频到乐谱(A2S)转换中流行音乐的研究不足,现有方法主要集中于古典音乐,缺乏针对流行音乐的有效数据和模型。

核心思路:论文通过构建SheetSage-A2S数据集,结合数据增强技术和MuQ预训练特征提取模型,提升音频特征的提取效果和模型的泛化能力,从而改善A2S的性能。

技术框架:整体架构包括数据集构建、特征提取、模型训练和评估四个主要模块。数据集提供了丰富的音频和乐谱对,特征提取模块使用MuQ模型提取音频特征,训练模块则应用数据增强技术以提升模型的鲁棒性。

关键创新:最重要的创新在于首次构建了针对流行音乐的SheetSage-A2S数据集,并结合了数据增强与预训练模型,显著提升了A2S任务的性能,尤其是在流行音乐领域。

关键设计:在模型设计中,采用了特定的损失函数以优化符号错误率(SER),并通过调整网络结构和参数设置来适应流行音乐的特征,确保模型能够有效学习音频与乐谱之间的映射关系。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的A2S模型在古典音乐的Quartets集合上达到了4.98%的符号错误率(SER),显著优于现有的15.3% SER。同时,在流行音乐的SheetSage-A2S数据集上,模型达到了20.92%的SER,为该领域的研究提供了新的基准。

🎯 应用场景

该研究的潜在应用领域包括音乐教育、音乐创作辅助工具以及音乐分析等。通过将音频转化为乐谱,能够帮助音乐学习者更好地理解和演奏音乐,同时也为音乐创作提供了新的灵感和工具。未来,该技术可能在音乐推荐和自动编曲等领域发挥更大作用。

📄 摘要(原文)

Existing audio-to-score (A2S) systems primarily focus on classical music, and the application to popular music remains underexplored. This paper first presents the new SheetSage-A2S Dataset, which includes 61 hours of audio with \texttt{**kern} score encodings for 9,468 clips originating from 6,066 unique songs, the first of its kind to facilitate A2S research for popular music. Additionally, we improve on existing A2S approaches by using data augmentation and MuQ, a pretrained feature-extraction model for music audio, to enhance generalisation abilities and extract meaningful audio features. Results show that the proposed A2S model achieves 4.98\% symbol error rate (SER) on the Quartets collection for classical music, which significantly outperforms the 15.3\% SER from the existing state-of-the-art \cite{alfaro-contrerasTransformer2024}. Additionally, our model achieves 20.92\% SER on the SheetSage-A2S dataset for popular music, serving as a strong benchmark for future research. The dataset, model, and code are made publicly available at: https://github.com/Multimodal-Music-Research-Lab/SheetSage2Kern_model.