Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
作者: Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoro Mo, Yaolong Ju
分类: cs.SD, cs.AI, cs.MM
发布日期: 2026-08-06
备注: Accepted at the 34th ACM International Conference on Multimedia (MM '26)
🔗 代码/项目: GITHUB
💡 一句话要点
提出SheetSage-A2S数据集以解决流行音乐音频转谱问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音频转谱 流行音乐 数据增强 特征提取 MuQ模型 SheetSage-A2S数据集
📋 核心要点
- 现有的音频到乐谱系统主要针对古典音乐,流行音乐的研究相对不足,导致相关技术的应用受限。
- 本文提出了SheetSage-A2S数据集,并结合数据增强和MuQ预训练模型,旨在提升音频特征提取和模型泛化能力。
- 实验结果显示,提出的模型在古典音乐和流行音乐上均取得了显著的性能提升,提供了新的研究基准。
📝 摘要(中文)
现有的音频到乐谱(A2S)系统主要集中于古典音乐,而对流行音乐的应用研究仍然不足。本文首次提出了SheetSage-A2S数据集,包含61小时音频和来自6066首独特歌曲的9468个片段的**kern乐谱编码,旨在促进流行音乐的A2S研究。此外,论文通过数据增强和MuQ预训练特征提取模型来提升现有A2S方法的泛化能力和音频特征提取效果。实验结果表明,所提出的A2S模型在古典音乐的Quartets集合上达到了4.98%的符号错误率(SER),显著优于现有最先进方法的15.3% SER。同时,在SheetSage-A2S数据集上,该模型在流行音乐中实现了20.92%的SER,为未来研究提供了强有力的基准。
🔬 方法详解
问题定义:本文旨在解决音频到乐谱(A2S)转换中流行音乐的研究不足,现有方法主要集中于古典音乐,导致流行音乐的音频特征提取和转谱效果不佳。
核心思路:通过构建新的SheetSage-A2S数据集,结合数据增强技术和MuQ预训练特征提取模型,提升模型的泛化能力和音频特征提取的有效性。
技术框架:整体架构包括数据集构建、数据增强、特征提取和模型训练四个主要模块。首先,利用SheetSage-A2S数据集进行训练,然后通过数据增强技术扩展训练样本,最后使用MuQ模型提取音频特征并进行A2S转换。
关键创新:最重要的创新在于首次构建了针对流行音乐的SheetSage-A2S数据集,并结合MuQ模型进行特征提取,显著提升了模型在流行音乐上的表现。
关键设计:在模型设计中,采用了特定的损失函数以优化符号错误率,并通过调节网络结构参数来提高模型的学习能力和泛化性能。具体的网络结构和参数设置在实验中经过多次调优,以确保最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的A2S模型在古典音乐的Quartets集合上达到了4.98%的符号错误率(SER),显著优于现有最先进方法的15.3% SER。同时,在SheetSage-A2S数据集上,模型在流行音乐中实现了20.92%的SER,为未来研究提供了强有力的基准。
🎯 应用场景
该研究的潜在应用领域包括音乐教育、音乐创作辅助工具以及音乐分析等。通过提供流行音乐的音频转谱技术,可以帮助音乐学习者更好地理解和演奏流行音乐,同时也为音乐创作提供新的灵感和工具。未来,该技术有望在音乐信息检索和自动编曲等领域发挥更大作用。
📄 摘要(原文)
Existing audio-to-score (A2S) systems primarily focus on classical music, and the application to popular music remains underexplored. This paper first presents the new SheetSage-A2S Dataset, which includes 61 hours of audio with \texttt{**kern} score encodings for 9,468 clips originating from 6,066 unique songs, the first of its kind to facilitate A2S research for popular music. Additionally, we improve on existing A2S approaches by using data augmentation and MuQ, a pretrained feature-extraction model for music audio, to enhance generalisation abilities and extract meaningful audio features. Results show that the proposed A2S model achieves 4.98\% symbol error rate (SER) on the Quartets collection for classical music, which significantly outperforms the 15.3\% SER from the existing state-of-the-art \cite{alfaro-contrerasTransformer2024}. Additionally, our model achieves 20.92\% SER on the SheetSage-A2S dataset for popular music, serving as a strong benchmark for future research. The dataset, model, and code are made publicly available at: https://github.com/Multimodal-Music-Research-Lab/SheetSage2Kern_model.