CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations
作者: Gabriel Meseguer-Brocal, Yuexuan Kong, Romain Hennequin
分类: cs.SD, cs.AI, cs.LG, eess.AS, eess.SP
发布日期: 2026-08-31
💡 一句话要点
提出CoJEPA以解决音乐表示学习中的全局与局部信息不足问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 音乐表示学习 自监督学习 对比学习 联合嵌入 音调理解 和声分析 音乐信息检索
📋 核心要点
- 现有的JEPA方法依赖教师-学生架构,可能导致表示信息不足,且训练不够稳定。
- CoJEPA通过结合JEPA和对比学习的目标,使用共享骨干网络来共同训练,从而解决了上述问题。
- 实验结果表明,CoJEPA在全球和局部音乐信息检索任务中均表现优异,特别在音调和和声理解方面具有显著优势。
📝 摘要(中文)
联合嵌入预测架构(JEPA)在潜在空间中通过自监督预测学习丰富表示方面表现出色,但通常依赖教师-学生架构和EMA来稳定训练,可能导致信息不足的表示。对比学习在训练上稳定,能够生成强大的全局表示,但在局部任务上受限于其全局目标。本文提出CoJEPA,将JEPA目标与对比目标结合,使用共享骨干网络共同训练,消除了对EMA教师的需求,同时通过局部预测丰富序列标记。CoJEPA在全球和局部音乐信息检索任务中超越或匹配了各自的方法,特别在音调和和声理解上表现出显著优势,且无需任何特定任务的架构更改。
🔬 方法详解
问题定义:本文旨在解决现有JEPA方法在训练稳定性和表示信息丰富性方面的不足,尤其是在音乐表示学习中。对比学习虽然稳定,但在局部任务上表现有限。
核心思路:CoJEPA通过将JEPA目标与对比学习目标结合,利用共享骨干网络进行联合训练,消除了对EMA教师的依赖,同时增强了序列标记的局部预测能力。
技术框架:CoJEPA的整体架构包括一个共享的骨干网络,采用JEPA目标对掩码序列标记进行训练,同时对类标记使用对比学习目标。这样的设计使得模型在训练过程中能够同时获得全局和局部的信息。
关键创新:CoJEPA的主要创新在于通过设计训练信号的方式来丰富表示,而无需增加额外的参数。这一方法有效结合了两种学习目标的优势,提升了模型的表现。
关键设计:在损失函数设计上,CoJEPA结合了JEPA的预测损失与对比损失,确保模型在训练过程中能够稳定学习。同时,保持了骨干网络的结构不变,避免了任务特定的架构调整。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CoJEPA在多个全球和局部音乐信息检索任务中超越或匹配了现有的对比学习和JEPA方法,特别是在音调和和声理解方面,表现出显著的优势,进一步验证了其有效性。
🎯 应用场景
CoJEPA在音乐信息检索(MIR)领域具有广泛的应用潜力,能够有效提升音频分析、音乐推荐和自动作曲等任务的性能。其创新的训练方法也为其他领域的表示学习提供了新的思路,未来可能推动更智能的训练目标设计。
📄 摘要(原文)
Joint-Embedding Predictive Architecture (JEPA) has shown strong performance in learning rich representations through self-supervised prediction in latent space. However, it typically relies on teacher--student architecture with an EMA to stabilise training, and can tend to yield uninformative representations. Contrastive learning is stable to train and produces strong global representations, but remains limited on local tasks by the global nature of its objective. In this work, we combine both into CoJEPA: a single shared backbone jointly trained with a JEPA objective on masked sequence tokens and a contrastive objective on the class token. The contrastive gradient provides stability, removing the need for an EMA teacher entirely, while JEPA enriches the sequence tokens via local predictions that contrastive learning alone cannot provide. Crucially, no extra parameters are added to the backbone: the same model is guided towards richer representations purely through the design of its training signal. CoJEPA takes the best of both worlds, outperforming or matching both individual methods across global and local MIR tasks, with a particularly strong advantage on tonal and harmonic understanding, and without any task-specific architectural changes. CoJEPA shows that combining objectives with complementary inductive biases can substitute for scale, encouraging future work to invest in smarter training objectives over ever-larger models.