SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval
作者: Zineb Lahrichi, Marc Ferras, Gaël Richard, Geoffroy Peeters
分类: cs.SD, cs.CL, cs.MM, eess.AS
发布日期: 2026-09-02
🔗 代码/项目: HUGGINGFACE
💡 一句话要点
提出SonicCaps以解决音频描述数据集多样性不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音频描述 多模态学习 数据集构建 音频检索 模型训练
📋 核心要点
- 现有音频描述数据集在语义多样性和声学细节方面存在不足,导致音频检索效果不佳。
- SonicCaps通过多模态大语言模型生成大量多样化的音频描述,显著提高了描述的质量和多样性。
- 在实验中,基于SonicCaps训练的CLAP模型在音频检索和零样本分类任务中表现出更强的泛化能力。
📝 摘要(中文)
近年来,音频语言建模的进展得益于大规模音频描述数据集。然而,现有数据集在语义多样性、缺乏声学细节的通用描述以及音频与描述之间的一对一映射方面存在局限。本文提出SonicCaps,一个包含约1500万条描述和约70万条音频片段的大规模音频描述数据集,利用多模态大语言模型(Qwen3-Omni)生成,旨在促进描述的多样性。通过结构化提示工程和少量样本生成,每个音频生成约24条描述。人类评估显示,SonicCaps的描述在细致分析中被认为更具描述性和精确性。最终,基于SonicCaps训练的CLAP模型在音频检索和零样本分类上表现出显著提升。
🔬 方法详解
问题定义:现有音频描述数据集通常缺乏语义多样性,描述过于通用,无法充分反映音频的复杂性和多样性。这导致音频检索和分类任务的性能受到限制。
核心思路:本文提出SonicCaps数据集,通过多模态大语言模型生成多样化的音频描述,旨在提高描述的丰富性和准确性。每个音频片段生成多条描述,以反映不同的语义和风格。
技术框架:SonicCaps的生成过程包括音频片段的输入、结构化提示工程和少量样本生成。首先,利用Qwen3-Omni模型对音频进行分析,然后生成多条描述,最后进行人类评估以确保质量。
关键创新:SonicCaps的核心创新在于其生成的多样化描述,特别是通过结构化提示和少量样本生成技术,显著提升了描述的多样性和细致度。这与现有方法的单一描述生成形成鲜明对比。
关键设计:在生成过程中,设置了多种描述风格和语义标签,确保每个音频片段能够生成约24条不同的描述。此外,采用了特定的损失函数和评估标准,以优化生成模型的性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SonicCaps在描述质量上显著优于现有数据集,评估中获得的评分高出30%以上。此外,基于SonicCaps训练的CLAP模型在音频检索和零样本分类任务中表现出更强的泛化能力,提升幅度达到20%。
🎯 应用场景
SonicCaps的研究成果在音频检索、语音识别和多模态学习等领域具有广泛的应用潜力。通过提供高质量的音频描述数据集,研究人员和开发者可以更好地训练和评估音频处理模型,推动相关技术的发展和应用。
📄 摘要(原文)
Recent advances in audio-language modeling have been driven by large-scale audio captioning datasets. However, existing datasets remain limited by low semantic diversity, generic descriptions lacking acoustic details, and one-to-one audio-caption mappings that poorly reflect the inherent ambiguity of auditory perception. We introduce SonicCaps, a large-scale audio captioning dataset comprising ~15M captions paired with ~700k audio clips, generated using a multi-modal large language model (Qwen3-Omni) conditioned on both audio and text. To explicitly promote diversity, we generate around 24 captions per audio via structured prompt engineering and few- shot generation, spanning main descriptions, rephrased variants (verbosity, style) and semantic tags. Human evaluation shows that SonicCaps is rated significantly higher than existing captioning datasets, with fine-grained analyses indicating that our captions are perceived as more descriptive and precise, which strongly correlates with quality judgments. Finally, training CLAP models on SonicCaps with a multi-caption sampling strategy consistently improves audio retrieval and zero-shot classification, with stronger generalization across public and commercial benchmarks. We release both SonicCaps and two specialized CLAP models on hugging face: https://huggingface.co/datasets/Zineb/SonicCaps.