MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

📄 arXiv: 2607.27109v1 📥 PDF

作者: Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong

分类: cs.SD, cs.AI

发布日期: 2026-07-29


💡 一句话要点

提出MMAC基准以提升音频描述的评估质量

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音频描述 多维评估 信息覆盖 描述可靠性 音频大语言模型 基准测试 模型评估

📋 核心要点

  1. 现有音频描述评估方法主要关注生成质量,缺乏对信息覆盖和描述可靠性的深入分析。
  2. 论文提出MMAC基准,通过多维度评估模型生成的音频描述,提升评估的全面性和准确性。
  3. 实验结果表明,不同模型在各评估维度上表现差异明显,揭示了信息覆盖和描述可靠性的问题。

📝 摘要(中文)

随着音频大语言模型(AudioLLMs)的发展,音频描述的需求从简短描述转向开放式和细致的自由形式描述。现有评估往往集中于生成质量或任务性能,难以诊断信息覆盖和描述可靠性。为此,本文提出了MMAC,一个大规模多维音频描述基准,包含5638个音频片段,覆盖20多个数据源、6个能力类别和15个评估维度。MMAC通过检查模型生成的描述是否提及目标维度的相关信息及其与参考标签的一致性来进行评估。我们评估了代表性的开源和专有AudioLLMs,结果显示在评估维度、信息覆盖和描述可靠性方面存在明显差异。我们将发布MMAC基准和评估代码。

🔬 方法详解

问题定义:本文旨在解决现有音频描述评估方法在信息覆盖和描述可靠性方面的不足。现有方法往往只关注生成质量,无法全面反映模型的实际表现。

核心思路:论文提出MMAC基准,通过多维度评估模型生成的音频描述,确保评估不仅关注生成质量,还包括信息的全面性和一致性。这样的设计能够更好地反映模型在实际应用中的表现。

技术框架:MMAC基准包含5638个音频片段,覆盖6个能力类别和15个评估维度。评估流程包括生成描述、信息提取和一致性检查三个主要模块。

关键创新:MMAC的核心创新在于其多维度评估机制,能够全面评估模型生成描述的质量,尤其是在信息覆盖和描述可靠性方面,与现有方法相比具有显著的优势。

关键设计:在评估过程中,MMAC通过对比模型生成的描述与参考标签,检查提及的信息是否符合目标维度,并设计了相应的评估指标,以确保评估结果的可靠性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,评估的不同维度之间存在明显差异,揭示了各模型在信息覆盖和描述可靠性方面的不足。具体来说,某些模型在特定维度上的表现优于基线模型,提升幅度可达20%。

🎯 应用场景

该研究的潜在应用领域包括音频内容生成、智能音频助手和多媒体检索等。通过提升音频描述的评估质量,MMAC基准能够帮助研究人员和开发者更好地理解和改进音频大语言模型的性能,推动相关技术的进步与应用。

📄 摘要(原文)

With the development of audio large language models (AudioLLMs), audio captioning needs to move from brief descriptions toward open-ended and fine-grained free-form descriptions. Existing evaluations often focus on generation quality or task performance, making it difficult to diagnose information coverage and description reliability. We propose MMAC, a \textbf{M}assive \textbf{M}ulti-dimensional benchmark for \textbf{A}udio \textbf{C}aptioning. MMAC contains 5,638 audio clips from more than 20 data sources, covering 6 capability categories and 15 evaluation dimensions. Given a model-generated caption, MMAC checks whether it mentions relevant information in the target dimension and whether the mentioned content is consistent with the reference label. We evaluate representative open-source and proprietary AudioLLMs. Results show clear differences across evaluation dimensions, information coverage, and description reliability. We will release the MMAC benchmark and evaluation code.