Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation

📄 arXiv: 2608.28508v1 📥 PDF

作者: V. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard Jäger

分类: cs.CL

发布日期: 2026-08-28

备注: Accepted at EMNLP-2026 (Findings)

🔗 代码/项目: GITHUB


💡 一句话要点

提出基于自监督语音表示的无参考强对齐评估指标

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自监督学习 语音表示 强对齐评估 音素聚类 声学一致性 多语言分析 无参考评估

📋 核心要点

  1. 现有的强对齐评估方法依赖于手动标注的时间戳,限制了其在大规模和多语言环境中的应用。
  2. 本文提出了PCMI和WACS两种新指标,利用自监督语音表示进行无参考的强对齐评估,提升了评估的效率和准确性。
  3. 实验结果显示,PCMI和WACS能够有效区分对齐质量,并与基于时间戳的评估指标高度相关,验证了其有效性。

📝 摘要(中文)

强对齐评估通常需要手动标注的时间戳,这限制了大规模和多语言分析的能力。本文提出了两种基于自监督语音表示的语料库级指标,用于无参考强对齐评估:音素聚类互信息(PCMI)和单词声学一致性评分(WACS)。PCMI衡量对齐音素标签与自监督语音表示所诱导的聚类之间的一致性,而WACS则通过动态时间规整相似性评估重复单词实现的一致性。实验表明,PCMI和WACS在对齐扰动下表现出一致的降级,且能够有效区分高质量和低质量的对齐结果。该研究展示了自监督语音表示在可扩展的无参考强对齐评估中的潜力。

🔬 方法详解

问题定义:本文旨在解决现有强对齐评估方法依赖手动标注时间戳的问题,这使得大规模和多语言分析变得困难。

核心思路:提出PCMI和WACS两种新指标,利用自监督学习生成的语音表示进行无参考评估,从而提高评估的可扩展性和准确性。

技术框架:整体架构包括两个主要模块:PCMI用于评估音素标签与聚类的一致性,WACS用于评估重复单词实现的一致性,二者结合形成完整的评估体系。

关键创新:PCMI和WACS的提出是本研究的核心创新,二者通过自监督语音表示实现了无参考评估,与传统方法相比,避免了对手动标注的依赖。

关键设计:在设计中,PCMI通过计算音素标签与聚类的互信息来评估一致性,而WACS则利用动态时间规整技术来衡量单词实现的相似性,确保了评估的准确性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,PCMI和WACS在85种语言的多种对齐系统中表现出色,能够有效区分高质量和低质量的对齐,且与手动标注的对齐质量指标高度相关,验证了其有效性和可靠性。

🎯 应用场景

该研究的潜在应用领域包括语音识别、语言学习、语音合成等,能够为多语言环境下的语音处理提供高效的评估工具。未来,随着自监督学习技术的进一步发展,这些指标有望在更多实际应用中发挥重要作用。

📄 摘要(原文)

Forced alignment evaluation typically requires manually annotated timestamps, limiting large-scale and multilingual analysis. We introduce two corpus-level metrics based on self-supervised (SSL) speech representations for reference-free forced alignment evaluation: Phoneme-Cluster Mutual Information (PCMI) and Word Acoustic Consistency Score (WACS). PCMI measures agreement between aligned phoneme labels and clusters induced from SSL-speech representations, while WACS measures consistency of repeated word realizations using dynamic time warping similarity between word representation sequences. Using both random and systematic perturbations, we show that PCMI and WACS degrade consistently under alignment perturbations. We further analyze the metrics across multiple alignment systems on 85 languages from FLEURS, validate them against manually annotated alignments from 45 languages in DoReCo, and evaluate them on two phonologically complex low-resource languages. The metrics effectively separate high- and low-quality alignments and correlate strongly with timestamp-based alignment quality measures. Our results demonstrate that SSL-speech representations enable scalable, reference-free forced alignment evaluation. The metrics are available as an open-source Python package at https://github.com/mahesh-ak/forced-aligner-metrics.