Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study
作者: Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour
分类: cs.CL
发布日期: 2026-08-26
💡 一句话要点
比较生成与编码大型语言模型在ASR评估中的应用
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动语音识别 大型语言模型 BERTScore SemDist 评估方法
📋 核心要点
- 现有的ASR评估方法主要依赖词错误率(WER),但这一指标无法准确反映语义相似性,导致评估结果的局限性。
- 本文提出了一种比较研究,分析了编码器和解码器大型语言模型在ASR评估中的表现,重点关注BERTScore和SemDist的应用。
- 实验结果表明,经过优化的编码器度量与人类判断高度相关,而生成LLMs在假设比较中表现优异,提升了评估的可解释性。
📝 摘要(中文)
自动语音识别(ASR)通常通过词错误率(WER)进行评估,但这一指标无法有效反映语义相似性。尽管基于嵌入的度量与人类判断的相关性更高,但编码器和解码器大型语言模型(LLMs)的具体作用尚未深入探讨。本文对这两类模型在ASR评估中的表现进行了比较研究,分析了BERTScore和SemDist在不同LLMs、层次和池化策略下的表现,结果表明,经过适当配置后,这两种度量可以与人类判断实现良好的相关性。对于解码器模型,我们在两种设置下研究了生成LLMs的表现:通过提示进行成对假设选择和直接的定性错误分类。研究结果显示,编码器基于的度量依然具有很强的竞争力,而生成LLMs在假设比较中表现突出,并提高了ASR评估的可解释性。
🔬 方法详解
问题定义:本文旨在解决现有ASR评估方法中词错误率(WER)无法有效反映语义相似性的问题,探讨编码器与解码器大型语言模型在评估中的作用。
核心思路:通过比较编码器和解码器模型,分析BERTScore和SemDist在不同配置下的表现,探索生成LLMs在假设选择和错误分类中的应用。
技术框架:研究分为两个主要部分:首先,评估编码器模型在ASR评估中的表现;其次,研究生成LLMs在假设选择和错误分类中的应用,采用不同的层次和池化策略进行比较。
关键创新:本文的创新在于系统比较了编码器和解码器模型在ASR评估中的表现,揭示了生成LLMs在提高评估可解释性方面的潜力。
关键设计:在实验中,采用了多种参数配置和池化策略,确保BERTScore和SemDist能够在不同的LLMs和层次上实现最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,经过优化的编码器度量与人类判断的相关性显著提升,BERTScore和SemDist在不同配置下均表现出色。生成LLMs在假设比较中表现优异,提升了ASR评估的可解释性,为未来的研究提供了新的方向。
🎯 应用场景
该研究的潜在应用领域包括语音识别系统的评估与优化、自然语言处理中的语义理解以及人机交互系统的改进。通过提高ASR评估的准确性和可解释性,能够为相关技术的发展提供更为可靠的基础,推动智能语音助手和自动翻译等应用的进步。
📄 摘要(原文)
Automatic Speech Recognition (ASR) is typically evaluated using Word Error Rate (WER), which poorly reflects semantic similarity. While embedding-based metrics correlate better with human judgments, the respective roles of encoder and decoder-based Large Language Models (LLMs) remain underexplored. This paper presents a comparative study of both families for ASR evaluation. We analyze BERTScore and SemDist across different LLMs, layers, and pooling strategies, showing that both metrics can achieve strong correlation with human judgments when properly configured. For decoder models, we investigate generative LLMs in two settings: pairwise hypothesis selection via prompting and direct qualitative error classification. Our results show that encoder-based metrics remain highly competitive, while generative LLMs perform strongly in hypothesis comparison and improve the interpretability of ASR evaluation.