CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

📄 arXiv: 2608.13101v1 📥 PDF

作者: Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

分类: cs.CL, eess.AS

发布日期: 2026-08-13

备注: To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa


💡 一句话要点

提出CASA以解决自动口语评估中的内容与音频信息分离问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自动口语评估 多模态模型 语音识别 内容分析 流利度特征 大语言模型 教育技术

📋 核心要点

  1. 现有的自动口语评估方法对音频与内容信息的贡献分析不足,且性能稳定性存在问题。
  2. CASA通过结合Whisper-medium与Qwen3.5-2B,提供了更清晰的语音表达与内容分离,简化了架构设计。
  3. 在Speak & Improve Corpus 2025上,CASA达到了0.358的RMSE,相较于之前最佳结果有显著提升,同时推理参数减少约50%。

📝 摘要(中文)

自动口语评估(ASA)的研究越来越多地采用多模态语音大语言模型来评估学习者的口语表现。然而,现有研究对音频和内容信息如何影响预测的分析有限,且结果的稳定性也存在疑问。本文提出CASA,一个结合Whisper-medium和Qwen3.5-2B的简化架构,达到了最先进的性能,同时提供了更可解释的语音表达与内容之间的分离。在Speak & Improve Corpus 2025上,CASA实现了0.358的均方根误差(RMSE),在使用约一半推理参数的情况下,超越了之前的最佳RMSE。该通用架构设计为可适应其他ASA语料库而无需结构性更改,并依赖于三个手工制作的流利度特征。通过消融实验和重复运行,分析了音频和内容信息的个体及互补贡献,考察了性能的可变性,并展示了大语言模型推理在无训练内容验证中的潜力。

🔬 方法详解

问题定义:本文旨在解决现有自动口语评估方法在音频与内容信息分析上的不足,特别是如何稳定地评估学习者的口语表现。

核心思路:CASA的核心思路是通过结合两个强大的模型(Whisper-medium和Qwen3.5-2B),实现对语音表达与内容的可解释性分离,从而提高评估的准确性和稳定性。

技术框架:CASA的整体架构包括音频特征提取模块、内容理解模块和流利度特征计算模块。音频特征通过Whisper-medium提取,内容理解则依赖于Qwen3.5-2B,流利度特征则是手工设计的。

关键创新:CASA的主要创新在于其简化的架构设计和对音频与内容信息的可解释性分离,这与现有方法的复杂性形成鲜明对比,提升了模型的可理解性和适应性。

关键设计:CASA使用了三个手工制作的流利度特征,并在模型推理中优化了参数设置,确保在减少推理参数的同时,仍能保持高性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

CASA在Speak & Improve Corpus 2025上实现了0.358的均方根误差(RMSE),显著优于之前的最佳结果,且在推理参数上减少了约50%。通过消融实验,验证了音频与内容信息的互补贡献,展示了模型的稳定性和有效性。

🎯 应用场景

CASA的研究成果在教育技术领域具有广泛的应用潜力,尤其是在语言学习和口语评估系统中。通过提供更准确和可解释的评估结果,CASA可以帮助教师和学习者更好地理解口语表现,并针对性地进行改进。此外,该方法的通用性使其能够适应不同的语料库,具有良好的扩展性。

📄 摘要(原文)

Research on automatic speaking assessment (ASA) has increasingly adopted multimodal speech large language models to assess learners' speaking performance. However, existing studies provide limited analysis of how acoustic and content information contribute to predictions and how stable the resulting performance is. We propose CASA, a simpler architecture combining Whisper-medium and Qwen3.5-2B that achieves state-of-the-art performance while providing a more interpretable separation between speech delivery and content. On the Speak & Improve Corpus 2025, CASA achieves a root mean square error (RMSE) of 0.358, improving on the previous best RMSE while using approximately half the estimated inference parameters. The general-purpose architecture is designed for adaptation to other ASA corpora without structural changes and relies on three handcrafted fluency features. Through ablations and repeated runs, we analyze the individual and complementary contributions of acoustic and content information, examine performance variability, and demonstrate the potential of large language model reasoning for training-free content validation.