Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

📄 arXiv: 2608.03610v1 📥 PDF

作者: Yuan Xie, Jiaqi Song, Xianliang Wang, Ming Lei, Jie Gao, Jie Wu

分类: cs.CL, cs.SD, eess.AS

发布日期: 2026-08-04


💡 一句话要点

提出语言专用多教师在线蒸馏以解决多语言ASR优化冲突问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多语言ASR 在线蒸馏 强化学习 语言专用教师 跨语言知识

📋 核心要点

  1. 现有的多语言ASR系统在联合建模时面临声学和语言特征的优化冲突,影响了语言专门化。
  2. 提出的LS-MOPD方法通过独立优化语言专用教师,减少了跨语言优化冲突,提升了多语言能力的整合效果。
  3. 实验结果显示,LS-MOPD在普通话、粤语和英语等基准测试中显著超越了现有的强化学习基线,展现了更强的泛化能力。

📝 摘要(中文)

现代基于大语言模型的自动语音识别(ASR)系统已将多语言能力作为标准特性,利用大规模多语言语料库和跨语言知识实现竞争性性能。然而,语言的声学、音位和词汇特征的异质性导致的联合建模引发优化冲突,削弱了语言专门化。为了解决这一挑战,本文提出了语言专用多教师在线蒸馏(LS-MOPD),通过强化学习独立优化语言专用教师,然后通过语言路由和令牌级多教师蒸馏将其专业知识整合到通用多语言学生中,从而减少直接的跨语言优化冲突。实验结果表明,LS-MOPD在多个基准测试中显著超越了强化学习基线,展现出超越所有教师的潜力。

🔬 方法详解

问题定义:本文旨在解决多语言ASR系统中由于语言特征异质性导致的优化冲突问题。现有方法在联合建模时,无法有效实现语言专门化,影响了系统性能。

核心思路:提出的LS-MOPD方法通过将语言特定知识的获取与多语言能力的整合解耦,采用独立优化的语言专用教师来减少直接的跨语言优化冲突。

技术框架:该方法的整体架构包括两个主要阶段:首先,通过强化学习独立优化语言专用教师;其次,通过语言路由和令牌级多教师蒸馏将教师的知识整合到一个通用的多语言学生模型中。

关键创新:LS-MOPD的核心创新在于其独立优化教师的策略,显著减少了不同语言之间的优化冲突,与现有的联合建模方法形成鲜明对比。

关键设计:在技术细节上,本文探讨了静态和动态的声学前缀配置,分析了教师与学生之间前缀一致性对在线蒸馏效果的影响,并设计了相应的损失函数和网络结构以优化蒸馏过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LS-MOPD在多个基准测试中显著超越了强化学习基线,尤其是在普通话、粤语和英语的识别任务中,性能提升幅度达到了XX%,显示出其在多语言ASR领域的强大潜力。

🎯 应用场景

该研究的潜在应用领域包括多语言语音助手、跨语言翻译系统以及多语种的客户服务自动化等。通过提高多语言ASR系统的性能,能够更好地满足全球用户的需求,推动人机交互的智能化和便捷化。未来,该方法可能在多语言处理和跨文化交流中发挥更大作用。

📄 摘要(原文)

Modern LLM-based ASR systems have established multilingual capability as a standard feature, leveraging large-scale multilingual corpora and LLMs' cross-lingual knowledge to achieve competitive performance across multilingual benchmarks. However, joint modeling of languages with heterogeneous acoustic, phonological, and lexical characteristics inevitably introduces optimization conflicts, undermining language-wise specialization. To address this challenge, we propose Language-Specialized Multi-Teacher On-Policy Distillation (LS-MOPD), which decouples language-specific knowledge acquisition from multilingual capability integration: language-specialized teachers are independently optimized via reinforcement learning (RL), after which their expertise is integrated into a generalist multilingual student through language routing and token-level multi-teacher distillation, thereby reducing direct cross-lingual optimization conflicts. We further explore two acoustic-prefix configurations, static and dynamic, to examine how teacher--student prefix consistency influences the efficacy of on-policy distillation. Experiments on benchmarks covering Mandarin, Mandarin subdialects, Cantonese, and English demonstrate that LS-MOPD substantially outperforms RL baselines and consistently surpasses the empirical performance envelope defined by best-performing RL teachers, revealing its potential to generalize beyond all teachers in multilingual ASR.