RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation
作者: Rong Chao, Sung-Feng Huang, Moreno La Quatra, Sabato Marco Siniscalchi, Wen-Huang Cheng, Szu-Wei Fu, Yu Tsao
分类: cs.SD, cs.CL
发布日期: 2026-08-12
备注: Accepted to INTERSPEECH 2026
💡 一句话要点
提出RT-SEMamba以解决实时语音增强问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 实时语音增强 知识蒸馏 因果模型 时频分析 模型压缩
📋 核心要点
- 现有的语音增强方法在实时处理和内存效率方面存在挑战,尤其是Transformer架构的高延迟和内存消耗问题。
- RT-SEMamba通过因果时频Mamba块和渐进知识蒸馏策略,提供了一种高效的语音增强解决方案,能够在保持性能的同时减少模型复杂性。
- 在实验中,8层RT-SEMamba在Voicebank-DEMAND上达到了3.32的PESQ,而蒸馏后的1层学生模型性能提升至3.18,显示出显著的速度和效率优势。
📝 摘要(中文)
本文提出了RT-SEMamba,一个基于因果时频Mamba块的完全因果语音增强模型。与依赖于不断增长的键值缓存的Transformer架构不同,Mamba每层传播固定大小的递归状态,从而实现内存和带宽高效的长时间推理。此外,论文引入了一种渐进知识蒸馏策略,将一个8层的教师模型压缩为一个浅层的1层学生模型,通过共同蒸馏复杂的谱输出和中间表示。在Voicebank-DEMAND数据集上,8层RT-SEMamba在25毫秒算法延迟约束下实现了3.32的PESQ,而蒸馏后的1层学生模型在保持相同稳态RTF的情况下,将性能从3.06提升至3.18,提供了2.75倍的速度提升。这些结果表明,采用渐进KD的状态空间模型在实时语音增强中提供了竞争性的质量-延迟权衡。
🔬 方法详解
问题定义:本文旨在解决实时语音增强中的延迟和内存效率问题,现有的Transformer架构在处理长时间序列时面临高延迟和内存消耗的挑战。
核心思路:RT-SEMamba通过因果时频Mamba块设计,使用固定大小的递归状态来替代动态的键值缓存,从而实现高效的长时间推理。同时,采用渐进知识蒸馏策略,将复杂的8层教师模型压缩为1层学生模型,提升了推理速度。
技术框架:RT-SEMamba的整体架构包括因果时频Mamba块和渐进知识蒸馏模块。Mamba块负责处理输入的语音信号,而知识蒸馏模块则通过共同蒸馏复杂的谱输出和中间表示来训练学生模型。
关键创新:最重要的创新在于引入了渐进知识蒸馏策略,成功将一个复杂的8层模型压缩为1层模型,同时保持了语音增强的性能,显著提高了推理速度。
关键设计:在模型设计中,采用了固定大小的递归状态以减少内存占用,损失函数设计上则注重于复杂谱输出和中间表示的共同蒸馏,确保学生模型能够有效学习教师模型的知识。
🖼️ 关键图片
📊 实验亮点
实验结果显示,8层RT-SEMamba在Voicebank-DEMAND数据集上达到了3.32的PESQ,且在25毫秒的算法延迟约束下表现优异。蒸馏后的1层学生模型在保持相同稳态RTF的情况下,将PESQ从3.06提升至3.18,实现了2.75倍的速度提升,展示了显著的性能改进。
🎯 应用场景
该研究的潜在应用领域包括实时语音通信、语音助手、听力辅助设备等,能够显著提升语音信号的清晰度和可懂度,尤其在噪声环境中表现优异。未来,该技术有望在智能家居、车载语音识别等场景中得到广泛应用,推动语音交互的自然性和流畅性。
📄 摘要(原文)
We present RT-SEMamba, a fully causal speech enhancement (SE) model built upon causal time-frequency Mamba blocks. Unlike Transformer-based architectures that rely on a growing key-value cache, Mamba propagates a fixed-size recurrent state per layer, enabling memory- and bandwidth-efficient long-form inference. We further introduce a progressive knowledge distillation (KD) strategy that compresses an 8-layer teacher into a shallow 1-layer student by jointly distilling complex spectral outputs and intermediate representations. On Voicebank-DEMAND, the 8-layer RT-SEMamba achieves 3.32 PESQ with a 25 ms algorithmic latency constraint, and the distilled 1-layer student improves over a naive 1-layer baseline from 3.06 to 3.18 PESQ while preserving the same steady-state RTF, delivering a 2.75x speedup over the teacher. These results demonstrate that state-space models with progressive KD provide a competitive quality-latency trade-off for real-time SE.