Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text
作者: Hyeonyu Kim, Hwayeon Kim, Youngwon Choi, Myeongkyun Cho, Huu-Kim Nguyen
分类: cs.CL, cs.AI
发布日期: 2026-08-24
备注: Accepted to EMNLP 2026 Findings
🔗 代码/项目: GITHUB
💡 一句话要点
提出框架以解决语音与文本表示之间的结构差异问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语音语言模型 结构对齐 语音与文本 多模态学习 自然语言处理
📋 核心要点
- 现有语音语言模型在指令遵循和任务泛化能力上较文本基础模型表现较弱,且语音与文本的表示仍然弱对齐。
- 论文提出了一种框架,解耦长度不匹配与语义对齐,促进语音与文本表示之间的紧密对应。
- 实验结果显示,该框架在多个基准测试中表现优异,强调了处理语音与文本结构差异的重要性。
📝 摘要(中文)
本研究探讨了语音语言模型(SLMs)在从语音生成文本响应时的表现,指出现有SLMs在指令遵循和任务泛化能力上相较于文本基础语言模型存在不足。尽管下游性能较强,语音与文本的表示仍然弱对齐,未能有效解决连续变化的语音与离散文本之间的结构差异。为此,论文提出了一种简单的框架,解耦长度不匹配与语义对齐,促进语音与文本表示之间的更紧密对应。实验结果表明,该方法在多个基准测试中表现出竞争力,强调了在SLM训练中明确处理语音与文本之间结构差异的重要性。
🔬 方法详解
问题定义:本研究旨在解决语音语言模型(SLMs)在生成文本响应时,语音与文本表示之间的结构差异问题。现有方法在指令遵循和任务泛化能力上存在不足,且语音与文本的表示未能有效对齐。
核心思路:论文的核心思路是提出一个框架,通过解耦长度不匹配与语义对齐,来增强语音与文本表示之间的对应关系。这种设计旨在更好地处理语音的连续性和文本的离散性。
技术框架:整体架构包括两个主要模块:一是语音特征提取模块,二是文本生成模块。框架通过对比学习的方式,促进语音与文本之间的语义一致性。
关键创新:最重要的技术创新点在于提出了将长度不匹配与语义对齐解耦的策略,这与现有方法的直接映射方式有本质区别。
关键设计:在参数设置上,采用了特定的损失函数来优化语音与文本的对齐程度,同时在网络结构上引入了多层次特征融合机制,以增强模型的表达能力。
🖼️ 关键图片
📊 实验亮点
实验结果表明,提出的框架在多个基准测试中表现出竞争力,尤其在指令遵循和任务泛化能力上,相较于强基线模型有显著提升,具体性能数据未详细列出,但强调了处理结构差异的重要性。
🎯 应用场景
该研究的潜在应用领域包括语音助手、自动字幕生成和人机交互等场景。通过提高语音语言模型的指令遵循能力和任务泛化能力,能够显著提升用户体验和系统的智能化水平。未来,该框架有望在多模态学习和自然语言处理领域产生更广泛的影响。
📄 摘要(原文)
Spoken Language Models (SLMs) generate textual responses directly from speech, offering an alternative to cascaded systems. Despite recent advances, existing SLMs still exhibit weaker instruction-following behavior and limited generalization across diverse tasks compared to text-based language models. Our analysis shows that speech and text representations in current SLMs remain weakly aligned despite strong downstream performance, indicating that structural differences between continuous, temporally varying speech and discrete text remain insufficiently addressed. To address this, we propose a simple framework that decouples length mismatch from semantic alignment and encourages closer correspondence between speech and text representations. Experiments across multiple benchmarks demonstrate competitive performance against strong baselines, underscoring the importance of explicitly addressing structural differences between speech and text in SLM training. Our code is publicly available at https://github.com/jaykim9870/Do_SLMs_Hear_Speech_as_They_Read_Text.