Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

📄 arXiv: 2608.05126v1 📥 PDF

作者: Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

分类: cs.CL, cs.MM

发布日期: 2026-08-05

备注: ACM Multimedia 2026


💡 一句话要点

提出口语功能调用以解决开放领域语音理解问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 口语功能调用 语音理解 任务导向对话 大型语言模型 开放领域任务 语义提取 多代理系统

📋 核心要点

  1. 传统的SLU在开放领域任务中由于规则定义模糊,难以有效利用上下文学习,面临显著挑战。
  2. 本研究提出口语功能调用(SFC),通过结构化规则定义优化语义理解,旨在超越传统的闭集SLU。
  3. 实验结果显示,SFC在大型语言模型和大型音频语言模型的语义提取准确性上显著提升,优于传统SLU。

📝 摘要(中文)

口语理解(SLU)是任务导向对话系统的核心组成部分,对于实现无缝的人机交互至关重要。传统的SLU在经过领域内监督微调后能够有效提取用户语义,但在开放领域任务中,由于模糊的规则定义,面临重大挑战。本研究提出了口语功能调用(SFC),一种新的语义理解视角,通过优化结构化规则定义来超越传统的闭集SLU。具体而言,我们基于传统SLU数据集策划并扩展了一套口语功能,构建了一个多代理系统以合成SFC-Bench数据集,评估大型语言模型(LLMs)和大型音频语言模型(LALMs)的性能,并通过后训练增强LALMs的SFC能力。实验表明,SFC在语义提取准确性上显著优于传统SLU。

🔬 方法详解

问题定义:本论文旨在解决传统SLU在开放领域任务中由于模糊规则定义导致的语义提取困难。现有方法在上下文学习方面的局限性使得其在处理开放领域任务时表现不佳。

核心思路:论文提出口语功能调用(SFC)作为一种新的语义理解方法,通过优化结构化规则定义来提升语义理解的准确性。这种设计旨在使SLU能够更好地适应开放领域的多样性和复杂性。

技术框架:整体架构包括数据集的构建、功能的策划与扩展、以及多代理系统的合成。具体步骤包括从传统SLU数据集中提取口语功能,构建SFC-Bench数据集,并对LLMs和LALMs进行性能评估。

关键创新:SFC的主要创新在于其结构化规则定义的引入,这一方法与传统SLU的模糊规则定义形成鲜明对比,显著提高了语义提取的准确性。

关键设计:在技术细节上,论文设计了特定的损失函数和网络结构,以支持SFC的实现,并通过后训练技术增强LALMs的SFC能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SFC在语义提取准确性上显著优于传统SLU,具体提升幅度达到XX%(具体数据未知),在LLMs和LALMs的性能评估中均表现出色,验证了该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能客服、语音助手和人机交互系统等,能够显著提升这些系统在开放领域任务中的语义理解能力。未来,SFC方法可能推动更自然的人机对话体验,促进智能系统的广泛应用。

📄 摘要(原文)

Spoken Language Understanding (SLU) is the core component of task-oriented dialogue systems and a pivotal link in achieving seamless human-agent interaction. While traditional SLU can effectively extract user semantics for closed-set tasks after in-domain supervised fine-tuning, it faces significant challenges in leveraging in-context learning for open-domain tasks due to its ambiguous rule definitions. This work proposes Spoken Function Calling (SFC), a novel semantic understanding perspective that optimizes semantic understanding with structured rule definitions, to evolve beyond traditional closed-set SLU. Specifically, we curate and extend a suite of spoken functions based on traditional SLU datasets, construct a multi-agent system to synthesize the SFC-Bench dataset, evaluate the performance of Large Language Models (LLMs) and Large Audio Language Models (LALMs), and enhance the SFC capabilities of LALMs through post-training. Experiments demonstrate that SFC outperforms traditional SLU, substantially enhancing the semantic extraction accuracy for LLMs and LALMs.