The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs

📄 arXiv: 2608.27750v1 📥 PDF

作者: Eric Yeats, Brendan Kennedy, Loc Truong, John Buckheit, Jung Lee, Jesse Friedbaum, John Emanuello, Henry Kvinge

分类: cs.LG, cs.CL

发布日期: 2026-08-27

备注: 4 main pages, 8 pages of references and appendices


💡 一句话要点

提出探测工具调用错误的新方法以提升LLM的可靠性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 工具调用错误 线性探针 大型语言模型 错误检测 模型泛化能力

📋 核心要点

  1. 现有方法在检测LLM工具调用错误时存在局限,无法有效捕捉某些类型的错误。
  2. 本文提出使用线性探针来检测工具调用错误,能够识别多种错误类型并提高检测的准确性。
  3. 实验结果显示,探针在捕捉错误方面表现出色,尤其是在处理参数类型正确但值错误的情况时。

📝 摘要(中文)

大型语言模型(LLMs)的隐藏状态能够捕捉与模型知识和行为相关的丰富信息,但仅通过输入和输出的检查难以提取。随着基于LLM的系统越来越多地与外部世界交互,检测工具的不当使用成为一个重要问题。为此,本文研究了使用线性探针检测工具调用错误的有效性,评估了18个工具调用LLM在伯克利函数调用排行榜上的表现。研究发现,探测是一种有效的手段,可以捕捉多种工具调用错误,包括使用错误值但正确类型的参数所引发的错误,这些错误可能不会被标准日志框架记录。成功的关键因素包括模型大小、探测层和模型后训练类型。我们还展示了探针能够对新类型错误进行泛化,这在实际应用中至关重要。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在工具调用时出现的错误检测问题。现有方法通常依赖于输入输出的检查,难以捕捉到某些细微的错误,尤其是参数类型正确但值错误的情况。

核心思路:论文提出通过线性探针来探测工具调用错误,利用模型的隐藏状态信息来识别潜在的错误。这种设计能够更全面地捕捉模型内部的行为特征,从而提高错误检测的准确性。

技术框架:整体架构包括数据收集、模型训练、线性探针设计和错误检测四个主要模块。首先收集工具调用数据,然后训练LLM,接着设计线性探针以分析隐藏状态,最后进行错误检测与评估。

关键创新:本文的主要创新在于使用线性探针对LLM的隐藏状态进行分析,能够有效识别多种工具调用错误,尤其是那些传统方法无法捕捉的错误。这一方法在模型后训练类型和探测层的选择上也展现出显著优势。

关键设计:在实验中,选择了不同大小的模型和多个探测层进行评估,使用特定的损失函数来优化探针的性能。通过对比不同设置,确定了最佳的参数配置,以提高探测的准确性和泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,线性探针在捕捉工具调用错误方面表现优异,能够识别多种错误类型,尤其是参数类型正确但值错误的情况。与传统方法相比,探针的有效性显著提升,尤其在模型规模和探测层的选择上,展现出更好的泛化能力。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化工具和其他基于LLM的系统,能够显著提高这些系统在与外部工具交互时的可靠性和安全性。未来,随着LLM的广泛应用,该方法将有助于减少因工具调用错误导致的系统故障,提升用户体验。

📄 摘要(原文)

The hidden states of large language models (LLMs) are known to capture rich information relating to model knowledge and behavior that can be hard to extract from examination of input and output alone. As LLM-based systems increasingly interface with the external world, one area of concern is detecting incorrect or improper use of tools. Motivated by this, we study the effectiveness of using linear probes to detect incorrect tool-calls, measuring probe efficacy across 18 tool-calling LLMs evaluated on the Berkeley Function Calling Leaderboard. Overall, we find that probing is an effective means to catch a range of different tool-calling errors, including errors arising from using an argument that has the wrong value but the correct type, which might not be recorded by standard logging frameworks. Important factors in success include model size, probing layer, and model post-training type. We also show that probes are capable of generalizing to novel types of errors, which is critical in real world deployments.