Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents
作者: Seonghyeon Cho, Chanjun Park
分类: cs.CL
发布日期: 2026-09-01
备注: Accepted to Findings of EMNLP 2026
💡 一句话要点
提出技能跟随以评估检索启用LLM代理的实际技能使用
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 技能检索 实际使用效应 评估方法 性能分析
📋 核心要点
- 现有评估方法无法准确判断检索技能对任务完成的真实影响,存在选择偏差。
- 本文提出检索引发的实际使用效应(RAE),用于评估技能启用与禁用的真实效果。
- 实验结果显示,尽管模型整体表现提升,但在特定任务上,检索反而可能导致性能下降。
📝 摘要(中文)
大型语言模型(LLM)代理越来越依赖外部技能,但标准评估方法无法清晰判断检索这些技能是否真正有助于任务完成。现有的聚合指标常常比较检索与非检索任务,导致严重的选择偏差,无法孤立出技能使用的真实效果。为此,本文引入了检索引发的实际使用效应(RAE),该指标计算在代理主动检索技能的任务中,匹配的技能启用与禁用执行之间的同任务结果差异。通过对17个LLM在编码和数学领域的评估,我们发现了一个明显的评估悖论:模型在整体上显示出正向的检索提升,但RAE却为负值。这表明聚合平均可能会产生误导性的工具使用能力幻觉,而RAE则直接衡量检索到答案的流程是否真正改善了结果。
🔬 方法详解
问题定义:本文旨在解决现有评估方法无法准确反映LLM代理在检索技能使用上的真实效果的问题。现有方法通过聚合指标比较检索与非检索任务,导致选择偏差,无法孤立出技能使用的真实影响。
核心思路:论文提出了检索引发的实际使用效应(RAE),该指标专注于在代理主动检索技能的任务中,比较技能启用与禁用的执行结果,从而更准确地评估技能的实际贡献。
技术框架:整体架构包括任务选择、技能检索、执行比较三个主要模块。首先,选择代理主动检索技能的任务;其次,执行技能启用和禁用的任务;最后,计算两者之间的结果差异。
关键创新:RAE的引入是本文的核心创新点,它与传统的聚合评估方法本质上不同,能够直接反映技能使用的真实效果,避免了选择偏差的影响。
关键设计:在RAE的计算中,采用了匹配任务的结果差异作为评估标准,确保比较的公平性。此外,实验中对17个LLM进行了系统评估,涵盖编码和数学领域,确保结果的广泛适用性。
🖼️ 关键图片
📊 实验亮点
实验结果揭示了一个评估悖论:尽管多个模型在整体上显示出正向的检索提升,但在特定任务上,RAE却为负值,表明检索可能对模型性能产生负面影响。这一发现强调了聚合平均可能导致的误导性结果。
🎯 应用场景
该研究的潜在应用领域包括智能助手、编程辅助工具和教育技术等。通过更准确地评估LLM在特定任务中的技能使用,能够提升这些系统的实用性和用户体验,未来可能推动更智能的交互式应用的发展。
📄 摘要(原文)
Large Language Model (LLM) agents increasingly rely on external skills, yet standard evaluations obscure whether retrieving these skills actually helps. Aggregate metrics often compare retrieved versus non-retrieved tasks, introducing severe selection bias and failing to isolate the true effect of skill use. To measure this actual-use capability-which we formalize as Skill Following (SF)-we introduce the Retrieval-Invoked Actual-Use Effect (RAE). RAE computes the same-task outcome difference between matched skill-enabled and skill-disabled executions, conditioned exclusively on tasks where the agent actively retrieved a skill. Evaluating 17 LLMs across coding and mathematical domains, we uncover a stark evaluation paradox: models frequently show positive aggregate retrieval lift but negative RAE. On MBPP+, multiple models that appear to benefit system-wide actually harm their own performance on the exact tasks where retrieval occurred. These findings demonstrate that aggregate averages can create a misleading illusion of tool-use proficiency, whereas RAE directly measures whether the retrieval-to-answer pipeline genuinely rescues more outcomes than it harms.