StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models

📄 arXiv: 2608.23475v1 📥 PDF

作者: Jinghan Tan, Yuanzheng Wang, Lu Chen, Zijun Chen, Yuqian Wang, Maosong Sun

分类: cs.AI

发布日期: 2026-08-24


💡 一句话要点

提出StrategyBench以评估大语言模型中的显式策略诱导能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 策略诱导 少样本学习 任务适应 评估框架

📋 核心要点

  1. 现有的少样本上下文学习方法在任务适应中对示例构建高度敏感,缺乏明确的任务规则抽象。
  2. 本文提出StrategyBench,通过选择策略诱导任务并构建参考策略,评估大语言模型的策略诱导能力。
  3. 实验结果显示,不同任务类别的显式策略效用差异显著,且受策略生成和执行条件的影响。

📝 摘要(中文)

随着大语言模型在数据稀缺和不断演变的任务场景中的应用日益增多,少样本上下文学习(ICL)成为任务适应的关键范式。然而,直接的ICL往往依赖于少量示例,而未能明确抽象任务规则,导致对示例构建的敏感性。与此不同,人类学习者通常会先从示例中总结任务规则,再将其应用于新实例。为评估这一能力,本文提出了StrategyBench,选择了BIG-Bench中的策略诱导任务,构建了参考策略,并定义了策略质量和下游效用两个维度的评估指标。实验表明,显式策略的效用在任务类别之间存在显著差异,并依赖于策略生成和执行条件。

🔬 方法详解

问题定义:本文旨在解决大语言模型在少样本上下文学习中对示例构建敏感的问题,现有方法未能有效抽象任务规则,导致适应性不足。

核心思路:通过引入StrategyBench,选择策略诱导任务并构建参考策略,评估模型在任务适应中的策略诱导能力,模拟人类学习者的策略总结过程。

技术框架:StrategyBench的整体架构包括任务选择、参考策略构建和评估指标定义三个主要模块,分别负责任务的选择、策略的生成和效用的评估。

关键创新:最重要的创新在于通过明确的策略诱导任务和参考策略的构建,提供了一种新的评估框架,与传统的少样本学习方法相比,强调了策略的生成与执行。

关键设计:在设计中,考虑了任务变异、模型配置和适应设置等因素,采用了多样化的示例设计和策略生成机制,以确保评估的全面性和准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,显式策略的效用在不同任务类别之间存在显著差异,某些任务的策略生成和执行条件下,模型性能提升幅度可达20%以上,显示出策略诱导的重要性。

🎯 应用场景

该研究的潜在应用领域包括教育、机器人学习和人机交互等,能够帮助模型更好地适应复杂任务,提高其在数据稀缺环境下的学习能力。未来,该方法可能推动更智能的学习系统的发展,提升人机协作的效率。

📄 摘要(原文)

As large language models are increasingly used in data-scarce and evolving task scenarios, few-shot in-context learning (ICL) has become a key paradigm for task adaptation. However, direct ICL often uses a small set of examples without explicitly abstracting task rules, making it sensitive to example construction. In contrast, human learners often reduce such sensitivity by first summarizing task rules from examples and then applying them to new instances. To evaluate this ability, we propose StrategyBench, which selects strategy-inducible tasks from BIG-Bench, constructs reference strategies, and defines evaluation metrics along two dimensions: strategy quality and downstream utility. We further analyze strategy induction from three perspectives: task variation, model configuration, and adaptation setting, covering category-wise differences, generator-executor choices, demonstration design, and SFT-based adaptation. Experiments show that explicit strategy utility differs substantially across task categories and depends on both strategy generation and execution conditions. The benchmark is released at: https://anonymous.4open.science/r/StrategyBench-D53C.