One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
作者: Xiaowei Sun, Jin Li, Yili Hong, Yikun Fu, Yanghua Xiao
分类: cs.AI
发布日期: 2026-09-01
🔗 代码/项目: GITHUB
💡 一句话要点
提出AnySearch框架以解决预算感知搜索问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 预算感知搜索 强化学习 大型语言模型 自适应采样 问答系统 资源分配 复合奖励机制
📋 核心要点
- 现有方法在固定预算下训练,无法适应部署时的预算变化,限制了其灵活性。
- 论文提出AnySearch框架,通过训练支架和课程强化学习实现单一策略的预算感知搜索。
- 在七个问答基准上进行的广泛实验显示,该方法在所有预算规模上均优于基线,并能在未见约束下泛化。
📝 摘要(中文)
尽管强化学习使基于大型语言模型的搜索代理能够调用外部工具,但现有方法在固定预算下训练,无法在部署时适应变化的约束。我们提出了AnySearch框架,使单一策略能够在任何预算约束下进行预算感知搜索。该方法通过训练支架和课程强化学习分为两个阶段:第一阶段注入显式预算状态并使用结构化推理提示指导在线性衰减预算下的有效分配;第二阶段移除支架,代理在自适应采样的预算约束下自主操作。通过将答案准确性与预算效率耦合的复合奖励进行优化,实验表明该方法在七个通用和多跳问答基准上超越了基线,能够在训练范围之外的未见约束下泛化,并在不增加过多token开销的情况下实现更高的工具生产力。
🔬 方法详解
问题定义:本论文旨在解决现有强化学习方法在固定预算下训练的问题,这导致其在实际应用中无法灵活应对变化的预算约束。现有方法缺乏适应性,限制了其在动态环境中的有效性。
核心思路:论文提出的AnySearch框架通过训练支架和课程强化学习,使单一策略能够在不同预算约束下进行有效的搜索。通过在训练过程中注入预算状态和结构化推理提示,代理能够学习如何在预算限制下进行高效的资源分配。
技术框架:AnySearch框架分为两个主要阶段:第一阶段通过显式预算状态注入和结构化推理提示进行训练,第二阶段移除支架,代理在自适应采样的预算约束下自主操作。整个过程通过复合奖励进行优化,结合了答案准确性和预算效率。
关键创新:该研究的主要创新在于通过复合奖励机制将答案准确性与预算效率耦合,采用自适应权重调整效率信号,从而在高准确性查询中放大效率信号,在低准确性查询中减弱效率信号。这种设计使得代理能够在不同的查询条件下灵活调整其搜索策略。
关键设计:在训练过程中,使用了线性衰减的预算模型,并通过绝对和相对信号来优化复合奖励。此外,代理的学习过程通过自适应采样的预算约束进行调整,以匹配推理条件。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AnySearch在七个通用和多跳问答基准上均超越了现有基线,在所有预算规模上表现优异。具体而言,该方法在未见约束下的泛化能力显著,且在工具生产力方面实现了显著提升,未增加过多token开销。
🎯 应用场景
该研究的AnySearch框架具有广泛的应用潜力,尤其在需要动态预算管理的搜索任务中,如在线问答系统、信息检索和智能助手等领域。其灵活的预算适应能力能够提高工具的使用效率,降低资源浪费,从而在实际应用中带来显著的经济效益。
📄 摘要(原文)
While reinforcement learning has enabled LLM-based search agents to invoke external tools, existing methods train under fixed budgets and cannot adapt when constraints vary at deployment. We propose AnySearch, a framework that enables a single policy to perform budget-aware search under any budget constraint through a training scaffold and curriculum reinforcement learning. In the first phase, we train the agent with explicit budget state injection and structured reasoning prompts that guide efficient allocation under linearly decaying budgets. In the second phase, the scaffold is removed and the agent learns to operate autonomously under adaptively sampled budget constraints, matching inference conditions. Both phases are optimized with a composite reward that couples answer accuracy with budget efficiency through absolute and relative signals, where an adaptive weight amplifies the efficiency signal for high-accuracy queries and attenuates it for low-accuracy ones. Extensive experiments on seven general and multi-hop QA benchmarks show that our method outperforms baselines across all budget scales, generalizes to unseen constraints beyond the training range, and achieves superior tool productivity without excessive token overhead. Our code is available at https://github.com/xwsun01/AnySearch.