HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning
作者: Haowei Liu, Jiamian Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang
分类: cs.LG, cs.AI, cs.IR
发布日期: 2026-08-03
💡 一句话要点
提出HindSearch以解决搜索增强强化学习中的失败轨迹信息损失问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 搜索增强 强化学习 自蒸馏 失败轨迹 后见学习 模型批评 Qwen2.5-3B
📋 核心要点
- 现有的搜索增强强化学习方法在处理失败轨迹时,往往忽视了失败原因的信息,导致学习效率低下。
- HindSearch通过引入后见自蒸馏机制,使得模型能够从失败轨迹中学习,并通过评判者的批评来改进搜索行为。
- 在标准基准测试中,HindSearch实现了39.4%的平均精确匹配率,显著优于之前的基线,展示了后见学习的重要性。
📝 摘要(中文)
搜索增强的语言模型代理通常使用二元精确匹配奖励进行训练,这导致大部分失败轨迹的信息被丢弃。本文提出HindSearch,一种针对GRPO的后见自蒸馏程序:在每次回合后,一个冻结的评判者使用黄金答案对每个失败轨迹进行简短的批评,这些批评为学生的搜索行为提供了辅助的在线蒸馏信号。在标准的七个基准测试中,使用Qwen2.5-3B-Instruct,HindSearch达到了39.4%的平均精确匹配率,超越了之前的搜索强化学习基线。移除评判者对黄金答案的访问几乎消除了大部分增益,证明了后见作为改进源的重要性。
🔬 方法详解
问题定义:本文旨在解决搜索增强强化学习中,失败轨迹信息丢失的问题。现有方法仅依赖于二元精确匹配奖励,无法有效利用失败轨迹的反馈。
核心思路:HindSearch的核心思路是通过后见自蒸馏机制,使模型能够从失败中学习。具体而言,使用一个冻结的评判者对失败轨迹进行批评,提供额外的学习信号。
技术框架:HindSearch的整体架构包括两个主要模块:一是执行回合的学生模型,二是负责批评的冻结评判者。每次回合结束后,评判者对失败轨迹进行分析,并生成批评信息。
关键创新:HindSearch的创新在于引入了后见自蒸馏机制,使得模型能够从失败中提取有价值的信息,显著提升了学习效果。这一方法与传统的强化学习方法相比,能够更好地利用失败轨迹的信息。
关键设计:在设计上,HindSearch采用了特定的损失函数来整合评判者的批评信息,并优化学生模型的搜索行为。评判者的批评信息被用作额外的在线蒸馏信号,增强了模型的学习能力。
🖼️ 关键图片
📊 实验亮点
HindSearch在标准七个基准测试中达到了39.4%的平均精确匹配率,显著超越了之前的搜索强化学习基线。这一结果表明,后见学习机制在提升模型性能方面具有重要作用,移除评判者对黄金答案的访问几乎消除了大部分增益,强调了后见学习的重要性。
🎯 应用场景
HindSearch的研究成果在多个领域具有潜在应用价值,尤其是在需要高效学习和决策的复杂任务中,如自动驾驶、机器人控制和智能对话系统。通过更好地利用失败信息,模型能够在动态环境中快速适应并优化决策过程,提升整体性能。
📄 摘要(原文)
Search-augmented LM agents are typically trained with a binary exact-match reward, which throws away most of what a failed trajectory tells us about why it failed. We introduce HindSearch, a hindsight self-distillation procedure for GRPO: after each rollout, a frozen judge writes a short critique of every failed trajectory using the gold answer, and the critique supplies an auxiliary on-policy distillation signal on the student's search actions. On the standard seven-benchmark suite with Qwen2.5-3B-Instruct, HindSearch reaches 39.4% average EM, outperforming prior search-RL baselines. Removing the judge's access to the gold answer erases most of the gain, isolating hindsight as the source of the improvement.