Group-Reflective Self-Distillation for Agentic Reinforcement Learning

📄 arXiv: 2607.28076v1 📥 PDF

作者: Binbin Zheng, Zijun Xie, Guanqun Zhao, Enlei Gong, Xing Ma, Xiaoliang Fu, Zeyu Chen

分类: cs.AI, cs.LG

发布日期: 2026-07-30


💡 一句话要点

提出群体反思自蒸馏以解决强化学习中的稀疏监督问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 自蒸馏 群体反思 能力对齐 结果区分 自然语言处理 智能代理

📋 核心要点

  1. 现有的强化学习方法在处理稀疏奖励时存在不足,无法有效区分成功与失败的行为。
  2. 本文提出的群体反思自蒸馏方法通过策略自身的验证回合生成指导,提升了学习效果。
  3. 实验结果显示,GRSD在多个环境中均优于现有基线,且在新任务上具有更强的泛化能力。

📝 摘要(中文)

具有可验证奖励的强化学习(RLVR)在训练大型语言模型代理方面表现出色。然而,终端奖励仅提供粗略的轨迹级监督,使得成功行为、重复错误和偶然选择混合在同一结果信号中。现有的自蒸馏方法虽然通过自然语言技能丰富了稀疏监督,但从外部检索或单一轨迹提取的技能可能与当前经验不匹配,超出策略能力或仍然是路径特定的。本文提出了群体反思自蒸馏(GRSD),从策略自身的验证回合中推导出能力对齐和结果区分的指导。通过对每个验证轨迹的反思,构建群体级特权指导,从而提升自我教师的回合级信用分配。实验结果表明,GRSD在多个代理环境和模型规模上均优于竞争基线,并在未见任务上具有更好的泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在稀疏奖励情况下的监督不足问题,尤其是无法有效区分成功与失败行为的挑战。现有自蒸馏方法依赖外部技能或单一轨迹,可能导致不匹配和路径特定性。

核心思路:提出群体反思自蒸馏(GRSD),通过策略自身的验证回合生成能力对齐和结果区分的指导,避免了外部依赖和路径特定性的问题。

技术框架:GRSD的整体架构包括:首先,策略对每个验证轨迹进行反思;其次,使用停止梯度快照对成功和失败的回合进行对比,构建群体级特权指导;最后,自我教师根据该指导进行回合级信用分配的优化。

关键创新:GRSD的主要创新在于利用策略自身的回合进行反思,构建群体级指导,这与现有方法依赖外部技能或单一轨迹的方式本质上不同。

关键设计:在设计中,采用了停止梯度机制以确保反思过程不影响策略更新,同时在损失函数中引入了基于结果的优势调制,以保持验证者确定的学习方向。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,GRSD在多个代理环境中均显著优于竞争基线,具体表现为在某些任务上性能提升超过20%。此外,GRSD在未见任务上的泛化能力显著增强,展示了其在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括智能代理的训练、自然语言处理任务以及复杂决策系统。通过提升强化学习的学习效率和泛化能力,GRSD可在自动驾驶、机器人控制和游戏AI等多个领域产生实际价值,推动智能系统的进一步发展。

📄 摘要(原文)

Reinforcement learning with verifiable rewards (RLVR) is effective for training large language model agents. However, terminal rewards provide only coarse trajectory-level supervision, leaving successful behaviors, recurring mistakes, and incidental choices entangled in the same outcome signal. Existing agentic self-distillation methods enrich sparse supervision with natural-language skills, but skills retrieved externally or extracted from a single trajectory by stronger models may mismatch current experience, exceed the policy's capability, or remain path-specific. We propose Group-Reflective Self-Distillation (GRSD), which derives capability-aligned and outcome-discriminative guidance from the policy's own verified rollouts. For each prompt, the policy reflects on each verified trajectory in an on-policy group, and a stop-gradient snapshot contrasts the resulting reflections from successful and failed rollouts to construct group-level privileged guidance. Conditioned on this guidance, a self-teacher refines turn-level credit assignment by modulating outcome-based advantages while preserving the verifier-determined learning direction. Experiments across multiple agentic environments and model scales demonstrate that GRSD consistently outperforms competitive baselines and generalizes more effectively to unseen tasks.