PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
作者: Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang, Jinyang Wu, Guoren Wang, Changsheng Li
分类: cs.AI
发布日期: 2026-08-03
💡 一句话要点
提出PCSD以解决强化学习中的稀疏奖励问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 自蒸馏 教师信号 稀疏奖励 动态调整 多轮交互 智能体学习
📋 核心要点
- 现有方法在处理稀疏奖励时,常依赖孤立的标记级差异,容易受到噪声影响,或使用共享的步级权重,忽视了位置变化。
- 本文提出的PCSD通过局部持久性信号推导标记级蒸馏权重,结合自适应窗口和趋势感知调制,增强了教师信号的可靠性。
- PCSD在ALFWorld整体结果上超越所有基线,分别提高了15.6和13.3分,且在未见的ALFWorld分割上也获得了15.8分的提升。
📝 摘要(中文)
大型语言模型代理在复杂交互任务中展现出强大的潜力,但其强化学习常受到稀疏奖励的制约,长时间的多轮轨迹可能仅收到单一的结果信号。现有的在线自蒸馏方法(OPSD)提供来自特权教师的密集标记级监督,但教师在每个位置的可靠性可能不高。本文提出了持久一致性自蒸馏(PCSD),通过局部持久性信号推导标记级蒸馏权重,结合自适应窗口和指数衰减聚合,捕捉持久的相对教师支持,并通过趋势感知调制来减弱局部下降的支持,最终生成连续权重。该目标与GRPO联合优化,结合了密集的教师指导与稀疏的环境反馈。
🔬 方法详解
问题定义:本文旨在解决强化学习中稀疏奖励带来的挑战,现有方法在处理教师信号时容易受到噪声影响,导致学习效果不佳。
核心思路:PCSD通过分析教师信号的局部持久性来推导标记级蒸馏权重,旨在提高教师信号的可靠性和有效性。
技术框架:PCSD的整体架构包括自适应窗口、指数衰减聚合和趋势感知调制等模块,形成一个动态调整的蒸馏过程。
关键创新:PCSD的主要创新在于结合了持久性信号和趋势感知调制,能够有效减弱局部信号的下降影响,与传统方法相比具有更强的鲁棒性。
关键设计:在参数设置上,PCSD采用了自适应窗口大小和指数衰减策略,损失函数设计上结合了教师信号的持久性和环境反馈,确保了蒸馏过程的稳定性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,PCSD在ALFWorld整体表现上超越了所有基线,分别提高了15.6和13.3分,相较于SDAR也有6.2和5.5分的提升。同时,在WebShop任务中保持竞争力,并在未见的ALFWorld分割上获得了15.8分的提升。
🎯 应用场景
该研究的潜在应用领域包括复杂交互任务的强化学习,如机器人控制、游戏智能体和自动驾驶等。通过提高学习效率和稳定性,PCSD有望在实际应用中显著提升智能体的表现,推动相关技术的发展。
📄 摘要(原文)
Large language model agents have shown strong potential in complex interactive tasks, yet their reinforcement learning (RL) is often hindered by sparse rewards, as a long multi-turn trajectory may receive only a single outcome-level signal. On-policy self-distillation (OPSD) provides dense token-level supervision from a privileged teacher, but the teacher may not be reliable at every position. Existing methods commonly rely on isolated token-level discrepancies, which can be sensitive to noise, or assign a shared step-level weight that may overlook positional variation. We propose Persistent Consistency Self-Distillation (PCSD), which derives token-level distillation weights from the local persistence of teacher-favoring signals. PCSD combines adaptive windows with exponentially decayed aggregation to capture persistent relative teacher support, applies trend-aware modulation to attenuate locally declining support, and produces continuous weights through sigmoid gating. The resulting objective is jointly optimized with GRPO, combining dense teacher guidance with sparse environmental feedback. Without inference-time skills, PCSD achieves the best ALFWorld Overall results among all baselines on both backbones, exceeding GRPO by 15.6 and 13.3 points and SDAR by 6.2 and 5.5 points, while remaining competitive on WebShop and gaining 15.8 points over GRPO on unseen ALFWorld split.