AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
作者: Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang
分类: cs.AI, cs.LG
发布日期: 2026-08-06
备注: Code: https://github.com/ZethWang/AgentOPSD
💡 一句话要点
提出AgentOPSD以解决长时间多回合任务中的信用分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 信用分配 自蒸馏 贝叶斯信念 多回合任务 智能体学习 决策优化
📋 核心要点
- 现有的强化学习方法在长时间多回合任务中,无法有效归因于关键决策,导致信用分配不准确。
- 本文提出AgentOPSD,通过递归自蒸馏实现回合级信用分配,聚合标记级信息以更新贝叶斯信念状态。
- 在ALFWorld上,AgentOPSD的成功率达到89.1%,超越了GRPO和其他自蒸馏基线,验证了其有效性。
📝 摘要(中文)
强化学习(RL)中,具有可验证奖励的策略构建了轨迹级优势估计,但在长时间、多回合的智能任务中,往往无法准确归因于决定结果的关键决策。近期研究引入了特权自蒸馏以改善信用分配,但如何表示序列信用仍不明确。本文提出AgentOPSD,一种无评论家、递归的方法用于智能强化学习中的回合级信用分配。AgentOPSD将标记级教师-学生对数概率差异聚合为回合级证据,并在对数几率空间中递归更新贝叶斯信念状态。这种方法有效地将稀疏的结果监督转化为回合级信用信号,并通过连续状态之间的边际信念修正识别关键回合。该方法与标准策略优化完全兼容,无需额外的评论家或额外的回合。实验结果表明,AgentOPSD在ALFWorld、WebShop和Search-QA上表现优异,尤其在ALFWorld上取得了89.1%的成功率。
🔬 方法详解
问题定义:本文旨在解决在长时间多回合智能任务中,现有强化学习方法无法准确归因于关键决策的问题。这导致了信用分配的稀疏性和不准确性,影响了学习效果。
核心思路:AgentOPSD通过递归自蒸馏方法实现回合级信用分配,聚合标记级教师-学生对数概率差异,形成更密集的监督信号,从而有效地识别关键决策回合。
技术框架:该方法的整体架构包括两个主要阶段:首先,聚合标记级的对数概率差异以生成回合级证据;其次,在对数几率空间中递归更新贝叶斯信念状态,以实现信用信号的动态调整。
关键创新:AgentOPSD的主要创新在于其无评论家的设计和递归更新机制,使得信用分配更加灵活和高效,区别于传统方法依赖于额外的评论家或回合。
关键设计:该方法的关键设计包括对数几率空间的贝叶斯信念更新机制,以及如何有效聚合标记级信息以形成回合级信用信号,确保了模型的兼容性和高效性。
🖼️ 关键图片
📊 实验亮点
在实验中,AgentOPSD在ALFWorld上取得了89.1%的成功率,显著优于GRPO和其他自蒸馏基线,展示了其在回合级信用分配中的有效性和优势。消融实验表明,回合级聚合和历史依赖的递归信念更新是提升性能的关键因素。
🎯 应用场景
AgentOPSD的研究成果在智能体强化学习领域具有广泛的应用潜力,尤其是在需要长时间决策的复杂任务中,如机器人控制、自动驾驶和智能客服等。通过提高信用分配的准确性,该方法能够显著提升智能体的学习效率和决策质量,推动相关领域的技术进步。
📄 摘要(原文)
Reinforcement learning (RL) with verifiable rewards constructs trajectory-level advantage estimates, yet it often fails to credit the few pivotal decisions that determine outcomes in long-horizon, multi-turn agentic tasks. Recent work introduces privileged self-distillation for credit assignment, providing denser supervision, but it remains unclear how such local signals should represent sequential credit. We propose AgentOPSD, a critic-free, recursive method for turn-level credit assignment in agentic reinforcement learning. AgentOPSD aggregates token-level teacher-student log-probability gaps into turn-level evidence and recursively updates a Bayesian belief state in log-odds space. This yields a principled reweighting scheme that converts sparse outcome supervision into turn-level credit signals and identifies pivotal turns through the marginal belief revision between consecutive states. The method is fully compatible with standard policy optimization and requires neither an additional critic nor extra rollouts. We evaluate AgentOPSD on ALFWorld, WebShop, and Search-QA using Qwen2.5 models at two scales (3B and 7B). AgentOPSD outperforms GRPO and strong self-distillation baselines, achieving 89.1% success on ALFWorld with Qwen2.5-7B. Ablation studies attribute the gains to turn-level aggregation and history-dependent recursive belief updates.