Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
作者: Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang
分类: cs.AI
发布日期: 2026-08-31
备注: Work in progress
💡 一句话要点
提出TASPO以解决监督与信用不匹配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 特权信息 策略优化 信用分配 自蒸馏
📋 核心要点
- 现有的基于结果的强化学习方法在长时间交互中对所有决策的信用分配过于粗糙,导致监督与信用之间存在差距。
- 论文提出的TASPO方法通过将特权监督转化为基于结果的行动信用,解决了监督与信用不匹配的问题。
- 实验结果显示,TASPO在三个基准测试中比GRPO提高了10.6%的性能,并且在未见任务上表现出更好的泛化能力。
📝 摘要(中文)
基于结果的强化学习为语言模型代理提供了经过验证的反馈,但在长时间交互中对所有决策均匀分配轨迹级优势,导致信用粗糙。尽管基于策略的自蒸馏通过重新评估采样行为提供了更细致的监督,但这种细粒度监督并不一定能带来细粒度的信用。为此,本文提出TASPO,将特权监督转化为基于结果的行动信用,构建可决策的特权信息,并在可执行动作级别聚合特权信息引起的可能性变化,从而实现更有效的信用分配。实验表明,TASPO在三个基准测试中比GRPO提高了10.6%的性能,并在未见任务上具有更好的泛化能力。
🔬 方法详解
问题定义:本文旨在解决现有基于结果的强化学习方法在长时间交互中对决策的信用分配过于粗糙的问题,导致监督与信用之间存在显著差距。
核心思路:TASPO通过将特权信息转化为基于结果的行动信用,构建可决策的特权信息,并在可执行动作级别聚合特权信息引起的可能性变化,从而实现更有效的信用分配。
技术框架:TASPO的整体架构包括三个主要模块:特权信息构建、可能性变化聚合和信用分配。特权信息通过验证成功经验生成,可能性变化在可执行动作级别进行聚合,最终将相对行动支持转化为正向、有限且均值保持的权重。
关键创新:TASPO的主要创新在于将特权监督转化为基于结果的行动信用,解决了现有方法中监督与信用不匹配的问题,使得验证的结果能够有效指导策略更新。
关键设计:在设计中,TASPO采用了特权信息的相对行动支持作为权重分配依据,确保了更新方向和平均规模由验证结果决定,而特权信息仅用于重新分配信用。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TASPO在三个基准测试中比GRPO提高了10.6%的性能,并且在未见任务上表现出更好的泛化能力。这一成果展示了TASPO在减少监督不匹配和稳定策略优化过程中的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能代理、自动化决策系统和强化学习算法的优化。通过提高信用分配的准确性,TASPO能够在复杂任务中提升代理的学习效率和决策质量,具有重要的实际价值和未来影响。
📄 摘要(原文)
Outcome-based reinforcement learning provides verified feedback for language-model agents, but assigns trajectory-level advantage uniformly to all decisions, yielding coarse credit over long-horizon interactions. On-policy self-distillation offers finer supervision by re-evaluating sampled behavior with privileged information (PI) available only during training. However, fine-grained supervision is not necessarily fine-grained credit: PI-induced likelihood changes describe how additional information alters policy preference, but do not directly determine how an executable action should inherit the verified task outcome. This creates a supervision-credit gap. Privileged signals may be irrelevant to the current interaction state, operate at a token granularity misaligned with executable decisions, and lack the outcome semantics required for reinforcement. We introduce TASPO, which converts privileged supervision into outcome-grounded action credit. TASPO constructs decision-applicable PI from verified successful experience, aggregates PI-induced likelihood shifts at the executable-action level, and converts relative action support into positive, bounded, mean-preserving weights on the original trajectory advantage. Thus, the verified outcome determines the update direction and average scale, while PI only redistributes credit across actions. Across three agentic benchmarks, TASPO improves over GRPO by 10.6\% and generalizes better to unseen tasks. Further analysis indicates that TASPO reduces supervision mismatch and that action-level assignment stabilizes the policy optimization process. These findings offer the community another interesting perspective.