Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning
作者: Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao Zhang
分类: cs.LG, cs.CL
发布日期: 2026-08-07
💡 一句话要点
提出TRIAL框架以解决稀疏奖励分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 代理强化学习 后见蒸馏 奖励分配 轨迹相对 决策优化 智能体学习
📋 核心要点
- 现有的代理强化学习方法在处理稀疏奖励时面临信号分配不明确的挑战。
- TRIAL框架通过轨迹相对后见蒸馏,采用统一的回合对齐评分协议来优化奖励分配。
- 实验结果显示,TRIAL在多个环境和评估指标上均优于GRPO,成功率显著提升。
📝 摘要(中文)
近年来的代理强化学习方法利用后见来补充稀疏的结果奖励。然而,完整的回合可能产生许多这样的信号,导致其在不同决策回合中的适当分配不明确。我们提出了TRIAL,一个具有统一回合对齐评分协议的轨迹相对后见蒸馏框架。TRIAL在每个决策回合提取该决策实现结果的视图,并在普通和后见条件下评估相同的响应。通过签名对数概率差确定标记级监督的方向和局部强度,同时回合级的幅度在实现的轨迹上共同归一化。实验结果表明,TRIAL在WebShop和ALFWorld上超越了GRPO,并在六种方法中在六个评估指标上实现最佳或并列最佳性能。
🔬 方法详解
问题定义:论文要解决的问题是如何在代理强化学习中有效分配稀疏奖励信号。现有方法在完整回合中产生多个奖励信号,但缺乏有效的分配机制,导致学习效率低下。
核心思路:TRIAL框架的核心思路是通过轨迹相对后见蒸馏,结合回合对齐评分协议,来优化奖励信号的分配。通过提取决策回合的结果视图,评估在不同条件下的响应,从而实现更有效的监督。
技术框架:TRIAL的整体架构包括决策回合的结果提取、普通与后见条件下的响应评估,以及基于签名对数概率差的监督分配。主要模块包括决策评估、信号提取和监督分配。
关键创新:TRIAL的关键创新在于其轨迹相对的奖励分配机制,通过联合归一化回合级幅度,确保了监督信号的有效分配,解决了现有方法中信号分配不均的问题。
关键设计:在设计中,TRIAL采用了签名对数概率差作为监督信号的基础,确保了标记级监督的方向性和强度,同时通过合适的参数设置实现了回合级幅度的归一化。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TRIAL在WebShop环境中成功率从56.4%提升至75.2%,任务得分从78.7%提升至85.7%。在所有八种骨干、环境和评估指标组合中,TRIAL均优于GRPO,并在六个指标中实现最佳或并列最佳性能。
🎯 应用场景
该研究的潜在应用领域包括智能代理、自动化决策系统和游戏AI等。通过优化奖励信号的分配,TRIAL框架能够提高智能体在复杂环境中的学习效率和决策能力,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Recent agentic reinforcement learning methods use hindsight to complement sparse outcome rewards. However, a completed rollout can yield many such signals, leaving their appropriate allocation across turns unclear. We introduce TRIAL, a trajectory-relative hindsight distillation framework with a unified turn-aligned scoring protocol. For each decision turn, TRIAL extracts an outcome view of that decision's realized consequence and evaluates the same response under ordinary and hindsight-conditioned contexts. The signed log-probability gap determines the direction and local strength of token-level supervision, while turn-level magnitudes are normalized jointly over the realized trajectory. The resulting allocation multipliers have an eligible-token-weighted mean of one, redistributing dense supervision across turns while fixing its average multiplier. Experiments on WebShop and ALFWorld with different backbones show that TRIAL outperforms GRPO across all eight combinations of backbone, environment, and evaluation metric, while achieving the best or tied-best performance among six methods on six of them. On WebShop with Qwen3-1.7B, TRIAL improves the success rate from 56.4% to 75.2% and the task score from 78.7% to 85.7%. Controlled ablations further show that trajectory-relative turn allocation provides substantial gains beyond those of dense hindsight distillation alone.