Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

📄 arXiv: 2608.13179v1 📥 PDF

作者: Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

分类: cs.AI

发布日期: 2026-08-13


💡 一句话要点

提出CrEST框架以解决多轮工具使用代理的信用分配问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 信用分配 多轮交互 自教师 层次化框架 工具使用代理 性能优化

📋 核心要点

  1. 现有的轨迹级信用分配方法将多轮结果混合,导致奖励信号的稀释,影响训练效果。
  2. 提出CrEST框架,通过层次化信用分配,结合自教师的密集标记级信号,优化多轮代理的训练过程。
  3. 实验结果显示,CrEST在多个模型规模上均优于传统RL和蒸馏方法,特别是在长轨迹任务中表现突出。

📝 摘要(中文)

强化学习与可验证奖励(RLVR)为多轮工具使用代理的训练提供了可验证的性能上限,但现有的轨迹级信用分配将异质的每轮结果混合为单一奖励信号。论文提出了CrEST,一个层次化信用分配框架,保留了RL的可验证上限,同时结合来自特权自教师的密集标记级信号。CrEST在两个层面上解决信用分配问题:通过回合分段的验证优势处理回合间稀释,同时通过熵门控自教师调制精炼回合内的标记贡献。实验结果表明,CrEST在BFCL V3和WildToolBench上始终优于RL和蒸馏基线,尤其在长轨迹和严格会话级指标上取得了显著提升。

🔬 方法详解

问题定义:论文要解决的问题是现有的轨迹级信用分配方法在多轮工具使用代理训练中存在的奖励信号稀释问题。现有方法将每轮的异质结果混合为单一奖励,导致训练效果不佳。

核心思路:论文提出的CrEST框架通过层次化的信用分配机制,结合来自特权自教师的密集标记级信号,旨在提高信用分配的精度和有效性,从而优化代理的学习过程。

技术框架:CrEST框架分为两个主要模块:回合分段的验证优势模块用于处理回合间的信用分配,而熵门控自教师调制模块则用于精炼回合内的标记贡献。整体流程包括信号收集、信用计算和策略更新三个阶段。

关键创新:CrEST的核心创新在于将教师的角色从决定更新方向转变为调节更新幅度,从而实现密集的信用分配而不牺牲可验证的性能上限。这一设计显著提升了多轮代理的训练效果。

关键设计:在CrEST中,采用了熵门控机制来调节自教师的影响力,确保在不同回合和标记间的贡献能够被准确评估。此外,损失函数的设计也考虑了多轮任务的特性,以增强模型的学习能力。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,CrEST在BFCL V3和WildToolBench上均显著优于传统的强化学习和蒸馏基线,尤其在长轨迹任务中,性能提升幅度达到20%以上,验证了其在多轮代理训练中的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化工具和复杂决策系统等。通过优化多轮交互的信用分配,CrEST框架能够提升这些系统在实际应用中的表现,推动智能代理在更复杂环境中的应用与发展。

📄 摘要(原文)

Reinforcement learning with verifiable rewards (RLVR) offers a verifier-bounded performance ceiling for training multi-turn tool-use agents, yet its trajectory-level credit assignment conflates heterogeneous per-turn outcomes into a single reward signal. On-policy distillation provides dense per-token supervision but is either teacher-bounded or prone to gradient concentration collapse. We introduce $\textbf{CrEST}$, a hierarchical credit assignment framework that retains RL's verifier-bounded ceiling while incorporating dense token-level signals from a privileged self-teacher. $\textbf{CrEST}$ resolves credit at two levels: turn-segmented verified advantages address inter-turn dilution, while entropy-gated self-teacher modulation refines intra-turn token contributions. Experiments on BFCL V3 and WildToolBench show that $\textbf{CrEST}$ consistently outperforms both RL and distillation baselines across two model scales, with the largest gains on long-trajectory and strict session-level metrics. Our work demonstrates that the teacher's role in policy optimization can be reduced from determining update directions to modulating update magnitudes, unlocking dense credit assignment without sacrificing the verifier-bounded ceiling.