SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

📄 arXiv: 2608.19842v1 📥 PDF

作者: Dayang Liang, Lang Feng, Bo An, Yunlong Liu

分类: cs.AI

发布日期: 2026-08-20


💡 一句话要点

提出SAPO以解决长时间交互任务中的策略优化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 代理强化学习 自回归模型 策略优化 长时间任务 内存效率 价值估计 SARSA PPO

📋 核心要点

  1. 现有的无评论强化学习方法在长时间复杂任务中存在优势崩溃和价值泛化不足的问题。
  2. 本文提出的SAPO框架通过共享自回归骨干网络,优化策略和价值函数,降低内存和计算开销。
  3. 实验结果表明,SAPO在多个任务上表现优异,显著提高了训练稳定性和效率。

📝 摘要(中文)

代理强化学习(RL)在大型语言模型的后训练阶段变得至关重要。现有的无评论、群体相对方法通过多个回合估计策略优势,避免了传统近端策略优化(PPO)的高内存开销,并在长时间交互任务中表现出色。然而,近期研究揭示了三大局限性:缺乏明确的价值泛化和有效的时间信用分配;在复杂的长时间任务中可能出现优势崩溃;在采样预算与策略性能之间需要昂贵的权衡。为此,本文提出了单回合自回归策略优化(SAPO),这是一个低内存和计算高效的框架,策略和价值函数共享一个自回归骨干网络。SAPO利用大型语言模型的自回归结构,在不同的因果边界生成策略和价值预测,同时独立优化PPO目标和辅助的在线SARSA目标。通过引入轨迹级广义优势估计器,结合lambda回报和批归一化,稳健地估计每个回合的贡献。实验结果显示,SAPO在ALFWorld和WebShop上稳定训练,分别比PPO和GRPO提高了15.1和12.1个百分点,同时消除了单独评论模型的内存成本,并将每次迭代的运行时间减少了33.2%。

🔬 方法详解

问题定义:本文旨在解决现有代理强化学习方法在长时间复杂任务中存在的优势崩溃、价值泛化不足和高内存开销等问题。

核心思路:SAPO通过共享自回归骨干网络来同时生成策略和价值预测,独立优化PPO和SARSA目标,从而提高了计算效率和内存使用率。

技术框架:SAPO的整体架构包括一个自回归骨干网络,负责生成策略和价值预测,并引入轨迹级广义优势估计器来优化每个回合的贡献。

关键创新:SAPO的主要创新在于利用自回归结构共享参数,解决了传统方法在长时间任务中的优势崩溃问题,并消除了对单独评论模型的需求。

关键设计:在设计中,SAPO采用了lambda回报与批归一化相结合的轨迹级广义优势估计器,以提高估计的稳健性和准确性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,SAPO在ALFWorld和WebShop任务上训练稳定,分别比PPO和GRPO提高了15.1和12.1个百分点。此外,SAPO还成功消除了单独评论模型的内存成本,并将每次迭代的运行时间减少了33.2%,显示出其在效率和性能上的显著优势。

🎯 应用场景

该研究的潜在应用领域包括智能对话系统、自动化决策支持和复杂任务的机器人控制等。通过提高策略优化的效率和稳定性,SAPO能够在实际应用中显著提升系统的响应能力和决策质量,推动智能体在动态环境中的表现。未来,SAPO有望在更广泛的强化学习任务中得到应用,进一步推动智能体技术的发展。

📄 摘要(原文)

Agentic reinforcement learning (RL) has become a critical stage in the post-training of large language models. Existing critic-free, group-relative methods estimate policy advantages from multiple rollouts, avoiding the substantial memory overhead of conventional proximal policy optimization (PPO) and achieving strong performance on long-horizon interactive tasks. Despite their success, recent studies revealed three limitations: (1) Lack explicit value generalization and effective temporal credit assignment; (2) Suffer from potential advantage collapse in long-horizon complex tasks; (3) Require a costly trade-off between sampling budget and policy performance. In this work, we propose Single-rollout Autoregressive Policy Optimization (SAPO), a low-memory and compute-efficient framework in which the policy and value functions share a single autoregressive backbone. SAPO exploits the autoregressive structure of LLMs to produce policy and value predictions at distinct causal boundaries with shared parameters, while independently optimizing the PPO objectives and auxiliary on-policy SARSA objectives. To robustly estimate the contribution of each turn, we further introduce a trajectory-level generalized advantage estimator that combines lambda-returns with batch normalization. Experiments across ALFWorld and WebShop with Qwen2.5-1.5B/7B show that SAPO trains stably and outperforms PPO and GRPO by mean +15.1 and +12.1 percentage points, respectively, while eliminating the memory cost of a separate critic model and reducing per-iteration runtime by 33.2% over PPO.