PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

📄 arXiv: 2608.17289v1 📥 PDF

作者: Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

分类: cs.AI

发布日期: 2026-08-18


💡 一句话要点

提出PlanPO以解决多轮交互任务中的策略优化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 策略优化 多轮交互 强化学习 大型语言模型 规划能力

📋 核心要点

  1. 现有的策略优化方法未能有效区分成功轨迹的效率,导致性能瓶颈和优势崩溃。
  2. 本文提出PlanPO,通过引入粗到细的优势信号,增强模型的规划能力,避免简单的长度最小化。
  3. 实验结果显示,PlanPO在多个基准测试上平均提升27.2%,超越了现有强基线,且训练成本几乎不增加。

📝 摘要(中文)

群体相对策略优化已成为训练多轮交互任务中智能大型语言模型(LLMs)的关键范式。然而,现有方法往往无法有效区分成功轨迹之间的优势,导致优势崩溃和性能瓶颈。为此,本文提出了一种简单而有效的强化学习方法——群体规划感知策略优化(PlanPO),旨在学习超越任务特定高质量行为模式的可泛化规划能力。PlanPO引入了粗到细的优势信号,捕捉成功轨迹在轨迹级和回合级响应长度上的相对差异。实验表明,PlanPO在多轮基准测试ALFWorld、WebShop和SciWorld上平均提升了27.2%,且额外训练成本微乎其微。

🔬 方法详解

问题定义:本文旨在解决多轮交互任务中,现有策略优化方法未能有效区分成功轨迹的效率问题,导致优势崩溃和性能瓶颈。

核心思路:PlanPO通过引入粗到细的优势信号,捕捉成功轨迹的相对差异,从而增强模型的规划能力,避免简单的长度最小化。

技术框架:PlanPO的整体架构包括轨迹采样、优势信号计算和策略更新三个主要模块。首先,从成功轨迹中采样,然后计算轨迹长度和响应长度的优势信号,最后进行策略优化。

关键创新:PlanPO的核心创新在于引入了粗到细的优势信号,这一设计使得模型能够在多轮交互中学习到更为复杂和有效的行为模式,与现有方法相比,显著提升了策略优化的效果。

关键设计:在损失函数设计上,PlanPO结合了轨迹长度和响应长度的优势信号,确保模型在优化过程中关注交互效率而非单纯的长度最小化。同时,模型结构保持简洁,便于实现和扩展。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PlanPO在ALFWorld、WebShop和SciWorld等多轮基准测试上平均提升了27.2%,显著超越了现有强基线,且额外训练成本几乎可以忽略不计,展示了其高效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括智能客服、虚拟助手和游戏AI等多轮交互场景。通过提升模型的规划能力,PlanPO能够在复杂的交互任务中实现更高效的响应生成,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successes are often assigned the identical outcome reward, causing advantage collapse and severe performance bottlenecks. To this end, we propose Group Planning-aware Policy Optimization (PlanPO), a simple yet effective RL method for learning generalizable planning abilities beyond task-specific high-quality behavior patterns. Specifically, PlanPO introduces coarse-to-fine advantage signals, which capture the relative differences in trajectory-level lengths and turn-level response lengths conditioned on successful trajectories sampled for the same task. Within the group-relative optimization structure, this enables agents to actively learn generalizable and deliberate behaviors spanning interaction planning and textual generation from high-quality rollouts, without degenerating into vanilla length minimization. Experimentally, PlanPO improves over GRPO by 27.2\% on average across the challenging multi-turn benchmarks ALFWorld, WebShop, and SciWorld, outperforming recent powerful baselines while incurring negligible additional training cost.