Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

📄 arXiv: 2608.13026v1 📥 PDF

作者: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

分类: cs.RO

发布日期: 2026-08-13


💡 一句话要点

提出Temporal GRPO以解决轨迹级信用混淆问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 视觉-语言-动作 轨迹级信用 任务阶段 样本效率 机器人控制 智能系统

📋 核心要点

  1. 现有的GRPO方法在处理轨迹级信用时存在问题,导致早期成功的动作因后期失败而受到惩罚。
  2. Temporal GRPO通过构建任务阶段并对齐回合与阶段特定的动作区间,解决了轨迹级信用混淆的问题。
  3. 在RoboTwin 2.0上,Temporal GRPO显著提高了任务成功率和样本效率,且在不同任务时间范围内均有提升。

📝 摘要(中文)

基于结果驱动的强化学习为从稀疏的任务成功反馈中后训练视觉-语言-动作(VLA)策略提供了一种可扩展的方法。在常见的基于GRPO的VLA后训练中,轨迹中的每个动作都应用了相同的回合级优势。这导致了轨迹级信用混淆的问题,即一个回合虽然在早期阶段取得了进展,但后期失败却惩罚了早期的成功。Temporal GRPO通过构建可检测的任务阶段,将每个回合与特定阶段的动作区间对齐,仅比较进入相同阶段的回合,从而解决了这一问题。实验表明,Temporal GRPO在RoboTwin 2.0上提高了任务成功率和样本效率,并在不同任务时间范围内均表现出一致的提升。

🔬 方法详解

问题定义:论文要解决的问题是轨迹级信用混淆,即在强化学习中,早期成功的动作因后期失败而受到不当惩罚,影响学习效果。现有的GRPO方法未能有效处理这一问题,导致学习效率低下。

核心思路:Temporal GRPO的核心思路是通过构建可检测的任务阶段,将每个回合的动作与特定阶段对齐,从而仅比较进入相同阶段的回合。这种设计旨在消除轨迹级信用混淆,使得每个动作的信用评估更加准确。

技术框架:整体架构包括任务阶段的构建、回合与阶段动作区间的对齐、以及基于阶段优势的策略更新。主要模块包括阶段检测模块、动作对齐模块和策略更新模块。

关键创新:最重要的技术创新点在于引入了阶段特定的优势评估机制,避免了传统方法中轨迹级信用混淆的问题。这一机制使得每个动作的信用评估更加精准,提升了学习效率。

关键设计:在关键设计上,Temporal GRPO采用了阶段检测算法来识别任务的不同阶段,并通过对齐机制确保每个回合的动作与其对应阶段的优势相匹配。此外,损失函数的设计也考虑了阶段特定的优势,以优化策略更新过程。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在RoboTwin 2.0的实验中,Temporal GRPO显著提高了任务成功率和样本效率,具体表现为在不同任务时间范围内均有一致的性能提升,展示了相较于传统GRPO方法的优势。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能助手等需要结合视觉、语言和动作的复杂任务。通过提高强化学习的样本效率和任务成功率,Temporal GRPO能够在实际应用中更快地适应新环境,提升系统的智能化水平。

📄 摘要(原文)

Outcome-driven reinforcement learning offers a scalable way to post-train vision-language-action (VLA) policies from sparse task-success feedback. In common GRPO-based VLA post-training, one rollout-level advantage is applied to every action in the trajectory. A rollout that completes several valid stages but fails later can therefore penalize the actions that produced its earlier progress. We call this trajectory-level credit aliasing. Temporal GRPO addresses this problem by constructing detectable task stages, aligning each rollout with stage-specific action intervals, and comparing only rollouts that have entered the same stage. The resulting stage advantages are applied to their corresponding intervals in a single policy update. On RoboTwin 2.0, Temporal GRPO improves task success and sample efficiency, with consistent gains across task horizons. Controlled updates on LIBERO-Long preserve shared prerequisite stages and concentrate improvement at the first stage where rollout outcomes diverge.