Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

📄 arXiv: 2608.17423v1 📥 PDF

作者: Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

分类: cs.RO, cs.LG

发布日期: 2026-08-18


💡 一句话要点

提出Prism-GRPO以解决VLA策略优化中的采样效率问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 视觉-语言-动作 策略优化 机器人控制 质量评分

📋 核心要点

  1. 现有的GRPO方法在强化学习中面临采样效率低下的问题,尤其是在早期训练阶段,许多回放失败导致大量资源浪费。
  2. 论文提出的Prism-GRPO通过引入质量评分,将相同结果的组划分为不同质量层次,从而恢复训练信号并提高采样效率。
  3. 实验结果显示,Prism-GRPO在四个不同的RoboTwin任务中,成功率和质量显著提升,且在达到目标成功率时,回放次数减少了56%。

📝 摘要(中文)

GRPO在视觉-语言-动作(VLA)策略的强化学习中越来越受到青睐,因为与PPO不同,它不需要训练评论员。然而,这种简化带来了采样成本:组相对优势需要从每个场景进行多次回放。在二元成功奖励下,所有回放成功或失败的组具有零优势,因而被动态采样丢弃。Prism-GRPO通过引入加权轨迹级执行质量评分,解决了这一问题。通过将相同结果的组划分为质量谱,Prism-GRPO恢复了训练信号,并确保每个成功仍然优于每个失败。实验证明,Prism-GRPO在四个RoboTwin任务中提高了成功率和质量,在相同的回放预算下,最多减少56%的回放次数。

🔬 方法详解

问题定义:论文要解决的问题是GRPO在强化学习中的采样效率低下,尤其是在早期训练阶段,许多回放失败导致大量资源浪费。现有方法在处理二元成功奖励时,容易丢弃所有成功或失败的组,从而损失训练信号。

核心思路:论文的核心解决思路是引入加权轨迹级执行质量评分,通过将相同结果的组划分为质量谱,恢复训练信号,同时确保成功的组优于失败的组。这种设计旨在提高采样效率,减少资源浪费。

技术框架:整体架构包括三个主要模块:首先是轨迹收集模块,收集不同场景的回放数据;其次是质量评分模块,根据执行质量对轨迹进行评分;最后是策略更新模块,基于评分结果进行策略优化。

关键创新:最重要的技术创新点在于引入了质量评分机制,使得相同结果的组能够根据质量进行区分,从而避免了动态采样中因零优势而丢弃组的情况。这与现有方法的本质区别在于,Prism-GRPO能够有效利用所有回放数据。

关键设计:在关键设计上,论文详细描述了质量评分的计算方法,可以基于模拟器接触、执行动作或视觉观察来获得,避免了任务特定的进展奖励。此外,论文还推导了梯度对齐条件,确保组合更新仍然是任务成功的局部上升方向。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Prism-GRPO在四个RoboTwin任务中,成功率和质量显著提升,且在相同的回放预算下,最多减少56%的回放次数。此外,该方法有效抑制了奖励黑客的现象,确保了更清晰的行为表现,能够直接迁移到真实机器人上。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶和人机交互等场景。通过提高VLA策略的训练效率,Prism-GRPO能够在实际部署中减少资源消耗,提升机器人在复杂环境中的适应能力和任务执行质量,具有重要的实际价值和未来影响。

📄 摘要(原文)

GRPO is increasingly used for reinforcement learning of vision-language-action (VLA) policies because, unlike PPO, it does not require training a critic. This simplification comes with a sampling cost: group-relative advantages require multiple rollouts from each scene. Under binary success rewards, groups whose rollouts all succeed or all fail have zero advantage and are discarded by dynamic sampling. These groups are especially common early in training, when most rollouts fail, wasting much of the expensive robotic rollout budget. We introduce Prism-GRPO, which augments binary outcome reward with a weighted trajectory-level execution-quality score. By splitting same-outcome groups into a quality spectrum, Prism-GRPO recovers training signal while ensuring that every success still outranks every failure. Quality scores can be derived from simulator contacts, executed actions, or visual observations, avoiding task-specific progress rewards. We prove that Prism-GRPO never increases the probability that a sampled group is discarded for having zero advantages, and derive a gradient-alignment condition under which its combined update remains a local ascent direction for task success. Across four RoboTwin tasks spanning different horizons and coordination patterns, Prism-GRPO improves success and quality at matched rollout budgets and reaches target success rates with up to 56% fewer rollouts. It also suppresses a reward-hacking shortcut, with the cleaner behavior transferring under direct deployment to a real robot. Through ablations, we show consistent gains across contact-, smoothness-, and VLM-derived quality signals.