Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

📄 arXiv: 2609.03941v1 📥 PDF

作者: Hyun Bin Park, Du-Seong Chang

分类: cs.LG, cs.AI, cs.CL

发布日期: 2026-09-03

备注: 51 pages, 25 figures, 17 tables. Accepted at COLM 2026


💡 一句话要点

提出Headroom-Drift Replay以解决GRPO中的重放控制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 重放控制 推理模型 Agentic Search 效率提升 策略兼容性 群体级重放 后训练

📋 核心要点

  1. 现有的重放方法通常嵌入在复杂的训练管道中,难以单独评估其贡献,导致效率低下。
  2. 本文提出Headroom-Drift Replay,通过将重用过程分为学习价值排名和兼容性筛选,简化了重放控制。
  3. 在多个基准测试中,该方法在性能上超越了简单重放,并在Agentic Search中显著降低了时间成本。

📝 摘要(中文)

基于强化学习的推理模型后训练越来越受到重复生成新回合的瓶颈限制,尤其是在环境交互主导时间成本的代理设置中。重放可以通过重用过去的轨迹来减轻这一负担,但现有方法通常将其嵌入更大的训练管道中,使得重放的贡献难以独立评估。本文提出了Headroom-Drift Replay,这是一种针对GRPO的群体级重放控制原语,将重用分为两个决策:Headroom根据剩余学习价值对存储的组进行排名,而Drift则根据与当前策略的兼容性对其进行筛选。该方法在多个基准测试中表现优异,尤其在Agentic Search中,提供了相似质量但显著降低了时间成本。

🔬 方法详解

问题定义:本文旨在解决在强化学习后训练中,重放机制的效率问题。现有方法往往复杂且难以评估重放的独立贡献,导致资源浪费。

核心思路:提出Headroom-Drift Replay,通过将重放过程分为两个决策:Headroom用于评估存储组的学习价值,Drift用于筛选与当前策略的兼容性,从而实现高效的重放控制。

技术框架:该方法的整体架构包括两个主要模块:Headroom模块负责对存储的轨迹组进行排名,Drift模块则根据当前策略的兼容性进行筛选。新生成的策略流保持不变,避免了额外的生成或训练过程。

关键创新:该方法的创新在于将重放控制简化为两个独立的决策过程,使得重放的贡献可以被清晰地评估,并且不依赖于复杂的训练管道。

关键设计:在设计中,Headroom模块使用剩余学习价值作为排名标准,而Drift模块则通过计算与当前策略的兼容性来进行筛选,确保重放的有效性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个基准测试中,Headroom-Drift Replay方法在Avg Mean@32指标上超越了简单重放,并与更复杂的重放方法相当。在Agentic Search中,该方法在显著降低时间成本的同时,保持了相似的质量,展示了其在高效重放控制中的优势。

🎯 应用场景

该研究的潜在应用领域包括智能代理、自动化决策系统和复杂环境中的实时推理。通过提高重放控制的效率,可以显著降低训练成本,提升模型在动态环境中的适应能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

RL-based post-training for reasoning models is increasingly bottlenecked by repeated fresh rollout generation, particularly in agentic settings where environment interaction dominates wall-clock cost. Replay can reduce this burden by reusing past trajectories, but existing methods typically embed it within larger training pipelines involving exploration, experience restructuring, or mixed-policy optimization. This makes replay's own contribution difficult to isolate. We ask a focused question: how far can principled replay selection alone go? We introduce Headroom-Drift Replay, a group-level replay control primitive for GRPO that separates reuse into two decisions. Headroom ranks stored groups by remaining learning value, while Drift gates them by compatibility with the current policy. The fresh on-policy stream remains unchanged, and the method adds no auxiliary generation or training machinery. Across mathematical reasoning, multimodal reasoning, and Agentic Search benchmarks, this single intervention outperforms naive replay and matches or exceeds broader replay methods on Avg Mean@32. In Agentic Search, where environment interaction dominates cost, it delivers comparable quality at materially lower wall-clock time.