TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling
作者: Yanyu Ren, Xizheng Wang, Xiao Liu, Bowen Lv, Hanchen Zhang, Shudan Zhang, Hanyu Lai, Shuai Wang, Li Chen, Dan Li, Jie Tang
分类: cs.LG, cs.DC
发布日期: 2026-08-11
💡 一句话要点
提出TideRL以提升多轮强化学习的训练效率
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 多轮对话 任务调度 资源优化 训练效率 模型迭代
📋 核心要点
- 现有的强化学习方法在多轮代理工作负载中面临训练效率低下的问题,GPU等待和重复预填充计算造成了显著的开销。
- TideRL通过准备感知调度,结合连续任务批处理、资源感知流水线和弹性资源扩展,优化了训练过程中的资源使用和任务调度。
- 实验结果显示,TideRL在多种工作负载下显著提升了训练良好产出,减少了训练时间和等待时间,表现出色。
📝 摘要(中文)
随着强化学习(RL)在大型语言模型中的应用逐渐向多轮代理工作负载转变,任务在外部环境中反复暂停、恢复并以高度可变的时间完成。在这种情况下,RL训练的良好产出(goodput),即训练吞吐量,比单纯的GPU占用率更为重要。本文提出了TideRL,一个具备准备感知调度的弹性RL系统,采用了连续任务批处理、资源感知Ref-Actor流水线和弹性资源扩展等技术。实验结果表明,TideRL在文本和多模态代理工作负载中,训练良好产出比同步基线提升了5.6倍,比异步基线提升超过33%,同时保持了相似的任务性能。它还提高了KV缓存命中率1.58倍,减少每步训练时间最多44.3%,并将总等待时间减少最多77.6%。
🔬 方法详解
问题定义:本文旨在解决多轮代理工作负载中强化学习训练效率低下的问题,现有方法在GPU等待和重复计算上存在显著的资源浪费。
核心思路:TideRL通过准备感知调度优化任务调度和资源使用,采用连续任务批处理和资源感知流水线,旨在提高训练良好产出。
技术框架:TideRL的整体架构包括三个主要模块:连续任务批处理(CTB)、资源感知Ref-Actor流水线(RA²P)和弹性资源扩展(ERS)。CTB负责保存有用的任务状态,RA²P根据准备情况选择流式处理或聚合,而ERS则利用相同的准备信号在任务和训练之间动态调整资源分配。
关键创新:TideRL的核心创新在于其准备感知调度机制,能够有效减少GPU等待时间和计算开销,与现有同步和异步方法相比,显著提升了训练效率。
关键设计:在设计中,CTB确保了任务状态的有效保存,RA²P通过解耦流式处理和聚合来优化资源使用,ERS则根据任务准备情况动态调整资源分配,确保训练过程的高效性。
🖼️ 关键图片
📊 实验亮点
TideRL在文本和多模态代理工作负载中,训练良好产出比同步基线提升了5.6倍,比异步基线提升超过33%。此外,KV缓存命中率提高了1.58倍,训练时间减少最多44.3%,总等待时间减少最多77.6%。
🎯 应用场景
TideRL的研究成果在多轮对话系统、智能助手和其他需要高效强化学习的应用场景中具有广泛的潜在应用价值。通过提升训练效率,能够加速模型的迭代与优化,推动智能系统的实际应用和发展。
📄 摘要(原文)
Reinforcement learning (RL) for large language models is moving toward multi-turn agentic workloads, where rollout tasks repeatedly pause for external environments, resume with growing contexts, and finish at highly variable times. In this setting, RL training goodput, measured by training throughput, matters more than raw GPU occupancy: GPU waiting and repeated prefill recomputation are pure overhead. We present TideRL, a readiness-aware elastic RL system with Continuous Task Batching, Resource-Aware Ref-Actor Pipelining, and Elastic Resource Scaling. CTB preserves useful rollout state, $\textrm{RA}^2\textrm{P}$ selects between decoupled streaming and colocated aggregation from the ready backlog and arrival interval, and ERS moves ranks between rollout and training using the same readiness signals. Across text-only and multi-modal agentic workloads, TideRL improves RL training goodput by up to 5.6$\times$ over synchronous baselines and over 33% over asynchronous baselines, while reaching similar task performance. It also improves KV cache hit rate by 1.58$\times$, reduces per-step training time by up to 44.3%, and cuts total waiting time by up to 77.6%.