PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs
作者: Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang
分类: cs.LG
发布日期: 2026-08-31
备注: Accepted at EMNLP 2026 (Main)
💡 一句话要点
提出PAC以优化多任务强化学习中的任务分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 多任务学习 大规模语言模型 动态任务分配 课程学习 贝叶斯优化 推理能力提升
📋 核心要点
- 现有的强化学习后训练方法通常依赖于固定的任务组合,未能动态调整任务分配,导致资源浪费。
- PAC通过结合优势导向的可学习性和实际奖励增益,动态调整任务的训练资源分配,提高了训练效率。
- 实验结果显示,PAC在多层次和多领域推理任务中,样本效率和最终性能均优于随机采样和优势基础的课程基线。
📝 摘要(中文)
本论文提出了一种名为PAC(Progress-Augmented Advantage Curriculum)的新方法,旨在通过强化学习(RL)提升大规模语言模型(LLMs)的推理能力。现有的RL后训练流程通常依赖于固定或手动设计的任务组合,未能考虑任务的有效性随训练进展而变化。PAC结合了两种任务级信号:优势导向的可学习性和近期的奖励增益,以更有效地分配训练资源。实验结果表明,PAC在多层次推理和多领域推理设置下,样本效率和最终性能均有所提升,验证了其有效性。
🔬 方法详解
问题定义:本论文旨在解决现有多任务强化学习中任务分配不合理的问题,尤其是固定任务组合导致的训练资源浪费。现有方法未能考虑任务有效性随训练进展的变化,导致更新幅度大但无效的任务占用过多资源。
核心思路:PAC的核心思路是结合优势导向的可学习性和近期奖励增益,动态评估任务的学习潜力和实际表现,从而优化训练资源的分配。通过这种方式,PAC能够更有效地引导模型学习,提高训练效率。
技术框架:PAC的整体架构包括两个主要模块:优势导向的可学习性评估模块和奖励增益监测模块。前者用于评估每个任务的学习潜力,后者则监测任务的实际表现。基于这两个信号,使用贝叶斯汤普森采样控制器在训练过程中动态分配训练资源。
关键创新:PAC的主要创新在于同时跟踪优势信号和实际奖励增益,这一方法与传统的固定任务组合或单一信号评估方法有本质区别,能够更精准地分配训练资源。
关键设计:在PAC中,优势导向的可学习性通过政策更新的幅度来衡量,而奖励增益则通过任务的实际表现来评估。关键参数设置包括贝叶斯控制器的超参数,以及任务更新频率的动态调整策略。
🖼️ 关键图片
📊 实验亮点
实验结果表明,PAC在多层次推理和多领域推理设置下,样本效率显著提高,使用更少的训练步骤即可达到与基线相当的验证分数,最终平均性能也高于随机采样和优势基础的课程基线,验证了其有效性。
🎯 应用场景
PAC的研究成果在多任务学习、自然语言处理和智能系统等领域具有广泛的应用潜力。通过优化任务分配,PAC能够提升大规模语言模型在复杂推理任务中的表现,进而推动智能助手、对话系统等实际应用的发展,提升用户体验和系统效率。
📄 摘要(原文)
Reinforcement learning (RL) is used to improve the reasoning abilities of LLMs, while training data span heterogeneous tasks. However, most RL post-training pipelines rely on fixed or manually designed task mixtures, even though task usefulness changes as training progresses. Online curriculum methods often define learnability by update magnitude, ignoring whether the update translates into reward gains, which can misallocate rollout budget toward tasks with large but ineffective updates. We propose PAC, a Progress-Augmented Advantage Curriculum for multi-task RL of LLMs that combines two task-level signals: advantage-derived learnability, which measures the magnitude of the policy update a task can induce, and recent reward gains, which show whether those updates have improved task performance. A Bayesian Thompson Sampling controller uses these signals to allocate rollouts across tasks during GRPO training. We evaluate PAC under two settings: a multi-level reasoning setting and a multi-domain reasoning setting. PAC improves sample efficiency and final performance: it reaches comparable validation scores with fewer rollout steps and achieves higher final averages than random sampling and advantage-based curriculum baselines in both settings. These results show that jointly tracking advantage signals and actual reward gains yields an effective online curriculum for LLM post-training.