SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning

📄 arXiv: 2607.26417v1 📥 PDF

作者: Siddharth Aphale, Ayushman Singh

分类: cs.LG

发布日期: 2026-07-29


💡 一句话要点

提出SCOUT以解决稀疏奖励强化学习中的重置课程问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 稀疏奖励 强化学习 重置课程 动态调整 机器人导航 操作任务 学习效率

📋 核心要点

  1. 现有稀疏奖励强化学习方法在不同任务上下文中学习速率不一致,导致辅助移除策略失效。
  2. SCOUT通过为每个上下文提供独立的重置课程,动态调整辅助的提供与移除,提升学习效率。
  3. 在六个实验设置中,SCOUT显著提高了学习成功率,并在多个情况下解决了未辅助训练的失败问题。

📝 摘要(中文)

稀疏奖励强化学习常常因为未辅助评估的回合难以达到任务后期阶段而失败。重置课程通过从较简单的中间状态开始训练回合来解决这一问题。现有方法通常使用统一的时间表来移除辅助,但在任务实例学习速率不同的情况下,这种方法可能失效。本文提出SCOUT,一个在线的、与学习者无关的重置控制器,为每个上下文提供独立的课程。SCOUT仅依赖二元回合成功信息,在持续成功后移除辅助,在失败后恢复辅助,并在进展停滞时谨慎测试更难的起始状态。实验结果表明,SCOUT在六个导航和操作设置中显著改善了学习效果,并在三种情况下成功解决了未辅助训练失败的问题。

🔬 方法详解

问题定义:本文解决的是稀疏奖励强化学习中,未辅助评估的回合难以达到任务后期阶段的问题。现有方法通常使用统一的时间表来移除辅助,但在不同上下文学习速率不一致时,这种方法可能导致学习失败。

核心思路:SCOUT的核心思路是为每个上下文提供独立的重置课程,允许根据每个上下文的学习进度动态调整辅助的提供与移除。这种设计旨在提高学习效率,确保不同上下文能够获得适当的辅助支持。

技术框架:SCOUT的整体架构包括三个主要模块:1) 评估模块,通过二元成功信息判断回合的成功与失败;2) 重置控制模块,根据学习进度动态调整辅助;3) 试探模块,在进展停滞时测试更难的起始状态。

关键创新:SCOUT的主要创新在于其在线、学习者无关的重置控制策略,使得每个上下文能够独立地获得适合其学习进度的辅助。这与现有方法的统一时间表形成鲜明对比,能够有效解决不同上下文对辅助需求的冲突。

关键设计:SCOUT使用二元成功信息来判断何时移除或恢复辅助,并在进展停滞时谨慎选择更难的起始状态。该方法不依赖于任何特定的奖励结构、优化器或学习者,确保了其广泛适用性。具体参数设置和损失函数设计在实验中进行了详细验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SCOUT在六个导航和操作设置中,成功率显著提高,尤其在三种情况下成功解决了未辅助训练的失败问题。与传统方法相比,SCOUT在处理学习速率不一致的上下文时表现出色,能够同时解决多个任务,而传统方法则未能解决其中的一个任务。

🎯 应用场景

SCOUT在稀疏奖励强化学习中的应用潜力巨大,尤其适用于需要动态调整学习策略的复杂任务场景,如机器人导航、操作任务和游戏AI等。通过提供个性化的学习辅助,SCOUT能够显著提升学习效率和成功率,未来可在更广泛的领域中推广应用。

📄 摘要(原文)

Sparse-reward reinforcement learning often fails because rollouts from the unassisted evaluation start rarely reach later task stages. Reset curricula address this by starting some training rollouts from easier intermediate states, called scaffolds. Such a curriculum faces two decisions: scaffold access, obtaining informative starts, and scaffold allocation, deciding how quickly that assistance is removed. Most prior curricula pace removal on one shared schedule, which can fail when task instances, or contexts, learn at different rates. We introduce SCOUT, an online, learner-agnostic reset controller that gives every context its own curriculum. Using only binary rollout success, SCOUT removes assistance after sustained success, restores it after failure, and cautiously tests a harder start when progress stalls, without changing the reward, optimizer, or learner. A counting construction shows that synchronized global pacing can be insufficient when contexts need conflicting amounts of assisted practice. Across six navigation and manipulation settings, scaffold access improves learning and enables success in three where unassisted training fails within the reported budget. In a constructed pacing conflict, each tested global schedule leaves one group unsolved, while SCOUT solves both. Average success can conceal this failure, so we also report the least successful group. Group-level pacing works when learning differences follow known groups but can fail when they occur within one group. SCOUT needs no group labels and remains consistently strong in both cases. A reset curriculum should remove assistance at the scale where learning progress differs.