REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation

📄 arXiv: 2608.11698v1 📥 PDF

作者: Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan

分类: cs.LG, cs.AI

发布日期: 2026-08-12


💡 一句话要点

提出REOPD以解决OPD中的奖励不稳定问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 在线策略蒸馏 奖励外推 动态调整 强化学习 教师模型

📋 核心要点

  1. 现有的奖励外推方法在处理奖励不稳定性时存在不足,容易导致学生模型过度拟合极端奖励。
  2. REOPD通过引入标记级兼容性权重和批次级自适应预算,设计了一个动态调整的奖励外推机制。
  3. 实验结果显示,REOPD在多个任务上超越了现有方法,验证了其在不同教师配置下的有效性。

📝 摘要(中文)

在现有的在线策略蒸馏(OPD)方法中,奖励外推技术如ExOPD使用单一全局系数λ来处理所有标记,这可能导致学生模型过度拟合奖励的极端峰值,从而引发奖励黑客行为和训练不稳定。为了解决这一问题,本文提出了REOPD,一个可靠性自适应奖励外推框架。REOPD结合了标记级兼容性权重和批次级自适应预算,生成了一个令教师对齐的标记级系数λ_{b,t}=1+γ_b q_t,能够在可靠的教师参考方向上进行选择性外推。实验结果表明,REOPD在单教师数学任务上优于G-OPD,并在多教师设置中也表现出色,同时在单教师代码任务上与G-OPD持平,展示了跨领域和教师配置的有效细粒度可靠性适应。

🔬 方法详解

问题定义:本文旨在解决在线策略蒸馏(OPD)中奖励不稳定性的问题。现有方法如ExOPD使用单一全局系数λ,导致学生模型可能过度拟合极端奖励,从而引发训练不稳定和奖励黑客行为。

核心思路:REOPD的核心思路是结合标记级兼容性权重与批次级自适应预算,生成动态的标记级系数λ_{b,t}=1+γ_b q_t。这种设计能够在保持教师对齐的同时,选择性地沿可靠的教师参考方向进行外推。

技术框架:REOPD的整体架构包括三个主要模块:标记级兼容性权重计算、批次级自适应预算分配和奖励外推执行。通过这些模块,REOPD能够有效地调整奖励外推策略。

关键创新:REOPD的关键创新在于其动态调整的奖励外推机制,与传统方法的静态全局系数λ相比,能够更好地适应不同任务和教师配置的需求。

关键设计:在REOPD中,参数γ_b用于控制自适应预算的分配,损失函数设计考虑了教师模型的对齐性,确保学生模型在训练过程中能够有效学习。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在实验中,REOPD在单教师数学任务上超越了G-OPD,且在多教师设置中表现优异,验证了其在不同任务中的有效性。在单教师代码任务上,REOPD与G-OPD的性能相当,展示了其广泛适用性。

🎯 应用场景

REOPD的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高效学习和稳定训练的强化学习任务中。其自适应奖励外推机制可以被应用于机器人控制、游戏智能体训练以及其他需要策略蒸馏的场景,提升模型的学习效率和稳定性。

📄 摘要(原文)

On-policy distillation (OPD) trains a student on its own trajectories under dense token-level supervision from a teacher. Reward-extrapolation methods such as ExOPD amplify the teacher-reference log-likelihood ratio to move beyond direct imitation, but apply a single global coefficient $λ$ to every token. This can drive the student to fit extreme peaks in the implicit reward, causing reward hacking and unstable training, and the optimal $λ$ varies across domains, requiring costly sweeps. We propose REOPD, a reliability-adaptive reward extrapolation framework for OPD. REOPD combines a token-level compatibility weight with a batch-level adaptive budget, yielding a token-wise coefficient $λ_{b,t}=1+γ_b q_t$ that preserves teacher alignment while selectively extrapolating along reliable teacher-reference directions. It requires no verifier, reward model, value model, or extra rollout beyond standard OPD. REOPD outperforms G-OPD on single-teacher mathematics and on both domains in the multi-teacher setting, while matching G-OPD on single-teacher code, demonstrating effective fine-grained reliability adaptation across domains and teacher configurations.