I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization
作者: Yubo Zhang, Xinhong Ma, Zezhong Tan, Ziqiang Dong
分类: cs.LG, cs.CL
发布日期: 2026-08-13
备注: 14 pages, 3 figures
💡 一句话要点
提出I-SDPO以解决自蒸馏策略优化中的偏差问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自蒸馏 策略优化 强化学习 群体相对奖励 智能决策
📋 核心要点
- 现有的群体相对策略优化方法在所有采样响应均错误时缺乏有效的学习信号,导致学习效率低下。
- I-SDPO通过实例级自适应自蒸馏策略优化,依据能力依赖性动态调整教师模型的影响,优化学习过程。
- 在SciKnowEval数据集上,I-SDPO在四个科学领域均取得最佳结果,准确率显著提升,展示了其有效性。
📝 摘要(中文)
群体相对策略优化(GRPO)通过回滚组内的奖励差异进行学习,但在所有采样响应均错误时缺乏有效的相对信号。特权自蒸馏可以通过密集的标记监督填补这一空白,但在训练过程中应用可能导致教师模型成为偏差且低方差的奖励目标替代品,从而在策略能够生成成功轨迹后,持续模仿可能会对奖励改进更新产生负面影响。本文提出了I-SDPO(实例级自适应自蒸馏策略优化),根据能力依赖性处理教师模型的依赖性。I-SDPO为每个输入实例做出一次路由决策,并在该实例的回滚组中共享:所有错误组使用特权自蒸馏目标,而任何成功组则保持不变以进行GRPO。该设计仅在群体相对奖励信息不足时使用模仿。在SciKnowEval上,I-SDPO在所有四个科学领域中获得最佳结果,平均mean@16准确率从56.67%提升至70.31%,最大领域增益为18.24分。
🔬 方法详解
问题定义:本文旨在解决现有群体相对策略优化(GRPO)在所有采样响应错误时缺乏有效学习信号的问题。现有方法在这种情况下无法提供有用的反馈,导致学习效率低下。
核心思路:I-SDPO提出了一种实例级自适应自蒸馏策略优化方法,根据输入实例的能力动态调整教师模型的依赖性。在所有响应错误的情况下,使用特权自蒸馏目标,而在有成功响应的情况下,保持GRPO不变。
技术框架:I-SDPO的整体架构包括输入实例的路由决策模块和自蒸馏目标模块。路由决策模块根据实例的成功概率决定使用哪种学习策略,确保在信息不足时引入自蒸馏。
关键创新:I-SDPO的主要创新在于根据能力依赖性动态调整教师模型的影响,避免了持续模仿带来的优化偏差。这一设计使得在成功概率上升时,自动降低预期的蒸馏率。
关键设计:在参数设置上,I-SDPO引入了非消失的偏差蒸馏权重,以确保优化过程中的稳定性。此外,损失函数设计上结合了特权自蒸馏目标和群体相对奖励,确保在不同情况下的有效学习。
🖼️ 关键图片
📊 实验亮点
I-SDPO在SciKnowEval数据集上取得了显著的实验结果,所有四个科学领域的平均mean@16准确率从56.67%提升至70.31%,最大领域增益达到18.24分,展示了其在策略优化中的有效性。
🎯 应用场景
该研究的潜在应用领域包括强化学习、机器人控制和智能决策系统等。通过优化策略学习过程,I-SDPO能够在复杂环境中提高模型的学习效率和决策能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Group Relative Policy Optimization (GRPO) learns from reward differences within a rollout group, but receives no useful relative signal when every sampled response is incorrect. Privileged self-distillation can fill this gap with dense token supervision, yet applying it throughout training creates a different failure mode: the teacher is a biased, low-variance surrogate for the reward objective, so persistent imitation can oppose reward-improving updates after the policy becomes capable of producing successful trajectories. We introduce I-SDPO (Instance-Level Adaptive Self-Distillation Policy Optimization), which treats teacher reliance as capability-dependent. I-SDPO makes one routing decision per input instance and shares it across that instance's rollout group: all-incorrect groups use a privileged self-distillation objective, whereas any-success groups remain intact for GRPO. This design uses imitation only where group-relative rewards are uninformative. A local analysis characterizes when teacher and reward directions align and shows that a non-vanishing biased distillation weight induces an optimization bias floor. The routing rule automatically reduces the expected distillation rate as success probability rises, withdrawing teacher influence without a hand-designed schedule. On SciKnowEval, I-SDPO obtains the best result in all four scientific domains and improves average mean@16 accuracy from 56.67% with GRPO to 70.31%, with a maximum domain gain of 18.24 points.