DualOPSD: Adaptive Privileged Teachers for On-Policy Self-Distillation

📄 arXiv: 2608.26019v1 📥 PDF

作者: Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng Liu

分类: cs.LG, cs.AI

发布日期: 2026-08-26

备注: preprint


💡 一句话要点

提出DualOPSD以解决OPSD固定教师适应性不足问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 自蒸馏 特权教师 强化学习 模型适应性 知识传递 动态学习 计算机视觉 自然语言处理

📋 核心要点

  1. 现有的OPSD方法在训练过程中未能适应学生模型的分布变化,导致监督信息的有效性下降。
  2. DualOPSD通过不对称交替框架,使得特权教师能够根据学生模型的更新进行自适应调整,从而提高学习效率。
  3. 实验结果显示,DualOPSD在多个基准测试中显著提升了模型性能,尤其是在较大规模模型上表现更为突出。

📝 摘要(中文)

在政策自蒸馏(OPSD)中,使用学生模型的特权副本提供密集监督,但该特权教师在训练过程中保持固定,未能适应学生分布和输出风格的变化。本文提出DualOPSD,一种不对称交替框架,能够同时适应两个策略。学生首先从特权教师学习,然后教师在同一学生轨迹上向更新的学生分布移动。这种更新使得后续监督能够响应学习者的变化,而无需额外的回滚。在Qwen3-8B的非思考模式下,DualOPSD在AIME 2024、AIME 2025和HMMT 2025上分别比OPSD提高了23.61、13.89和10.00点。1.7B和4B的结果表明,准确性提升依赖于模型规模,所有三个规模下DualOPSD均减少了截断现象。4B的诊断结果也显示教师与学生之间的KL散度在两个方向上均较低。

🔬 方法详解

问题定义:现有的OPSD方法在训练过程中使用固定的特权教师,未能适应学生模型的分布变化,导致监督信息的有效性不足。

核心思路:DualOPSD提出了一种不对称交替框架,学生模型首先从特权教师学习,然后教师根据更新的学生分布进行调整。这种设计使得监督信息能够实时响应学生的变化,提升学习效果。

技术框架:DualOPSD的整体架构包括两个主要模块:学生模型和特权教师。学生模型在每个训练步骤中首先接收来自特权教师的指导,随后教师根据学生的更新分布进行自适应调整,形成一个循环学习过程。

关键创新:DualOPSD的核心创新在于其不对称交替学习机制,使得特权教师能够动态适应学生模型的变化,这与传统的固定教师方法形成了鲜明对比。

关键设计:在参数设置上,DualOPSD对教师和学生的学习率进行了精细调节,以确保两者能够有效协同。同时,损失函数设计上也考虑了KL散度的降低,以促进教师与学生之间的知识传递。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,DualOPSD在Qwen3-8B模型的非思考模式下,分别在AIME 2024、AIME 2025和HMMT 2025上提高了23.61、13.89和10.00点,显示出显著的性能提升。同时,1.7B和4B模型的实验结果表明,准确性提升与模型规模相关,且在所有规模下均减少了截断现象。

🎯 应用场景

该研究的潜在应用领域包括强化学习、自然语言处理和计算机视觉等多个领域,尤其是在需要高效学习和知识迁移的场景中。DualOPSD的自适应特性可以帮助模型更好地应对动态变化的环境,提升实际应用中的性能和稳定性。

📄 摘要(原文)

On-policy self-distillation (OPSD) uses a privileged copy of the student model to provide dense supervision without an external teacher. OPSD keeps this privileged teacher fixed, even though the student distribution and output style change during training. We propose DualOPSD, an asymmetric alternating framework that adapts both policies. The student first learns from the privileged teacher. The teacher then moves toward the updated student distribution on the same student trajectory. This update makes later supervision responsive to the learner and does not require another rollout. On Qwen3-8B in non-thinking mode, DualOPSD improves avg@12 over OPSD by 23.61, 13.89, and 10.00 points on AIME 2024, AIME 2025, and HMMT 2025. Results at 1.7B and 4B show that the accuracy gain depends on model scale. Across all three scales, DualOPSD reduces truncation. The 4B diagnostic also shows lower KL in both directions between the teacher and student.