Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation

📄 arXiv: 2608.09228v1 📥 PDF

作者: Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar, Junpei Komiyama

分类: cs.LG, cs.AI

发布日期: 2026-08-10

备注: Working progress


💡 一句话要点

提出OP²SD以探讨教师行为对自蒸馏的影响

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 自蒸馏 教师行为 上下文诱导 数学基准 智能辅导系统

📋 核心要点

  1. 现有的在政策自蒸馏方法通常假设教师通过观察参考解决方案来指导学生,但这种理解忽略了教师行为的上下文影响。
  2. 论文提出了OP²SD方法,通过使用来自不同示例的问题和解决方案,探讨教师的上下文诱导行为对学生学习的影响。
  3. 实验结果表明,OP²SD在三个数学基准上表现优于基础模型,并与OPSD相竞争,强调了教师行为的重要性。

📝 摘要(中文)

在论文中,作者探讨了在政策自蒸馏(OPSD)中,教师观察到的参考解决方案如何影响学生的学习轨迹。通过引入OP²SD(来自其他问题的在政策自蒸馏),研究表明,教师的上下文诱导行为在自蒸馏过程中起着重要作用,而不仅仅是依赖于参考解决方案。实验结果显示,OP²SD在三个数学基准上超越了基础模型,并与OPSD保持竞争力,表明OPSD的收益并不完全源于对参考解决方案的访问。

🔬 方法详解

问题定义:论文旨在解决在政策自蒸馏(OPSD)中,教师观察参考解决方案对学生学习轨迹的影响。现有方法过于依赖于参考解决方案,未能充分考虑教师行为的上下文影响。

核心思路:论文提出OP²SD方法,替换掉配对的参考解决方案,使用来自其他问题的示例,保持学生的学习轨迹和教师的监督目标,以此探讨教师行为的上下文诱导效应。

技术框架:整体架构包括学生模型、教师模型和蒸馏目标。学生模型在学习过程中生成轨迹,教师模型则基于不同问题的解决方案提供指导。

关键创新:OP²SD的核心创新在于其不再依赖于特定问题的参考解决方案,而是通过不同问题的解决方案来引导学生,强调了教师行为的上下文诱导作用。

关键设计:在实验中,设置了多个数学基准,使用了特定的损失函数来优化教师的监督效果,并确保学生模型的学习过程与教师的指导保持一致。实验中对模型的参数进行了细致调优,以实现最佳性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,OP²SD在三个数学基准上超越了基础模型,且与传统的OPSD方法保持竞争力,表明其在教师行为上下文诱导方面的有效性。具体性能提升幅度未知,但结果表明教师的上下文行为对学习效果有显著影响。

🎯 应用场景

该研究的潜在应用领域包括教育技术、智能辅导系统和自适应学习平台。通过优化教师的指导行为,能够提升学生的学习效果,具有重要的实际价值和未来影响。

📄 摘要(原文)

On-Policy Self-Distillation (OPSD) is commonly interpreted as the transfer of privileged information: a teacher observes the verified solution to the target problem and supervises the student's trajectory. However, this interpretation conflates two effects. The reference solution not only reveals the answer to the current instance but also changes the context under which the teacher provides token-level supervision. We investigate the role of target-specific privilege with $\mathrm{OP}^{2}\mathrm{SD}$ (On-Policy Self-Distillation from Other Problems), which replaces the paired reference with a problem and solution from a different example, while preserving the student rollout, teacher, and distillation objective. Across three models and three mathematics benchmarks, $\mathrm{OP}^{2}\mathrm{SD}$ improves over the base model, remains competitive with OPSD. The success of $\mathrm{OP}^{2}\mathrm{SD}$ implies that OPSD gains do not necessarily come from access to the reference solution, and that the teacher's context-induced behavior is an important factor.