Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

📄 arXiv: 2608.01589v1 📥 PDF

作者: Xuyang Zhao, Liting Zhang, Zichen Xu, Zhihu Wang, Xu Caiyue, Shiwan Zhao, Qicheng Li

分类: cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出PS-OPSD以提升自蒸馏推理的准确性

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 自蒸馏 推理能力 轨迹引导 数学推理 机器学习

📋 核心要点

  1. 现有的在线自蒸馏方法依赖于教师提供的参考解决方案,导致推理时信息缺失。
  2. 论文提出的PS-OPSD通过轨迹引导替代完整解决方案,增强了模型的推理能力。
  3. 在三个数学推理基准测试中,PS-OPSD在问题仅观察的情况下实现了最高的准确率。

📝 摘要(中文)

在这篇论文中,作者提出了一种新的方法——问题空间引导的在线自蒸馏(PS-OPSD),旨在改善推理过程。现有的在线自蒸馏方法依赖于教师提供的特定参考解决方案,这在推理时可能无法获得。PS-OPSD通过用描述初始状态、目标条件、约束和选定状态转移路径的轨迹引导替代完整解决方案,从而提高了学生模型的推理能力。实验结果表明,PS-OPSD在多个数学推理基准测试中表现优异,尤其是在问题仅观察的情况下,达到了最高的准确率。

🔬 方法详解

问题定义:论文要解决的问题是现有在线自蒸馏方法在推理时依赖于特定参考解决方案的信息,这在实际推理过程中可能无法获得,导致模型性能受限。

核心思路:PS-OPSD的核心思路是用轨迹引导来替代完整的解决方案,提供关于初始状态、目标条件、约束和状态转移路径的信息,从而使学生模型在推理时能够获得更有效的指导。

技术框架:PS-OPSD的整体架构包括教师模型和学生模型,教师模型提供轨迹引导,而学生模型则在仅观察问题的情况下进行推理。整个过程保持了学生模型的回滚和在线自蒸馏目标不变。

关键创新:PS-OPSD的关键创新在于将轨迹引导作为替代方案,强调了特权信息的表示在在线自蒸馏中的重要性,这与现有方法依赖于完整解决方案的本质区别。

关键设计:在设计上,PS-OPSD关注于轨迹的相关性和路径的一致性,这些设计选择在实验中被证明对性能提升至关重要。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,PS-OPSD在三个数学推理基准测试中表现优异,尤其是在问题仅观察的情况下,达到了最高的准确率。与其他方法相比,PS-OPSD的准确率显著提升,展示了轨迹引导在推理中的有效性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、智能辅导系统和自动化问题解决工具。通过提升推理能力,PS-OPSD可以帮助学生更好地理解复杂问题,促进自主学习和问题解决能力的提高,未来可能在多个领域产生深远影响。

📄 摘要(原文)

On-policy self-distillation (OPSD) improves reasoning by using a privileged view of a model conditioned on reference solutions to supervise a student view that observes only the question. However, the teacher-provided token-level targets may depend on reference-specific information unavailable at inference time. We propose Problem-Space-Guided OPSD (PS-OPSD), which replaces the complete solution with trajectory-grounded guidance describing the initial state, goal conditions, constraints, and a selected state-transition path. The student rollout and OPSD objective remain unchanged. Across three mathematical reasoning benchmarks and model scales ranging from 1.7B to 8B, PS-OPSD achieves the highest aggregate question-only accuracy among the compared methods. Controlled experiments further indicate that guidance relevance and path coherence contribute to these gains, highlighting the representation of privileged information as an important design choice in OPSD.