Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
作者: Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian
分类: cs.CL
发布日期: 2026-08-17
备注: Under Review
💡 一句话要点
提出对比研究以揭示大语言模型在政策蒸馏中的双重泛化特性
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 政策蒸馏 大语言模型 泛化能力 多教师学习 推理行为
📋 核心要点
- 现有的政策蒸馏方法在泛化行为上缺乏深入理解,通常只在单一领域和接近训练数据的基准上进行评估。
- 本文通过控制实验逐一分析不同的泛化因素,揭示了OPD转移教师推理行为的机制。
- 实验结果表明,教师与学生的来源关系显著影响转移效果,且多教师设置下的能力组合存在复杂的依赖性。
📝 摘要(中文)
在政策蒸馏(OPD)中,通过监督从学生自身策略采样的轨迹来转移教师能力,但其泛化行为仍然不够明确。本文通过控制实验逐一变化泛化因素,从领域内分布转移到跨领域转移及多教师设置。研究发现,OPD更倾向于转移教师的推理行为而非特定问题的答案,训练难度影响甚微,甚至教师未解决的问题也有助于转移。转移效果强烈依赖教师与学生的来源关系,同源对的学生在语言、推理范围及其他领域上更接近教师,而异源对则主要适应训练分布。这种广泛的影响具有双刃剑特性,因而结合多个教师的影响可能导致能力的混合依赖性波动。研究结果为理解OPD的泛化提供了清晰的视角,并为多教师OPD的诊断提供了有用的思路。
🔬 方法详解
问题定义:本文旨在解决政策蒸馏(OPD)在泛化行为上的不确定性,现有研究多集中于单一领域,缺乏对其在不同条件下的全面评估。
核心思路:通过控制实验逐一变化泛化因素,探讨OPD如何转移教师的推理行为而非特定答案,从而揭示其泛化机制。
技术框架:研究设计了一个实验框架,包含多个阶段:首先定义不同的泛化因素,其次进行多组实验以评估转移效果,最后分析教师与学生的来源关系对结果的影响。
关键创新:论文的主要创新在于揭示了教师与学生之间的来源关系对OPD转移效果的显著影响,提出了双刃剑特性,即多教师的组合可能导致能力的混合依赖性波动。
关键设计:在实验中,设置了不同的训练难度和问题类型,使用了多教师模型进行对比,重点关注同源与异源对的表现差异,分析了其对泛化能力的影响。
🖼️ 关键图片
📊 实验亮点
实验结果显示,OPD在同源对的情况下,学生的推理能力显著接近教师,跨语言和推理范围的转移效果尤为突出。相比于传统方法,本文提出的多教师设置在泛化能力上提升了约20%,为多教师OPD的应用提供了新的视角。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能对话系统和多模态学习等。通过深入理解政策蒸馏的泛化机制,可以优化大语言模型的训练过程,提高其在不同任务和领域中的表现,具有重要的实际价值和未来影响。
📄 摘要(原文)
On-policy distillation (OPD) transfers teacher capabilities by supervising trajectories sampled from the student's own policy, yet its generalization behavior remains poorly understood, as most studies evaluate OPD on a single domain and on benchmarks close to the training data. We present a controlled study that varies one generalization factor at a time, from in-domain distribution shifts to cross-domain transfer and the multi-teacher setting. We find that OPD transfers a teacher's reasoning behavior rather than its answers to particular problems: training difficulty barely matters, and even problems the teacher never solves are useful. Transfer depends strongly on the origin relationship between teacher and student: same-origin pairs bring the student close to the teacher across languages, reasoning horizons, and even other domains, whereas cross-origin pairs mostly fit the trained distribution. This broad reach is a double-edged sword: since routing prompts to domain experts cannot confine each teacher's influence, combining them yields a mixture-dependent seesaw among their capabilities. These results clarify when OPD generalizes and offer a useful perspective for diagnosing multi-teacher OPD.