Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation
作者: Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng Zhang
分类: cs.LG, cs.AI
发布日期: 2026-08-10
备注: 9 pages, 5 figures, 2 tables
💡 一句话要点
提出SKALD框架以解决强化学习中的奖励信号不足问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 自蒸馏 技能卡 奖励信号 数学基准测试 模型优化 上下文学习
📋 核心要点
- 现有强化学习方法在回滚组均正确或均错误时,无法提供有效的奖励信号,导致学习效果不佳。
- SKALD框架通过引入技能卡作为显性信号,利用学生和教师模型的上下文视图进行自蒸馏,提升了学习效率。
- 在五个数学基准测试中,SKALD在不同模型规模下均显著提高了性能,相较于基线GRPO有明显的提升幅度。
📝 摘要(中文)
在强化学习中,当回滚组均正确或均错误时,验证奖励无法提供相对信号,这在我们的实验中占63.0-68.0%。为此,我们提出了SKALD(技能锚定潜在蒸馏)框架,该框架利用同一Qwen3-Base模型的两个上下文视图:一个仅包含问题的学生和一个基于抽象、明确答案过滤的技能卡的教师。学生在自身前缀上进行训练,将技能诱导的优势转移到共享参数中,而测试时不需要特权输入。SKALD通过使用逐渐倾斜的目标来稳定上下文诱导的分布不匹配,降低教师偏好的低学生可能性标记的权重。实验结果显示,SKALD在五个数学基准上显著提升了性能。
🔬 方法详解
问题定义:论文旨在解决强化学习中当回滚组均正确或均错误时,验证奖励信号缺乏有效性的问题。这种情况在实验中占据了63.0-68.0%,导致学习效果受限。
核心思路:SKALD框架通过引入技能卡作为显性信号,利用同一模型的学生和教师的上下文视图进行自蒸馏,旨在将技能诱导的优势转移到共享参数中,从而提高学习效率。
技术框架:SKALD的整体架构包括两个主要模块:一个是仅处理问题的学生模型,另一个是基于技能卡的教师模型。学生在自身前缀上进行训练,而教师则提供指导。框架通过逐渐倾斜的目标来减小上下文诱导的分布不匹配。
关键创新:SKALD的创新在于使用技能卡作为显性信号进行自蒸馏,解决了传统方法在特权输入缺失时的学习困境。这种方法与现有的基于奖励的学习方法有本质区别。
关键设计:SKALD采用了逐渐倾斜的目标函数,降低了教师偏好的低学生可能性标记的权重,随着倾斜消失,目标函数收敛到教师的交叉熵。此外,实验中引入了一个实证门控机制,仅在验证回滚估计出正向教师优势时激活蒸馏。
🖼️ 关键图片
📊 实验亮点
在五个数学基准测试中,SKALD在不同模型规模下相较于GRPO的平均提升分别为+2.46、+4.85和+12.01。在1.7B模型中,零方差蒸馏恢复了84.7%的整体增益,SKALD仍然比FLOP匹配的GRPO高出+4.06,超出上下文技能暴露的提升为+3.77。
🎯 应用场景
该研究的潜在应用领域包括教育技术、自动化评估系统和智能辅导系统。通过引入技能卡作为显性信号,SKALD能够在缺乏有效奖励信号的情况下,提升模型的学习能力和适应性,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Reinforcement learning with verifiable rewards yields no group-relative signal when rollout groups are uniformly correct or uniformly wrong, which account for 63.0-68.0% of groups in our experiments. We propose SKALD (Skill-Anchored Latent Distillation), an on-policy self-distillation framework that uses two context views of the same Qwen3-Base model: a question-only student and a teacher conditioned on an abstract, explicit-answer-filtered skill card. The student is trained on its own prefixes, transferring the skill-induced advantage into shared parameters without privileged input at test time. To stabilize context-induced distribution mismatch, SKALD employs an annealed exponentially tilted objective that downweights teacher-preferred tokens with very low student likelihood; as the tilt vanishes, it converges to teacher cross-entropy and recovers the forward-KL student gradient. An empirical gate activates distillation only when verified rollouts estimate a positive teacher advantage. Across five held-out mathematics benchmarks, SKALD improves overall avg@8 over GRPO by +2.46, +4.85, and +12.01 at 0.6B, 1.7B, and 4B, respectively. At 1.7B, zero-variance-only distillation recovers 84.7% of the full gain, while SKALD remains +4.06 above FLOP-matched GRPO and exceeds contextual skill exposure by +3.77. These results show that abstract skills provide dense supervision where group-relative rewards become uninformative.