On-Policy Delta Distillation for Multilingual Math Reasoning
作者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
分类: cs.CL, cs.LG
发布日期: 2026-08-06
备注: 9 pages, 3 figures, 10 tables
💡 一句话要点
提出On-Policy Delta Distillation以提升多语言数学推理能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多语言推理 蒸馏训练 数学推理 深度学习 自然语言处理
📋 核心要点
- 现有的On-Policy Distillation方法在多语言环境下的应用效果尚不理想,特别是在数学推理任务中。
- 论文提出的On-Policy Delta Distillation(OPD$^2$)通过利用教师模型与基础模型之间的概率差距作为学习信号,提升了多语言推理能力。
- 实验结果显示,OPD$^2$在韩语和日语的表现显著优于原始OPD,并有效缩小了英语与韩语的性能差距。
📝 摘要(中文)
On-Policy Distillation(OPD)作为强化学习后训练的有前景替代方案,在多语言环境下的有效性尚未得到充分探索。本文研究了OPD及其高级变体On-Policy Delta Distillation(OPD$^2$),专注于英语、韩语和日语的数学推理。OPD$^2$通过利用后训练教师模型与基础模型之间的概率差距作为学习信号,改进了OPD。实验结果表明,OPD$^2$在Qwen3上始终优于原始OPD,尤其在韩语和日语方面表现出显著提升,并普遍缩小了英语与韩语之间的性能差距。进一步发现,仅使用英语的OPD也能提高韩语和日语的表现,但往往使响应偏向英语,突显了多语言数据在保持目标语言响应中的重要性。
🔬 方法详解
问题定义:本文旨在解决现有On-Policy Distillation(OPD)在多语言数学推理中的不足,尤其是在韩语和日语的表现不佳问题。现有方法未能充分利用多语言数据的潜力,导致模型在特定语言上的响应偏向英语。
核心思路:论文提出的On-Policy Delta Distillation(OPD$^2$)通过引入教师模型与基础模型之间的概率差距作为学习信号,增强了模型的学习能力,从而提升多语言推理的准确性和一致性。
技术框架:整体架构包括数据预处理、模型训练和评估三个主要阶段。在训练阶段,使用OPD$^2$方法进行模型优化,利用教师模型的输出作为指导信号。
关键创新:OPD$^2$的核心创新在于通过概率差距引导学习,这一设计使得模型能够更好地捕捉多语言之间的细微差异,显著提升了推理能力。与传统的OPD相比,OPD$^2$在多语言环境下表现出更强的适应性和准确性。
关键设计:在模型训练中,采用了特定的损失函数来量化教师模型与基础模型之间的差距,并通过调节学习率和批量大小等超参数,优化了模型的训练过程。
🖼️ 关键图片
📊 实验亮点
实验结果表明,OPD$^2$在Qwen3模型上表现优异,尤其在韩语和日语的推理任务中,性能提升幅度达到显著水平,且有效缩小了英语与韩语之间的性能差距,展示了其在多语言处理中的优势。
🎯 应用场景
该研究的潜在应用领域包括教育、语言学习和跨语言信息检索等。通过提升多语言数学推理能力,能够为多语言用户提供更准确的知识获取和学习支持,具有重要的实际价值和广泛的未来影响。
📄 摘要(原文)
On-Policy Distillation (OPD) is emerging as a promising alternative to reinforcement learning for LLM post-training, yet its effectiveness in multilingual settings remains underexplored. We study OPD and its advanced variant, On-Policy Delta Distillation (OPD$^2$), for mathematical reasoning in English, Korean, and Japanese. OPD$^2$ improves OPD by using the probability gap between a post-trained teacher and its base model as the learning signal. Experiments with Qwen3 show that OPD$^2$ consistently outperforms the original OPD, with particularly strong improvements in Korean and Japanese, and generally narrows the English-Korean performance gap. We further find that English-only OPD can also increase performance for Korean and Japanese, but often shifts the responses toward English, highlighting the importance of multilingual data to preserving target-language responses.