DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

📄 arXiv: 2608.09233v1 📥 PDF

作者: Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

分类: cs.LG, cs.CV

发布日期: 2026-08-10


💡 一句话要点

提出DreOPD以解决流匹配模型的优化冲突问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 流匹配模型 在线蒸馏 奖励外推 多任务学习 计算机视觉

📋 核心要点

  1. 现有流匹配模型在多样化下游任务中的适应性依赖后期训练,导致优化目标冲突和性能不稳定。
  2. DreOPD通过将隐式奖励外推转化为速度回归,结合在线蒸馏的稳定性,提供了一种新颖的训练方法。
  3. 实验结果显示,DreOPD在单教师和多教师设置下均优于传统OPD和多任务强化学习基线,表现出显著的性能提升。

📝 摘要(中文)

流匹配模型已成为图像生成的主流方法,但其在多样化下游场景中的适应性通常依赖于后期训练,这可能导致任务特定优化目标之间的冲突。强化学习能够直接优化任务特定奖励,但轨迹级优化可能引发高方差梯度和跨任务干扰。我们提出DreOPD,一种用于流匹配模型的降级参考外推在线蒸馏方法,旨在弥合这两种范式。DreOPD将隐式奖励外推转化为封闭形式的速度回归,实现了具有OPD稳定性的外推后期训练,并利用轻度降级参考增强教师-参考对比,提供更清晰的外推方向。实验表明,DreOPD在平均性能上优于OPD和多任务强化学习基线,并在大多数指标上超越了专门教师。

🔬 方法详解

问题定义:论文旨在解决流匹配模型在多样化下游任务中适应性不足的问题。现有方法依赖后期训练,导致任务特定优化目标之间的冲突,影响模型性能和稳定性。

核心思路:DreOPD的核心思想是将隐式奖励外推转化为封闭形式的速度回归,从而实现稳定的外推后期训练。通过引入轻度降级参考,增强教师与参考之间的对比,提供更清晰的外推方向。

技术框架:DreOPD的整体架构包括两个主要模块:奖励外推模块和在线蒸馏模块。奖励外推模块负责将隐式奖励转化为速度回归,而在线蒸馏模块则提供稳定的监督信号,指导学生模型的训练。

关键创新:DreOPD的主要创新在于将传统的教师匹配方法从模仿转变为基于外推的速度回归,这一设计显著提高了模型的训练稳定性和性能。

关键设计:在DreOPD中,关键的参数设置包括轻度降级参考的选择,以及损失函数的设计,确保教师与学生之间的有效对比。此外,网络结构上采用了适应性调整,以适应不同任务的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DreOPD在平均性能上超越了传统的在线蒸馏方法OPD和多任务强化学习基线,尤其在多个指标上超过了专门教师,展示了显著的性能提升,具体提升幅度未知。

🎯 应用场景

DreOPD在图像生成、视频处理和其他计算机视觉任务中具有广泛的应用潜力。通过提高流匹配模型的适应性和稳定性,该方法能够在多任务环境中实现更高效的训练,推动相关领域的研究和应用发展。

📄 摘要(原文)

Flow-matching models are now a mainstream method to image generation, but its adaptation to diverse downstream scenarios typically relies on post-training, which may cause conflicts among task-specific optimization objectives. Reinforcement learning enables direct optimization of task-specific rewards beyond the original models, yet trajectory-level optimization may incur high-variance gradients and cross-task interference. On-policy distillation (OPD) offers dense and stable supervision on student rollouts, but conventional teacher matching remains imitation-based. We propose DreOPD, a Degraded-reference extrapolative OPD method for flow-matching models that bridges these two paradigms. Our DreOPD converts implicit reward extrapolation into closed-form velocity regression, enabling extrapolative post-training with the stability of OPD. It further uses a mildly degraded reference to strengthen the teacher-reference contrast, yielding a clearer extrapolation direction. Experiments on single- and multi-teacher settings show that DreOPD outperforms OPD and multi-task RL baselines in average performance, while surpassing specialized teachers on most metrics.