Disentangling Optimization Scale from Preference Scale in DPO
作者: Ivan Kruzhilov
分类: cs.LG
发布日期: 2026-08-27
💡 一句话要点
提出中心软正则化以解决DPO中的优化规模与偏好规模纠缠问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 直接偏好优化 中心软正则化 KL散度 学习率调度 模型训练
📋 核心要点
- 现有的DPO方法中,系数$β$纠缠了优化规模与偏好规模,导致学习率调度复杂且对超参数敏感。
- 论文提出中心软正则化的重构,明确区分逆偏好噪声规模和学习率的影响,使得优化过程更为稳定。
- 实验结果表明,新的方法在KL散度和损失曲线上的表现显著优于传统DPO,提升了模型的学习效果。
📝 摘要(中文)
直接偏好优化(DPO)是一种广泛应用于从偏好数据对齐语言模型的目标,其中系数$β$通常被解释为控制与参考策略的KL约束。本文表明,$β$纠缠了两个不同的角色:它既控制有效的逆偏好噪声规模,又重新缩放优化动态,导致在固定学习率下,政策偏差在$β$中呈现非单调性。此外,标准DPO损失值在不同$β$下不可比,几乎相同的损失曲线可能在KL散度上有几倍的差异。为了解决这些问题,本文提出了一种中心软正则化的重构,使其在$β>0$时与DPO等价,同时使逆偏好噪声规模和学习率效应明确且可独立调整。
🔬 方法详解
问题定义:本文要解决的是DPO中系数$β$的纠缠问题,导致优化动态和学习率调度复杂,影响模型性能。现有方法在不同$β$下的损失值不可比,增加了超参数选择的难度。
核心思路:论文提出的中心软正则化重构使得逆偏好噪声规模和学习率效应明确且可独立调节,从而简化了优化过程。通过这种方式,优化动态不再依赖于$β$的变化,提升了模型的学习稳定性。
技术框架:整体架构包括数据输入、偏好数据处理、中心软正则化损失计算和模型更新四个主要模块。中心软正则化损失与传统DPO损失相结合,确保在优化过程中保持一致性。
关键创新:最重要的技术创新在于提出了中心软正则化的重构,使得$β$的影响被解耦,优化过程中的逆偏好噪声规模和学习率可以独立调整。这与现有方法的本质区别在于,传统方法将这两个因素混合在一起,导致优化效果不稳定。
关键设计:关键设计包括中心软正则化损失函数的定义,确保其在$β>0$时与DPO等价。此外,设计了一个连续的$β o0$端点,使其简化为线性偏好边际目标,从而在不同的优化阶段提供灵活性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用中心软正则化的模型在KL散度和损失曲线上的表现显著优于传统DPO方法,尤其在不同$β$值下,模型的学习效果提升了数倍,验证了新方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的模型训练、推荐系统的优化以及其他需要从偏好数据中学习的机器学习任务。通过明确优化规模与偏好规模的关系,未来可以在更广泛的领域中提升模型的学习效率和稳定性。
📄 摘要(原文)
Direct Preference Optimization (DPO) is a widely used objective for aligning language models from preference data, with the coefficient $β$ commonly interpreted as controlling the KL constraint to a reference policy. We show that $β$ entangles two distinct roles: it governs the effective inverse preference-noise scale and simultaneously rescales the optimization dynamics, coupling this scale with the effective step size. As a consequence, at a fixed learning rate the achieved policy deviation is non-monotone in $β$: it vanishes in a dead zone at small $β$, reaches a peak at an intermediate value, and decreases again for larger $β$. Moreover, standard DPO loss values are not comparable across $β$: runs with nearly identical loss curves can differ several-fold in KL divergence from the reference model. This entanglement obscures the role of $β$, increases sensitivity to hyperparameter choices, and complicates learning-rate scheduling. We propose a centered-softplus reformulation that is argmin-equivalent to DPO for $β>0$, while making the inverse preference-noise-scale and learning-rate effects explicit and independently tunable. The normalized centered-softplus objective also admits a continuous $β\to0$ endpoint that reduces to a linear preference-margin objective.