Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

📄 arXiv: 2608.09568v1 📥 PDF

作者: Wenxiao Zhao, Shu Wang, Ying Nian Wu

分类: cs.CL

发布日期: 2026-08-10

备注: 16 pages, 2 figures, COLM2026


💡 一句话要点

提出Se-DPO以解决直接偏好优化中的静态令牌信用问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 直接偏好优化 令牌信用 自演化机制 自然语言处理 模型训练

📋 核心要点

  1. 现有的直接偏好优化方法将所有令牌视为对偏好信号的等同贡献,未能考虑个别令牌的实际影响。
  2. 本文提出的Se-DPO机制通过动态调整令牌信用,基于每个令牌的贡献强度和置信度,解决了静态信用的不足。
  3. 实验结果显示,Se-DPO在多个基准测试上显著提升了性能,验证了其有效性和优越性。

📝 摘要(中文)

直接偏好优化(DPO)通过统一求和聚合令牌级别的对数概率比,隐式地将所有令牌视为对偏好信号的贡献相等。然而,个别令牌对偏好信号的贡献是不同的。本文引入了令牌信用,根据每个令牌对偏好结果的贡献来调节其KL正则化。我们推导出有效的令牌信用与每个令牌的隐含奖励大小成正比,并观察到这一量在训练过程中显著演变。这意味着,静态令牌信用在训练过程中会越来越不匹配。为此,我们提出了Se-DPO(自演化令牌信用),该机制在DPO训练过程中根据模型自身不断演变的内部信号推导令牌信用。Se-DPO无需外部模型,仅增加一个轻量级的校准网络,计算开销极小。实验表明,Se-DPO在AlpacaEval~2上提高了最多9.8分,在Arena-Hard上提高了12.2分。

🔬 方法详解

问题定义:本文旨在解决直接偏好优化中静态令牌信用导致的偏好信号不准确的问题。现有方法未能考虑个别令牌对偏好信号的不同贡献,导致性能下降。

核心思路:Se-DPO通过实时调整令牌信用,基于模型内部信号的演变,动态反映每个令牌的贡献。这种设计使得模型能够更准确地捕捉到训练过程中令牌的实际影响。

技术框架:Se-DPO的整体架构包括一个轻量级的校准网络,该网络在DPO训练过程中实时计算令牌信用。主要模块包括令牌信用计算、信号强度评估和置信度校准。

关键创新:Se-DPO的核心创新在于其自演化的令牌信用机制,区别于传统方法的静态信用分配,能够更好地适应训练过程中的变化。

关键设计:在设计中,Se-DPO采用了基于KL正则化的损失函数,结合令牌的隐含奖励大小和置信度进行动态调整,确保计算效率和模型性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Se-DPO在AlpacaEval~2上提高了最多9.8分,在Arena-Hard上提高了12.2分,显著优于传统DPO方法,验证了其有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、推荐系统和人机交互等。通过更准确的偏好信号优化,Se-DPO可以提升用户体验和系统性能,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Direct Preference Optimization (DPO) aggregates token-level log-probability ratios via uniform summation, implicitly treating all tokens as contributing equally to the preference signal. However, the contribution of individual tokens to the preference signal varies. We introduce token credit, which modulates each token's KL regularization based on its contribution to the preference outcome. We derive that effective token credit is proportional to the magnitude of each token's implicit reward, and observe that this quantity evolves substantially during training. This implies that static token credit becomes increasingly misaligned as training progresses. In this work, we propose Se-DPO (Self-Evolving Token Credit for DPO), a live mechanism that derives token credit from the model's own evolving internal signals during DPO training. Since the reward signal varies in reliability across positions, Se-DPO calibrates token credit based on both the strength and the confidence of each token's contribution. Se-DPO requires no external models, adding only a lightweight calibration network with minimal computational overhead. Experiments show that Se-DPO improves over DPO by up to 9.8 points on AlpacaEval~2 and 12.2 points on Arena-Hard.