Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO
作者: Prakhar Gupta, Vaibhav Gupta
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-09-01
💡 一句话要点
提出审计GRPO、SFT和DPO以增强语言模型的上下文理解能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 语言模型 上下文理解 后训练 GRPO SFT DPO 注意力机制 机器学习
📋 核心要点
- 现有语言模型在处理与记忆知识冲突的提示时存在忽略证据的挑战,影响其上下文理解能力。
- 本文通过比较九种后训练方法,探讨了是否需要新机制来增强模型的上下文理解,重点在于GRPO、SFT和DPO的效果。
- 实验结果显示,GRPO的提升有限,而DPO在匹配分布上显著提高了上下文理解能力,表明已有机制在提升中起关键作用。
📝 摘要(中文)
语言模型在面对与记忆知识冲突的提示证据时可能会忽略这些证据。后训练可以使模型更可靠地遵循这些证据,但尚不清楚这些提升是否需要新机制或是加强已有机制。本文比较了来自同一起始检查点的九种后训练方法,包括GRPO、SFT和DPO,重点比较了不同规模和家族的效果。实验结果表明,GRPO的提升较小,而DPO在其匹配分布上驱动了接近上限的上下文理解能力。整体来看,上下文理解的提升主要依赖于起始模型中已有的机制。
🔬 方法详解
问题定义:本文旨在解决语言模型在面对与记忆知识冲突的提示证据时的忽略问题。现有方法在提升上下文理解能力方面存在不足,尤其是在不同后训练策略的效果上。
核心思路:论文的核心思路是通过比较不同的后训练方法(GRPO、SFT和DPO),评估它们对上下文理解能力的影响,探讨这些提升是否依赖于新机制或已有机制的强化。
技术框架:研究采用了从同一检查点出发的九种后训练方法,重点分析了GRPO的多个变体、SFT和DPO的效果。通过对比不同方法的性能,评估其对上下文理解的贡献。
关键创新:最重要的技术创新在于通过实验验证了上下文理解的提升主要依赖于起始模型中已有的机制,而非新引入的机制。这一发现挑战了传统观点,强调了已有结构的重要性。
关键设计:在实验中,采用了多种参数设置和损失函数,特别是在DPO的设计中,通过调整注意力头的使用,确保模型在处理上下文时的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GRPO的上下文理解提升有限,而DPO在其匹配分布上实现了接近上限的提升。具体而言,DPO的增益在经过监督预热后,恢复了35%的效果,表明已有机制在提升中的关键作用。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等。通过增强语言模型的上下文理解能力,可以提升人机交互的自然性和准确性,未来可能在教育、客服和内容生成等多个领域产生深远影响。
📄 摘要(原文)
Language models can ignore prompt evidence when it conflicts with memorized knowledge. Post-training can make models follow such evidence more reliably, but it is unclear whether these gains require new machinery or strengthen machinery already present. We compare nine post-training arms spanning GRPO, SFT, and DPO from one starting checkpoint, with key comparisons extended across scales and families. We estimate a grounding direction from that checkpoint before training. Across five tested GRPO variants, grounding gains are small. For the two variants replicated across seeds, equivalence tests bound their effects below the conflict-SFT gain even as the rewarded metric improves. Conflict-SFT improves grounding moderately, while DPO drives grounding near ceiling on its matched distribution. Conflict-SFT and DPO largely use the same causal attention-head set as the starting model. Subtracting the starting-model direction suppresses both gains, while adding it to the starting model recovers 35% of DPO's gain at a dose passing all stated side-effect checks. After a supervised warm start makes the context answer appear in more rollouts, the same GRPO recipe adds essentially no further grounding gain. In our setting, grounding gains largely depend on machinery already present in the starting model.