ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning
作者: Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei
分类: cs.AI, cs.CL
发布日期: 2026-07-30
🔗 代码/项目: GITHUB
💡 一句话要点
提出ReDiPPO框架以解决数学推理中的价值评估问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 数学推理 PPO 价值估计 深度学习 策略优化 模型训练
📋 核心要点
- 现有的PPO方法在数学推理任务中面临长推理过程和稀疏奖励的挑战,导致价值评估不准确。
- ReDiPPO通过引入参考引导评论员和量化标准差异,改善了逐词的信用分配和价值估计。
- 实验结果显示,ReDiPPO在多个数学推理基准上超越了PPO、DAPO和GSPO等强基线,提升了推理性能。
📝 摘要(中文)
强化学习已成为提升大型语言模型数学推理能力的有效范式。在现有的策略优化方法中,近端策略优化(PPO)因其学习的评论员能够提供逐词的信用分配而受到青睐。然而,在长推理过程和稀疏结果奖励的数学推理任务中,可靠的逐词信用分配仍然具有挑战性。标准评论员往往无法准确评估中间推理状态,导致噪声优势估计和次优策略更新。本文提出了ReDiPPO,一个参考引导和差异感知的PPO框架,利用参考答案作为训练时的特权信号,以提供更准确的价值估计。同时,保留标准评论员并量化标准价值估计与参考引导价值估计之间的逐词参考标准差异。这种差异作为困难推理状态的指示符,用于在PPO优化过程中重新加权相应的逐词优势。大量实验表明,ReDiPPO提高了价值估计的准确性,并在最终推理性能上持续超越了包括PPO、DAPO和GSPO在内的强基线。
🔬 方法详解
问题定义:本文旨在解决在数学推理任务中,现有PPO方法在长推理过程和稀疏奖励下,无法准确评估中间推理状态的问题。这导致了噪声优势估计和次优策略更新,影响了模型的推理能力。
核心思路:ReDiPPO的核心思路是引入参考引导评论员,利用参考答案作为特权信号,以提供更准确的价值估计。同时,通过量化标准价值估计与参考引导价值估计之间的差异,来识别困难的推理状态并重新加权相应的逐词优势。
技术框架:ReDiPPO框架主要包括两个评论员模块:一个是标准评论员,另一个是参考引导评论员。标准评论员负责基本的价值估计,而参考引导评论员则利用参考答案进行更精确的估计。两者的输出差异用于调整逐词优势,从而优化策略。
关键创新:ReDiPPO的创新在于引入了参考引导的价值估计和差异感知的优势加权机制。这一设计使得模型能够更好地处理复杂的推理任务,显著提高了价值评估的准确性。
关键设计:在参数设置上,ReDiPPO采用了标准的PPO损失函数,同时引入了一个新的损失项,用于量化标准与参考估计之间的差异。此外,网络结构上,参考引导评论员的设计使得模型能够有效利用外部参考信息,增强了推理能力。
🖼️ 关键图片
📊 实验亮点
在多个数学推理基准上,ReDiPPO显著提高了价值估计的准确性,最终推理性能超越了PPO、DAPO和GSPO等强基线,展示了更优的策略优化效果。具体实验结果表明,ReDiPPO在推理任务中的表现提升幅度达到XX%,具体数据待补充。
🎯 应用场景
ReDiPPO框架在数学推理任务中具有广泛的应用潜力,尤其是在教育、自动化推理和智能问答系统等领域。通过提高模型的推理能力,ReDiPPO能够为复杂问题的解决提供更可靠的支持,推动相关技术的发展和应用。
📄 摘要(原文)
Reinforcement learning has emerged as an effective paradigm for enhancing the mathematical reasoning capabilities of large language models. Among existing policy optimization methods, Proximal Policy Optimization (PPO) remains particularly appealing because its learned critic can, in principle, provide token-level credit assignment. However, in mathematical reasoning tasks characterized by long reasoning horizons and sparse outcome rewards, reliable token-level credit assignment remains challenging. The standard critic often fails to accurately evaluate intermediate reasoning states, resulting in noisy advantage estimates and suboptimal policy updates. In this paper, we propose ReDiPPO, a Reference-guided and Discrepancy-aware PPO framework for mathematical reasoning. ReDiPPO introduces a reference-guided critic that uses reference answers as training-time privileged signals to provide more accurate value estimation. Meanwhile, it retains a standard critic and quantifies the token-level reference-standard discrepancy between the standard value estimate and the reference-guided value estimate. This discrepancy serves as an indicator of difficult reasoning states and is used to reweight the corresponding token-level advantages during PPO optimization. Extensive experiments on diverse mathematical reasoning benchmarks demonstrate that ReDiPPO improves value-estimation accuracy and consistently outperforms strong policy optimization baselines, including PPO, DAPO, and GSPO, in final reasoning performance. Our code is available on https://github.com/cii030/ReDiPPO.