Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

📄 arXiv: 2609.03342v1 📥 PDF

作者: Leqi Zheng, Jinbo Su, Fang Niu, Chaokun Wang, Weiping Wang, Jiajun Zhang, Shannan Yan, Jie Wu, Zhaolu Kang, Rong Fu, Hang Zhang

分类: cs.LG

发布日期: 2026-09-03

🔗 代码/项目: GITHUB


💡 一句话要点

提出梯度对齐奖励以解决强化学习在大语言模型推理中的局限性

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 大语言模型 推理能力 梯度对齐 奖励机制 数学基准测试 余弦相似度 专家锚点

📋 核心要点

  1. 现有的强化学习方法在处理大语言模型的推理时,无法有效区分正确的推理轨迹,导致奖励信号不足。
  2. 本文提出的梯度对齐奖励(GAR)通过在策略的梯度空间中操作,利用专家锚点梯度计算密集奖励,从而提升推理能力。
  3. 实验结果表明,GAR在Qwen3-4B和Qwen3-8B模型上,在数学基准测试中显著优于GRPO等基线,且无需领域特定数据。

📝 摘要(中文)

强化学习中的可验证奖励(RLVR)推动了大语言模型的思维链推理,但其二元结果奖励无法区分正确轨迹。现有的密集奖励替代方案要么忽视了训练语料库中已有的专家解决方案,要么需要昂贵的离线标注。本文提出了梯度对齐奖励(GAR),该方法在策略的梯度空间中操作:通过输出投影层的截断反向传播提取每次回合的紧凑梯度向量,并与专家锚点梯度的余弦相似度计算出密集的、具有推理意识的奖励,且墙钟时间开销低于9%。我们证明了该余弦相似度可以分解为预测误差和激活模式因素,从而具体表征了对齐信号所测量的内容。在Qwen3-4B和Qwen3-8B上,GAR在竞争级数学基准测试中持续优于GRPO和其他基线,并在没有领域特定数据的情况下转移到GPQA Diamond和MMLU-Pro。代码和数据可在https://github.com/LQgdwind/GAR获取。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在大语言模型推理中无法有效区分正确轨迹的问题。现有的二元奖励机制无法提供足够的信息,导致模型推理能力受限。

核心思路:论文提出的梯度对齐奖励(GAR)通过在策略的梯度空间中操作,利用截断反向传播提取的梯度向量与专家锚点梯度的余弦相似度来生成密集的奖励信号,从而增强模型的推理能力。

技术框架:GAR的整体架构包括三个主要模块:首先,通过截断反向传播提取每次回合的梯度向量;其次,计算该向量与专家锚点梯度的余弦相似度;最后,将该相似度作为奖励信号反馈给模型。

关键创新:GAR的主要创新在于其通过余弦相似度的乘法分解,将奖励信号具体化为预测误差和激活模式因素,这一特性使得奖励信号更加精准且具有推理意识。

关键设计:在设计中,GAR的计算开销低于9%,并且不需要额外的离线标注,极大地提高了效率和实用性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,GAR在Qwen3-4B和Qwen3-8B模型上,在竞争级数学基准测试中持续优于GRPO和其他基线,具体提升幅度显著,且在GPQA Diamond和MMLU-Pro等任务中表现出色,证明了其广泛适用性。

🎯 应用场景

该研究的潜在应用领域包括教育、自动化推理系统和智能问答等。通过提升大语言模型的推理能力,GAR可以在需要复杂推理的任务中提供更准确的结果,具有重要的实际价值和未来影响。

📄 摘要(原文)

Reinforcement learning from verifiable rewards (RLVR) drives chain-of-thought reasoning in large language models, yet its binary outcome reward cannot distinguish among correct trajectories. Existing dense reward alternatives, from surface heuristics to process reward models, either ignore the expert solutions already present in training corpora or require expensive offline annotation. We propose Gradient-Aligned Reward (GAR), which operates in the policy's own gradient space: truncated backpropagation through the output projection layer extracts a compact gradient vector for each rollout, and cosine similarity with an expert-anchor gradient yields a dense, reasoning-aware reward with less than 9% wall-clock overhead. We prove that this cosine admits a multiplicative decomposition into prediction-error and activation-pattern factors, providing a concrete characterization of what the alignment signal measures. On Qwen3-4B and Qwen3-8B, GAR consistently improves over GRPO and other baselines on competition-level math benchmarks and transfers to GPQA Diamond and MMLU-Pro without domain-specific data. Code and data are available at https://github.com/LQgdwind/GAR.