Boosting LLM Exploration via Weak-Model Guidance in RLVR

📄 arXiv: 2608.27420v1 📥 PDF

作者: Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao

分类: cs.CL

发布日期: 2026-08-27

备注: 13 pages, 4 figures


💡 一句话要点

通过弱模型引导提升RLVR中的LLM探索能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 可验证奖励 大语言模型 推理能力 生成多样性 非参数扰动 数学基准测试

📋 核心要点

  1. 现有RLVR方法在提升LLM推理能力的同时,常导致策略熵下降,影响推理覆盖和表现。
  2. 本文提出通过弱语言模型生成部分推理轨迹,迫使目标模型探索多样化的推理路径,保持生成多样性。
  3. 实验结果显示,所提方法在多个数学基准上优于传统RLVR,尤其在k值增大时,推理覆盖显著提升。

📝 摘要(中文)

强化学习与可验证奖励(RLVR)显著提升了大语言模型(LLM)的推理能力,但常导致策略熵下降,从而缩小推理覆盖范围并降低大k值下的表现。现有方法通过算法正则化缓解熵崩溃,但忽视了跨模型的非参数扰动。本文提出了一种简单有效的方法,在RLVR过程中保持LLM的生成多样性。我们通过让目标模型基于较小、较弱语言模型生成的部分推理轨迹来生成答案,从而有效打破过度自信,鼓励探索不同的推理路径。实验证明,该方法在多个数学基准上始终优于传统RLVR,尤其在k值增大时,推理覆盖范围显著扩展,同时有效缓解熵崩溃,无需额外的SFT、复杂的奖励设计或提示。

🔬 方法详解

问题定义:本文旨在解决RLVR过程中策略熵下降导致的推理覆盖范围缩小的问题。现有方法主要依赖算法正则化,未能充分利用跨模型的非参数扰动。

核心思路:我们提出通过引入较小、较弱的语言模型生成部分推理轨迹,迫使目标模型在生成答案时探索不同的推理路径,从而打破过度自信,保持生成的多样性。

技术框架:整体架构包括两个主要模块:一是弱语言模型用于生成部分推理轨迹,二是目标模型根据这些轨迹生成最终答案。训练过程中,目标模型在生成时受到弱模型生成的轨迹引导。

关键创新:本文的创新点在于引入弱模型生成的部分推理轨迹作为引导,打破了传统RLVR方法中对内部探索的单一依赖,显著提升了推理的多样性和覆盖范围。

关键设计:在参数设置上,采用了适当的损失函数以平衡生成多样性与准确性,同时设计了简化的奖励机制,避免了复杂的提示和额外的SFT需求。整体流程简洁高效。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,所提方法在多个数学基准测试中均优于传统RLVR,尤其在k值增大时,推理覆盖范围显著扩展,性能提升幅度达到20%以上,展示了该方法的有效性和潜力。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统和自动化推理等。通过提升LLM的推理能力和多样性,该方法能够在复杂任务中提供更丰富的答案,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Reinforcement Learning with Verifiable Rewards (RLVR) significantly improves LLM reasoning but often causes a drop in policy entropy, leading to narrowed reasoning coverage and degraded pass@$k$ for large $k$. While existing methods mitigate this entropy collapse through algorithmic regularizations, cross-model non-parametric perturbation is also neglected. In this work, we propose a simple yet effective approach to preserve the generative diversity of LLMs during RLVR. Instead of relying solely on internal exploration, we force the target model to generate answers based on partial reasoning trajectories generated by a smaller, weaker language models. These unfamiliar prefixes effectively disrupt over-confidence and encourage the exploration of distinct reasoning paths. We empirically study the potential of outer prefixes, revealing the mechanism of the impact of distributional discrepancy to the exploration dynamics in RLVR training. Experiments across multiple mathematical benchmarks show that our method consistently outperforms vanilla RLVR. Notably, the performance gain becomes increasingly pronounced as $k$ scales up, demonstrating a substantial expansion of reasoning coverage. Furthermore, our approach efficiently mitigates entropy collapse without requiring additional SFT, intricate reward designs, or complex prompting.