Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

📄 arXiv: 2608.23311v1 📥 PDF

作者: Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

分类: cs.CL

发布日期: 2026-08-24

备注: Accepted to EMNLP 2026 main conference

🔗 代码/项目: GITHUB


💡 一句话要点

提出环境正则化方法以解决大语言模型策略优化中的稳定性与探索性困境

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 策略优化 环境正则化 Query-KL 数学推理 稳定性 探索性

📋 核心要点

  1. 现有的大语言模型策略优化方法在稳定性与探索性之间存在权衡,导致优化效果不理想。
  2. 本文提出环境正则化策略优化(ERPO),通过引入Query-KL项,将正则化转移至输入侧,有效控制查询分布漂移。
  3. 在六个数学推理基准上,ERPO替代了传统的Policy-KL正则化,显著提升了模型的准确性和稳定性。

📝 摘要(中文)

大语言模型的策略优化面临稳定性与探索性的权衡,现有方法通过动作侧的Policy-KL正则化进行调节,导致响应行为受限且消耗探索预算。本文提出环境正则化策略优化(ERPO),将正则化转移至输入侧,引入Query-KL(QKL)项以限制查询分布漂移,并结合静态参考数据集的每查询权重,优化每次查询更新。QKL通过查询似然严格流动,不对响应分布施加直接梯度压力,从而保留探索性。ERPO在六个数学推理基准上替代了标准的Policy-KL正则化,实现了对查询分布漂移的有效控制,提升了准确性,并在高温解码和长时间训练下表现出更稳定的行为。

🔬 方法详解

问题定义:本文旨在解决大语言模型策略优化中的稳定性与探索性权衡问题。现有方法依赖于动作侧的Policy-KL正则化,导致响应行为受限并消耗探索预算,缺乏有效的漂移控制。

核心思路:论文提出环境正则化策略优化(ERPO),将正则化转移至输入侧,通过引入Query-KL(QKL)项来限制查询分布的漂移,同时结合静态参考数据集的每查询权重,优化每次查询的更新。这样的设计避免了对响应分布施加直接梯度压力,从而保留了探索性。

技术框架:ERPO的整体架构包括查询分布的动态调整和静态参考权重的结合。具体流程为:首先,计算当前策略下的查询分布;其次,利用QKL项对查询分布进行约束;最后,结合静态参考权重进行更新。

关键创新:ERPO的主要创新在于将正则化从动作侧转移至输入侧,通过QKL项有效控制查询分布的漂移,避免了传统方法的限制,保持了探索性。

关键设计:在ERPO中,QKL项通过查询似然进行梯度流动,确保不对响应分布施加直接压力。此外,静态参考权重的设计使得每次查询更新更倾向于参考分布下的典型查询,从而提高了模型的稳定性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在六个数学推理基准上,ERPO替代了传统的Policy-KL正则化,显著提升了模型的准确性,表现出更稳定的行为,尤其在高温解码和长时间训练下,准确性提升幅度明显,展示了其优越性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和自动文本生成等。通过优化大语言模型的策略,ERPO可以在实际应用中提高模型的响应质量和稳定性,促进更复杂任务的实现,具有重要的实际价值和未来影响。

📄 摘要(原文)

Policy optimization (PO) for Large Language Models faces a stability--exploration trade-off, currently mediated by an action-side Policy-KL regularizer. This puts practitioners in a double bind: keeping Policy-KL constrains response behavior and consumes the action-side exploration budget, while dropping it leaves the optimization without an explicit drift control. We argue for an alternative that breaks the dilemma by moving regularization to the input side. As training progresses, the distribution over training queries induced by the current policy drifts unchecked from its pre-RL reference distribution. Concretely, Environment-Regularized Policy Optimization (ERPO) introduces a Query-KL (QKL) term that bounds this query distribution shift, together with a dataset-static reference-derived per-query weight that biases each per-query update toward queries typical under the reference. The QKL gradient flows strictly through the query likelihood; the response score function used by policy-gradient estimators does not appear in the QKL term, so QKL exerts no direct gradient pressure on the response distribution---exploration is preserved. ERPO plugs into GRPO/PPO/REINFORCE-style pipelines without additional forward passes. On six mathematical reasoning benchmarks, ERPO replaces the standard Policy-KL regularizer while achieving effective control over query distribution drift, delivering stronger accuracy and substantially more stable behavior under high-temperature decoding and long-horizon training.Our source code are available at https://github.com/alibaba/ERPO