Robust General Utility for Reinforcement Learning

📄 arXiv: 2608.03562v1 📥 PDF

作者: Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

分类: cs.LG

发布日期: 2026-08-04


💡 一句话要点

提出鲁棒一般效用强化学习以解决效用误指定问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 鲁棒性 效用函数 最小最大学习 算法收敛性 非凹优化 安全对齐 探索最大化

📋 核心要点

  1. 现有的一般效用强化学习方法假设评估效用是固定且正确的,未考虑实际应用中的效用偏差问题。
  2. 本文提出鲁棒一般效用强化学习框架,通过最小最大学习策略,针对效用误指定进行训练,增强了鲁棒性。
  3. 实验结果表明,所提出的方法在LLM安全对齐和探索最大化任务中表现出良好的收敛性,验证了理论结果。

📝 摘要(中文)

一般效用强化学习(RL)通过优化策略引导的占用测度的任意效用函数,扩展了经典RL的应用范围。然而,现有研究通常假设评估效用是固定且正确指定的,实际应用中,部署时的效用可能与训练时的效用偏离,导致鲁棒性差。为此,本文提出鲁棒一般效用RL,构建了一个最小最大学习框架,针对规定的不确定性集内的效用误指定进行策略训练。该框架严格推广了标准的一般效用RL,并通过适当选择效用不确定性集,统一了许多现有RL框架的视角。我们进一步开发了两个阶段的可证明收敛的随机算法,针对凹效用和非凹效用分别提出了不同的算法,并在LLM安全对齐和探索最大化任务上进行了实验验证。

🔬 方法详解

问题定义:本文旨在解决现有一般效用强化学习方法在效用误指定情况下的鲁棒性不足问题。现有方法通常假设效用是固定且正确的,导致在实际应用中存在鲁棒性差的问题。

核心思路:论文提出了一种鲁棒一般效用强化学习框架,采用最小最大学习策略,针对效用的不确定性进行训练,以增强模型的鲁棒性。通过在训练过程中考虑效用的偏差,提升了策略的适应性。

技术框架:该框架包括两个主要阶段:首先,定义一个效用的不确定性集;其次,基于该不确定性集,采用不同的算法进行策略训练。对于凹效用,使用投影随机梯度上升法;对于非凹效用,采用随机近似外梯度算法。

关键创新:最重要的技术创新在于提出了一个统一的框架,能够将标准的一般效用强化学习与其他现有框架(如奖励鲁棒RL和约束RL)进行整合,同时提供了针对效用误指定的鲁棒性保障。

关键设计:在算法设计中,针对凹效用和非凹效用分别设计了不同的算法,确保了收敛性和稳定性。特别是对于非凹效用,设计了随机近似外梯度算法,以缓解由非凹性引起的不良行为。算法的收敛性得到了理论证明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的鲁棒一般效用强化学习方法在LLM安全对齐和探索最大化任务中表现出良好的收敛性,尤其在非凹效用情况下,算法成功缓解了不良行为,收敛到近似一阶站态,验证了理论分析的有效性。

🎯 应用场景

该研究的潜在应用领域包括安全对齐、自动驾驶、金融决策等需要考虑不确定性和效用偏差的强化学习任务。通过增强模型的鲁棒性,能够在实际应用中提高决策的可靠性和有效性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Reinforcement learning (RL) with general utility extends classic RL by optimizing an arbitrary utility functional of the policy-induced occupancy measure, thereby enabling a broader range of applications. However, previous work on general utility RL typically assumes the evaluation utility is fixed and correctly specified. In practice, the utility used at deployment can deviate from the training one, creating a robustness gap that prior work does not address. Motivated by this, we propose robust general-utility RL, a minimax learning framework that trains policies against utility misspecification within a prescribed uncertainty set. Our framework strictly generalizes standard general-utility RL while also providing a unified view of many existing RL frameworks, including reward-robust RL and constrained RL, through appropriate choices of the utility uncertainty set. We further develop provably convergent stochastic algorithms for two regimes. For concave utilities, we develop a projected stochastic gradient descent-ascent method and establish stationarity guarantees. For the more challenging nonconcave regime, we propose a stochastic prox-extragradient algorithm that mitigates ill-posed behavior induced by nonconcavity, with convergence guarantees to approximate first-order stationarity. Experiments on LLM safety alignment and exploration maximization tasks further corroborate the convergence behavior consistent with our theory.