Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning
作者: Abdelghani Ghanem, Mounir Ghogho
分类: cs.LG
发布日期: 2026-08-03
💡 一句话要点
提出期望值n步Q学习以解决离线强化学习中的偏差问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 离线强化学习 期望值学习 Q学习 多步回报 偏差减小 机器人控制 自动驾驶 智能体学习
📋 核心要点
- 现有的多步回报方法在离线强化学习中引入了悲观偏差,影响了决策评估的准确性。
- 提出的期望值n步Q学习(ENQ)通过不对称期望值损失来替代传统的时序差分损失,从而减小偏差。
- 实验结果显示,ENQ在多个任务中与LQL表现相当,并在训练效率上有显著提升。
📝 摘要(中文)
多步回报加速了离线强化学习中的奖励传播,但将每个决策的评估与后续的次优记录动作耦合,导致随着时间跨度增长而加剧的悲观偏差。本文提出了期望值n步Q学习(ENQ),用不对称的期望值损失替代对称的n步时序差分损失,期望值水平τ是唯一的超参数。我们证明了ENQ算子是γ^n收缩的。在确定性动态下,当τ=1时,其偏差在覆盖的支持对上消失,固定点满足分离-n实例及其下界不等式。在随机动态下,算子偏差具有双侧界限。使用单一的期望值水平τ=0.8和固定的备份时间跨度,ENQ在27个操作和导航任务实例中与LQL竞争,训练步骤吞吐量更高,并在控制缩放实验中从十个评论家集成中受益更多。
🔬 方法详解
问题定义:本文解决了离线强化学习中多步回报引入的悲观偏差问题,现有方法在评估决策时依赖于次优的记录动作,导致评估不准确。
核心思路:论文提出期望值n步Q学习(ENQ),通过引入不对称的期望值损失来替代传统的对称损失,从而减小随着时间跨度增长的偏差。
技术框架:ENQ的整体架构包括期望值损失的计算、n步回报的获取以及Q值的更新。主要模块包括期望值损失计算模块和Q值更新模块。
关键创新:ENQ的核心创新在于使用不对称期望值损失,这一设计使得在确定性和随机动态下均能有效减少偏差,与传统的n步时序差分方法相比,具有本质的区别。
关键设计:论文中设置的超参数τ=0.8是唯一的特定于方法的超参数,损失函数采用不对称期望值损失,确保了在不同任务中的适应性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ENQ在27个操作和导航任务中与LQL的表现相当,并在训练步骤吞吐量上更高,显示出在控制缩放实验中,十个评论家集成的优势。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动驾驶、游戏AI等需要高效决策的强化学习场景。通过减少偏差,ENQ可以在复杂环境中实现更优的策略学习,提升智能体的表现和效率。
📄 摘要(原文)
Multi-step returns accelerate reward propagation in off-policy reinforcement learning, but couple the evaluation of each decision to the suboptimal logged actions that follow it, inducing a pessimistic bias that grows with the horizon. We propose Expectile $n$-step Q-learning (ENQ), which replaces the symmetric $n$-step temporal-difference (TD) loss with an asymmetric expectile loss on the action-value error, with expectile level $τ$ as the only method-specific hyperparameter added beyond $n$-step TD. We prove that the ENQ operator is a $γ^{n}$-contraction. Under deterministic dynamics, at $τ=1$, its bias vanishes at the optimal action-value function $Q^*$ on covered in-support pairs, and the corresponding fixed point satisfies the separation-$n$ instance and its multiples of the lower-bound inequality used by Long-Horizon Q-learning (LQL). Under stochastic dynamics, the operator bias admits two-sided bounds with horizon-independent noise constants. Using a single expectile level $τ=0.8$ and a fixed backup horizon across 27 manipulation and navigation task instances, ENQ is competitive with LQL on aggregate, achieves higher measured training-step throughput in our profiling study, and benefits more from a ten-critic ensemble in a controlled scaling experiment.