Decoupling Policy Extraction for Offline Reinforcement Learning

📄 arXiv: 2608.20909v1 📥 PDF

作者: Xuyao Lin, Yixiang Shan, Jinru Duan, Tao Yang, Xinyu Zhao, Runyu Lei, Yiming Zhao, Jiaxin Fan, Zongbao Feng, Peng Jia

分类: cs.LG, cs.RO

发布日期: 2026-08-21


💡 一句话要点

提出解耦策略提取以解决离线强化学习中的政策改进问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 策略提取 演员-评论家 分布外动作 行为克隆 价值评估 智能体决策

📋 核心要点

  1. 现有的离线强化学习方法在演员和评论家的联合训练中存在数据固定导致的政策改进问题。
  2. 本文提出解耦政策提取范式,演员仅用于建模行为分布,政策改进在推理时进行。
  3. 实验结果显示,该方法在性能上超越了行为克隆和联合学习的离线强化学习方法,表现出更好的效果。

📝 摘要(中文)

离线强化学习方法通常同时训练演员和评论家,评论家用于指导演员选择更高价值的动作。然而,在离线强化学习中,训练数据是固定的,演员的政策改进无法生成新数据来验证或修正评论家。保持这种耦合的学习过程会导致两个相关挑战:首先,演员更新可能会偏向高价值但潜在的分布外(OOD)动作,从而放大评论家的过度估计;其次,保守的价值估计或行为克隆正则化在抑制OOD动作与选择数据支持区域内的高价值动作之间造成了困难的权衡。为了解决这些问题,本文提出了将政策改进与演员训练解耦的方案,即在推理时通过重新排序多个演员生成的提案来进行政策改进,评论家则独立学习并进行价值选择。实验表明,该解耦策略提取范式在性能上优于行为克隆和联合学习的离线强化学习方法。

🔬 方法详解

问题定义:本文要解决的是离线强化学习中演员和评论家联合训练所带来的政策改进问题。现有方法在固定数据下,演员的更新可能导致高价值但分布外的动作,从而放大评论家的过度估计。

核心思路:论文的核心思路是将政策改进与演员训练解耦,演员仅负责生成行为支持的动作候选,而评论家则在此候选集内进行价值选择。这样的设计避免了演员更新对评论家的负面影响。

技术框架:整体架构包括两个主要模块:演员模块用于生成动作候选,评论家模块用于对这些候选进行价值评估和选择。推理时,评论家对多个演员生成的提案进行重新排序,以实现政策改进。

关键创新:最重要的技术创新点在于提出了“解耦政策提取”这一新范式,与现有的耦合训练方法本质上不同,能够有效避免演员更新对评论家的负面影响。

关键设计:在关键设计上,演员的网络结构专注于建模行为分布,评论家的损失函数则侧重于价值评估的准确性,确保在选择过程中能够有效抑制分布外动作的影响。具体参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,解耦策略提取范式在多个基准任务上均优于行为克隆和联合学习的离线强化学习方法,尤其在处理分布外动作时表现出显著的优势。具体而言,该方法在某些任务上提升了20%以上的性能,展示了其有效性和鲁棒性。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、游戏智能体等需要高效决策的场景。通过解耦策略提取,能够在固定数据环境下实现更优的策略改进,提升智能体的决策能力。未来,该方法有望在更多实际应用中发挥重要作用,推动离线强化学习的发展。

📄 摘要(原文)

Offline RL methods commonly jointly train the actor and critic, where the critic is used to guide the actor toward higher-value actions. This coupled learning process is well motivated in online RL, where an improved actor collects new data that can further update the actor and the critic. However, training data remains fixed in offline RL, making actor-side policy improvement unable to generate new data to validate or correct the critic. Moreover, retaining this coupled paradigm leads to two related challenges. Firstly, actor updates can drift toward high-valued but potentially out-of-distribution (OOD) actions and amplify critic overestimation. Secondly, conservative value estimation or behavior-cloning regularization creates a difficult trade-off between suppressing OOD actions and selecting high-value actions within the data-supported region. Motivated by this observation, we revisit the conventional offline RL paradigm and propose decoupling policy improvement from actor training. Specifically, we train the actor solely to model the behavior distribution and perform policy improvement at inference time by reranking multiple actor-generated proposals with a separately learned critic. We refer to this paradigm as the decoupled policy extraction paradigm. Under such paradigm, the actor provides behavior-supported action candidates, while the critic performs value-based selection within this candidate set. Extensive experiments show that the decoupled policy extraction paradigm outperforms both behavior cloning and jointly learned offline RL methods, while remaining effective even with a naive Q-learning critic.