Simple Actors and Deep Critics for Scalable Reinforcement Learning
作者: Guhyeon Kang, Jaehwi Lee, Minhae Kwon
分类: cs.LG
发布日期: 2026-08-27
备注: Accepted at CIKM 2026
💡 一句话要点
提出LAC以解决离线强化学习中的效率问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 离线强化学习 演员-评论家 深度学习 推理效率 多模态行为
📋 核心要点
- 现有的离线强化学习方法在推理时效率低下,尤其是生成演员需要多次去噪步骤。
- 论文提出LAC方法,通过将更多能力分配给评论家,并引入残差MLP、n步引导目标和分类交叉熵损失来解决深评论家的不稳定性。
- 实验结果表明,LAC在OGBench上与最强的基线相匹配,同时推理延迟降低了4倍,显示出显著的效率提升。
📝 摘要(中文)
近年来,离线强化学习的进展得益于表达能力强的生成演员,如扩散和流匹配策略,这些策略能够捕捉离线数据集中的多模态行为。然而,这些演员在每次决策时需要多次去噪或积分步骤,导致在部署时开销巨大。本文重新审视了在离线演员-评论家方法中应如何分配能力。由于评论家仅在训练期间使用并在部署时被丢弃,因此将能力分配给评论家而非演员更有利于推理时的效率。本文识别了在离线强化学习中加深评论家时出现的三种失败模式,并提出相应的解决方案。最终,结合轻量级确定性演员,提出了LAC(轻演员,深评论家),在OGBench上,LAC的推理延迟比最强的基线低4倍,同时与单步蒸馏策略的性能相当。
🔬 方法详解
问题定义:本文旨在解决离线强化学习中演员-评论家方法的效率问题,现有方法在推理时由于演员的复杂性导致开销过大。
核心思路:通过将更多计算资源分配给评论家而非演员,优化推理效率,同时解决深评论家在离线学习中的不稳定性。
技术框架:LAC方法包含一个轻量级的确定性演员和一个深度评论家,评论家使用残差MLP结构,结合n步引导目标和分类交叉熵损失进行训练。
关键创新:提出了将评论家的深度与稳定性结合的策略,解决了传统深评论家在离线强化学习中的优化、引导噪声放大和价值范围漂移等问题。
关键设计:使用残差MLP作为评论家的基础结构,n步引导目标来减少引导噪声,采用分类交叉熵损失来提高训练稳定性。
🖼️ 关键图片
📊 实验亮点
LAC在OGBench上的实验结果显示,其性能与最强的扩散和流匹配基线相当,同时推理延迟降低了4倍,展现出与单步蒸馏策略相当的效率,证明了其在离线强化学习中的有效性和实用性。
🎯 应用场景
该研究在离线强化学习领域具有广泛的应用潜力,尤其适用于需要高效决策的场景,如机器人控制、自动驾驶和智能推荐系统。通过提高推理效率,LAC方法能够在实际应用中实现更快的响应时间和更低的计算成本,推动智能系统的普及与发展。
📄 摘要(原文)
Recent progress in offline reinforcement learning (RL) has been driven by expressive generative actors such as diffusion and flow-matching policies, which capture multimodal behavior in offline datasets. However, these actors require multiple denoising or integration steps per action and thus incur substantial overhead at every decision in deployment. In this work, we revisit where capacity should be invested in an offline actor--critic method. Since the critic is used only during training and is discarded at deployment while the actor runs at every decision step, allocating capacity to the critic rather than the actor is more favorable for inference-time efficiency. However, scaling MLP critics in offline RL is known to introduce several distinct instabilities that have, in practice, kept critics shallow. We identify three distinct failure modes that arise when critics are deepened in offline RL---optimization, bootstrap-noise amplification, and value-range drift---and address each with a corresponding ingredient: a residual MLP backbone, n-step bootstrap targets, and a categorical cross-entropy loss. Combining these ingredients with a lightweight deterministic actor, we propose LAC (Light Actor, deep Critic). On OGBench, LAC matches the strongest diffusion- and flow-matching baselines while achieving up to 4x lower inference latency, comparable to one-step distilled policies without distillation. Its critic recipe also transfers across actor parametrizations.