Efficient Hypergradient Descent for Inverse Reinforcement Learning

📄 arXiv: 2608.11052v1 📥 PDF

作者: Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova

分类: cs.LG, stat.ML

发布日期: 2026-08-11


💡 一句话要点

提出高效超梯度下降法以解决逆强化学习中的计算挑战

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 逆强化学习 超梯度下降 费舍尔信息 双层优化 计算效率 策略优化 流式算法

📋 核心要点

  1. 现有的逆强化学习方法在计算上面临挑战,尤其是在双层优化中外层更新需要复杂的超梯度计算。
  2. 本文提出了一种高效的超梯度下降方法,通过利用费舍尔信息矩阵来简化超梯度的计算过程。
  3. 实验结果显示,该方法在离散和连续控制环境中表现出色,政策性能与基线相比具有竞争力,且计算效率显著提升。

📝 摘要(中文)

逆强化学习(IRL)旨在恢复一个奖励函数,使得在该函数下的策略能够重现专家演示中的行为。传统的IRL方法将其表述为一个双层优化问题,其中内层对应于在学习的奖励下进行策略优化,外层则衡量诱导策略与专家数据之间的差异。然而,这种表述在实际应用中计算上具有挑战性,因为外层更新需要涉及内层目标的超梯度,且需要逆海森-向量乘积。本文通过证明在内层最优时,内层目标的海森矩阵与策略的费舍尔信息矩阵成比例,从而提出了一种基于费舍尔的结构化超梯度,紧密相关于自然超梯度下降。为了解决与大型费舍尔矩阵相关的可扩展性瓶颈,我们使用流式谱草图近似所需的逆费舍尔-向量乘积,避免了显式构造费舍尔矩阵的需求。我们在离散和连续控制环境中评估了我们的方法,结果表明政策性能具有竞争力,奖励排名质量强,同时费舍尔草图减少了曲率存储复杂度,并相较于显式费舍尔求解器提高了计算效率。

🔬 方法详解

问题定义:本文解决逆强化学习中的计算挑战,尤其是双层优化中外层更新所需的复杂超梯度计算,传统方法在处理大规模问题时效率低下。

核心思路:通过证明在内层最优时,内层目标的海森矩阵与策略的费舍尔信息矩阵成比例,提出了一种基于费舍尔的超梯度计算方法,旨在提高计算效率。

技术框架:整体架构包括内层策略优化和外层奖励函数的优化,内层通过费舍尔信息矩阵进行超梯度计算,外层则通过评估策略与专家数据的差异进行更新。

关键创新:最重要的创新在于利用流式谱草图近似逆费舍尔-向量乘积,避免了显式构造大型费舍尔矩阵,从而显著提高了算法的可扩展性和计算效率。

关键设计:在参数设置上,采用了流式算法来处理费舍尔矩阵的近似,损失函数设计上关注于策略与专家行为的匹配度,确保了优化过程的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的方法在离散和连续控制环境中均表现出色,政策性能与第一阶随机双层基线相比具有竞争力,且费舍尔草图的使用显著降低了曲率存储复杂度,提高了计算效率。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、游戏AI等,能够有效地从专家示范中学习并优化策略,提升智能体的决策能力。未来,该方法可能在复杂环境中的应用中展现出更大的价值,推动逆强化学习的实际应用。

📄 摘要(原文)

Inverse reinforcement learning (IRL) aims to recover a reward function under which the resulting policy reproduces the behavior observed in expert demonstrations. A natural approach is to formulate IRL as a bilevel optimization problem, in which the inner level corresponds to policy optimization under the learned reward and the outer level measures the discrepancy between the induced policy and expert data. However, this formulation is computationally challenging in practice because the outer update requires a hypergradient involving an inverse-Hessian-vector product for the inner objective. We address this challenge by showing that, at the inner optimum, the Hessian of the inner objective is proportional to the Fisher information matrix of the policy, yielding a structured Fisher-based hypergradient closely related to Natural Hypergradient Descent. To address the resulting scalability bottleneck associated with large Fisher matrices, we approximate the required inverse-Fisher-vector product using a streaming spectral sketch, avoiding explicit construction of the Fisher matrix. We evaluate our approach against a first-order stochastic bilevel baseline across discrete- and continuous-control environments. The results demonstrate competitive policy performance and strong reward-ranking quality, while Fisher sketching reduces curvature-storage complexity and can improve computational efficiency relative to an explicit Fisher solver.