Interpretable reinforcement learning with decision-tree pruning

📄 arXiv: 2608.07151v1 📥 PDF

作者: Mark Leon Ringer, Michel Tokic

分类: cs.LG, cs.AI

发布日期: 2026-08-07


💡 一句话要点

提出决策树修剪方法以提高强化学习的可解释性

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 可解释性 决策树 策略修剪 机器学习 透明性 审计机制

📋 核心要点

  1. 现有的强化学习策略缺乏可解释性,导致信任度不足,难以被广泛应用。
  2. 本文提出了一种修剪机制,通过简化决策树规则来提高策略的可解释性,同时保持其性能。
  3. 在经典控制和MuJoCo基准测试中,修剪后策略的可解释性显著提高,且性能保持在高水平。

📝 摘要(中文)

强化学习策略难以检查,但其可解释性是建立信任的前提。将训练好的策略转化为明确的决策树规则可以提高透明度,但生成的规则往往过于复杂,难以被人理解。本文提出了一种修剪过程,简化规则基础的策略,同时保持任务性能,并使策略的编辑过程可审计。该过程定义了一小组结构和使用感知的操作符,通过重新执行策略来评估候选编辑,从而测量回报和可解释性代理。这一转化过程从复杂的政策结构到紧凑的政策结构。我们在经典控制和MuJoCo基准上研究了这种方法,修剪过程显示出一致的可解释性改善,同时保持高性能。

🔬 方法详解

问题定义:本文旨在解决强化学习策略的可解释性不足问题。现有方法生成的决策树规则往往复杂,难以理解,影响了用户的信任和应用。

核心思路:通过引入修剪过程,简化决策树规则,同时保留策略的任务性能和可审计性。该方法通过定义结构和使用感知的操作符来实现候选编辑的评估。

技术框架:整体流程包括训练强化学习策略、将策略转化为决策树、应用修剪操作、评估修剪后的策略性能和可解释性。主要模块包括策略训练、规则生成、修剪评估和性能验证。

关键创新:最重要的创新在于提出了一种结构化的修剪过程,能够在保持高性能的同时显著提高可解释性。这与现有方法的主要区别在于其关注于可审计的编辑过程。

关键设计:修剪过程中使用了一小组结构和使用感知的操作符,评估候选编辑时通过重新执行策略来测量回报和可解释性代理,确保修剪后的策略仍然有效。具体参数设置和损失函数的设计在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,修剪后的策略在可解释性上有显著提升,具体表现为可解释性代理的提高,同时在经典控制和MuJoCo基准测试中保持高性能,回报率与未修剪策略相当,显示出修剪过程的有效性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、医疗决策支持和金融交易等需要高可解释性的强化学习系统。通过提高策略的可解释性,能够增强用户的信任,从而推动这些领域的实际应用和发展。

📄 摘要(原文)

Reinforcement learning policies are difficult to inspect, but interpreting them is a prerequisite for trustworthiness. Converting a trained policy into explicit decision-tree rules improves transparency and the resulting artifacts often remain too complex for human understanding. We present a pruning process that simplifies such rule-based policies while preserving task performance and making edits to the policy auditable. The process defines a small set of structural and usage-aware operators and evaluates candidate edits by re-executing the policy to measure return and interpretability proxies. This exposes an transformation process from complex to compact policy structures. We investigate this approach on classic control and MuJoCo benchmarks, where pruning traces reveal consistent interpretability improvements while maintaining high performance.