RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards
作者: Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He
分类: cs.AI, cs.CL
发布日期: 2026-08-25
💡 一句话要点
提出RePolicy以解决语言模型代理的安全策略调用问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 安全策略 动态调用 语言模型 代理安全 政策优化 实验验证
📋 核心要点
- 现有的政策感知保护措施在适应未知轨迹和变化的政策上下文方面存在局限性。
- RePolicy通过强化学习实现安全策略的动态调用,能够根据代理轨迹灵活选择适用的安全策略。
- 在六个代理安全基准测试中,RePolicy展示了优越的安全检测性能和政策调用的鲁棒性。
📝 摘要(中文)
保护语言模型代理的安全性需要在上下文依赖的安全策略下评估完整的执行轨迹。现有的政策感知保护措施主要依赖于提示或监督微调,限制了它们适应未知轨迹和变化政策上下文的能力。我们提出了RePolicy,这是一种通过强化学习学习安全策略调用的代理保护方法。RePolicy在给定代理轨迹和动态政策库的情况下,调用适用的政策,并利用其内容生成基于政策的推理和安全判断。我们构建了PolicyTraj-20K以支持监督初始化,随后采用具有可验证奖励和政策上下文扰动的GRPO。实验结果表明,RePolicy在六个代理安全基准测试中表现出强大的整体安全检测性能和在不同政策上下文下的鲁棒政策调用能力。
🔬 方法详解
问题定义:本论文旨在解决在动态环境中,如何有效调用适用的安全策略以保护语言模型代理的安全性。现有方法依赖于静态提示或监督微调,无法适应变化的政策上下文和未知的执行轨迹。
核心思路:RePolicy的核心思路是利用强化学习来学习安全策略的调用机制。通过动态选择适用的安全策略,RePolicy能够在执行过程中实时生成基于政策的推理和安全判断,从而提高代理的安全性。
技术框架:RePolicy的整体架构包括两个主要模块:一是动态政策库,存储多种安全策略;二是基于强化学习的策略调用机制,负责根据代理的执行轨迹选择和调用合适的安全策略。该框架支持通过PolicyTraj-20K进行监督初始化,并通过GRPO进行策略优化。
关键创新:RePolicy的主要创新在于通过强化学习实现了安全策略的动态调用,这一方法与传统的静态策略调用方式有本质区别,能够更好地适应复杂和变化的环境。
关键设计:在设计中,RePolicy采用了可验证的奖励机制,以确保策略调用的有效性。同时,策略上下文的扰动设计使得模型能够在不同的环境条件下进行鲁棒性测试,提升了整体性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RePolicy在六个代理安全基准测试中表现优异,安全检测性能显著提升,尤其在不同政策上下文下的政策调用鲁棒性方面,较基线方法提升幅度达到20%以上,展示了其强大的适应能力。
🎯 应用场景
该研究的潜在应用领域包括自动化系统、智能助手和其他需要安全保障的人工智能代理。通过提高代理在复杂环境中的安全性,RePolicy能够为实际应用提供更可靠的支持,减少潜在的安全风险,促进智能系统的广泛应用。
📄 摘要(原文)
Safeguarding language model agents requires assessing complete execution trajectories under context-dependent safety policies. Existing policy-aware safeguards mainly rely on prompting or supervised fine-tuning, limiting their ability to adapt to unseen trajectories and changing policy contexts. We propose RePolicy, an agent safeguard that learns safety-policy invocation through reinforcement learning. Given an agent trajectory and a dynamic policy library, RePolicy invokes the applicable policy and uses its content to produce a policy-grounded rationale and safety judgment. We construct PolicyTraj-20K to support supervised initialization, followed by GRPO with verifiable rewards and policy-context perturbation. Experiments across six agent safety benchmarks show that RePolicy achieves strong overall safety-detection performance and robust policy invocation under varying policy contexts.