Training Alignment Auditors via Reinforcement Learning

📄 arXiv: 2608.25460v1 📥 PDF

作者: Paul Rosu, Rowan Wang

分类: cs.AI, cs.LG

发布日期: 2026-08-26

备注: 82 pages, 15 figures. Code, prompts, and evaluation data are available at https://github.com/paulrosu11/training-auditing-agents-public


💡 一句话要点

通过强化学习提升大型语言模型审计员的对齐审计能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 对齐审计 强化学习 大型语言模型 自动化审计 行为监测

📋 核心要点

  1. 现有的自动审计员在连贯性调查和审计现实性方面存在不足,难以有效识别潜在的不良行为。
  2. 本文提出通过强化学习训练LLM审计员,利用LLM评判者对调查结果进行全面比较,从而优化审计过程。
  3. 实验结果表明,成对奖励的训练方法显著提高了调查质量和审计现实性,同时假阳性率保持在1%以下。

📝 摘要(中文)

随着前沿模型的对齐审计日益依赖大型语言模型(LLM)审计员来大规模揭示不良行为,现有的自动审计员在连贯调查和审计现实性方面面临挑战。本文通过强化学习改进LLM审计员。在最佳训练环境中,策略调查潜在隐藏行为的目标模型。一个LLM评判者全面比较策略的调查与参考调查,以确定奖励。通过系统的消融实验,我们发现成对奖励相比于逐点奖励能产生更稳健的训练效果,且增加没有隐藏行为的目标有助于维持低假阳性率。训练提升了针对隐藏行为目标的调查质量,揭示未修改生产模型中令人担忧行为的比率,以及审计的现实性,同时假阳性率保持在1%以下。此外,审计能力在不同框架间具有良好的泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有自动审计员在调查连贯性和审计现实性方面的不足,特别是在识别潜在隐藏行为时的挑战。

核心思路:通过强化学习训练LLM审计员,利用LLM评判者对调查结果进行全面比较,以优化审计效果和降低假阳性率。

技术框架:整体架构包括一个策略网络用于调查目标模型,一个LLM评判者用于评估调查结果,以及奖励机制以指导训练过程。

关键创新:最重要的创新在于使用成对奖励机制,相比传统的逐点奖励,成对奖励能够提供更稳健的训练信号,从而提升审计员的性能。

关键设计:在训练过程中,设置了多个参数以优化策略网络的学习,包括奖励函数的设计,以及在训练环境中引入没有隐藏行为的目标以降低假阳性率。通过系统的消融实验验证了这些设计的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用成对奖励的训练方法相比于传统方法显著提高了审计员的调查质量,针对隐藏行为的调查质量提升明显,且假阳性率保持在1%以下,展示了良好的审计现实性和泛化能力。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的安全性审计、AI系统的行为监测以及自动化合规检查等。通过提升审计员的能力,可以更有效地识别和修正模型中的不良行为,从而增强AI系统的可靠性与安全性,对未来的AI治理具有重要影响。

📄 摘要(原文)

Alignment auditing of frontier models increasingly relies on LLM auditors to surface undesirable behaviors at scale, but current automated auditors can struggle with coherent investigation and audit realism. In this work, we improve LLM auditors with reinforcement learning. In our best training environment, the policy investigates target models that potentially possess hidden behaviors planted via their system prompt. An LLM judge, which knows whether the target has a hidden behavior, holistically compares the policy's investigation to a reference investigation to determine the reward. With systematic ablations, we find that pairwise rewards yield more robust training compared to pointwise rewards, and that adding targets without planted behaviors helps maintain a low false positive rate. Training improves investigation quality against targets with planted behaviors, the rate of concerning behaviors surfaced in unmodified production models, and audit realism, while false-positive rates stay below 1%. Furthermore, auditing capabilities generalize across scaffolds: performance on AuditBench's adversarially fine-tuned targets substantially improves [Sheshadri et al., 2026].