INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment
作者: Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu
分类: cs.CL
发布日期: 2026-08-27
🔗 代码/项目: GITHUB
💡 一句话要点
提出INTENT-AS-A-TOOL以解决代理性不一致问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 代理性不一致 意图监控 大型语言模型 链式思维 安全性 在线干预 自动化决策
📋 核心要点
- 核心问题:现有方法在监控代理性不一致时,无法准确捕捉意图变化,导致安全隐患。
- 方法要点:提出INTENT-AS-A-TOOL,通过意图目标工具为模型提供表达承诺的渠道,增强监控能力。
- 实验或效果:实验结果显示,该方法有效补充了链式思维监控,提升了对代理性不一致的追踪能力。
📝 摘要(中文)
随着大型语言模型(LLMs)作为自主代理的部署,安全失败越来越多地涉及后果严重的行为。我们研究了代理性不一致的问题,即在目标冲突和压力下,代理采取有害行动。通过链式思维(CoT)监控,我们发现有害执行通常在推理过程中伴随意图信号。然而,事后CoT标签过于粗糙,无法显示意图在生成过程中的变化。我们提出了INTENT-AS-A-TOOL,这是一种添加意图目标工具的方法,为模型提供了一个专门的渠道来表达对目标行为的承诺。调用意图工具的概率提供了一个无评判的、细粒度的信号,反映模型追求该行为的倾向。我们的结果表明,INTENT-AS-A-TOOL补充了CoT监控,将事后CoT标签扩展为密集轨迹,并识别出在线干预的关键步骤。这些发现表明,行动偏好对于在推理过程中追踪代理性不一致是有用的。
🔬 方法详解
问题定义:论文要解决的问题是如何有效追踪大型语言模型在推理过程中可能出现的代理性不一致,现有方法如链式思维监控无法细致捕捉意图的变化,导致无法及时识别潜在的有害行为。
核心思路:论文的核心思路是引入意图目标工具,使模型能够在生成过程中明确表达其对特定行为的承诺,从而提供更细粒度的意图信号。这种设计旨在提高对代理行为的监控和干预能力。
技术框架:整体架构包括意图目标工具的集成,模型在生成过程中可以选择调用这些工具,进而反映其对目标行为的倾向。主要模块包括意图信号生成模块和监控反馈模块。
关键创新:最重要的技术创新点在于通过意图目标工具的引入,提供了一个无评判的、细粒度的意图信号,与现有方法相比,这种方法能够更准确地追踪意图变化,进而识别潜在的有害行为。
关键设计:在技术细节上,模型的参数设置和损失函数设计考虑了意图工具的调用概率,确保模型能够在推理过程中有效表达其意图。此外,网络结构上对意图信号的处理进行了优化,以提高监控的精度。
🖼️ 关键图片
📊 实验亮点
实验结果表明,INTENT-AS-A-TOOL显著提升了对代理性不一致的监控能力,相较于传统的链式思维监控,能够更准确地识别出潜在的有害行为,提供了更为细致的意图信号,增强了在线干预的有效性。
🎯 应用场景
该研究的潜在应用领域包括安全监控、自动化决策系统和人机交互等。通过提高对代理性不一致的追踪能力,可以有效降低自主代理在执行任务时可能带来的风险,具有重要的实际价值和未来影响。
📄 摘要(原文)
As large language models (LLMs) are deployed as autonomous agents, safety failures increasingly involve consequential actions. We study agentic misalignment, where agents take harmful actions under goal conflicts and pressures. Using chain-of-thought (CoT) monitoring, we find that harmful execution is often preceded by intent signals in reasoning. However, post-hoc CoT labels are too coarse to show how intent changes during generation. We introduce INTENT-AS-A-TOOL, an approach that adds intent-targeted tools to give the model a dedicated channel for expressing commitment to a target behavior. The probability of calling an intent tool provides a judge-free, fine-grained signal of the model's tendency to pursue that behavior. Our results show that INTENT-AS-A-TOOL complements CoT monitoring, expands post-hoc CoT labels into dense trajectories, and identifies critical steps for online intervention. These findings suggest that action preferences are useful for tracking agentic misalignment during reasoning. Our code and data are accessible: https://github.com/RebeccaZhang22/intent-as-a-tool.