ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
作者: Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye
分类: cs.CR, cs.CL
发布日期: 2026-08-12
备注: Work in Progress
💡 一句话要点
提出ToolHazard以解决LLM代理的安全评估与对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗环境 大型语言模型 安全评估 自动化合成 智能代理 注入攻击 环境模拟
📋 核心要点
- 现有方法在对抗环境的构建上依赖人工实现,缺乏可扩展性,限制了安全研究的广度。
- ToolHazard通过自动化合成对抗环境,减少人工干预,支持扩展,提升了环境构建的效率和灵活性。
- 实验结果显示,ToolHazard有效揭示了代理的脆弱性,并通过生成的对齐数据显著提高了安全性。
📝 摘要(中文)
大型语言模型(LLM)代理与外部工具集成后,容易受到嵌入环境状态中的间接提示注入攻击。然而,现有研究主要依赖手动实现或重用环境、随机的LLM工具模拟和预定义的注入位置,限制了在更广泛领域的可扩展安全研究。为此,本文提出了ToolHazard,一个可扩展的对抗环境合成框架,减少了人工工程,并支持通过额外的种子领域和计算资源进行扩展。通过环境模拟器、攻击者代理和用户模拟器,ToolHazard合成可执行的状态环境,发现可行的注入点并生成环境特定的有效载荷,构建状态驱动的长时间任务。基于ToolHazard,我们构建了ToolHazard-Bench,用于在复杂工作流和多样化环境攻击下对代理进行压力测试。实验揭示了代理的显著脆弱性,并表明注入时机和位置影响攻击效果。此外,ToolHazard生成的对齐数据在保持良性任务效用的同时,提高了ToolHazard-Bench和AgentDojo的安全性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型(LLM)代理在与外部工具集成时,易受间接提示注入攻击的问题。现有方法在环境构建上依赖于人工实现,缺乏可扩展性,限制了对抗环境的多样性和复杂性。
核心思路:ToolHazard的核心思路是通过自动化合成对抗环境,减少人工工程的需求,并支持通过额外的种子领域和计算资源进行扩展,从而提升安全研究的效率和广度。
技术框架:ToolHazard的整体架构包括三个主要模块:环境模拟器、攻击者代理和用户模拟器。环境模拟器用于合成可执行的状态环境,攻击者代理发现可行的注入点并生成环境特定的有效载荷,用户模拟器则构建状态驱动的长时间任务。
关键创新:ToolHazard的主要创新在于其自动化的环境合成能力和对抗攻击的全面评估,显著不同于现有方法的手动实现和局限性。
关键设计:在设计中,ToolHazard采用了动态生成的环境状态和灵活的注入点选择机制,以适应不同的攻击场景和任务需求。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ToolHazard能够有效揭示代理的脆弱性,注入时机和位置对攻击效果有显著影响。通过ToolHazard生成的对齐数据,安全性在ToolHazard-Bench和AgentDojo上均有显著提升,且保持了良性任务的效用。
🎯 应用场景
ToolHazard的研究成果在安全评估、对抗学习和智能代理的开发中具有广泛的应用潜力。它可以用于提升LLM代理在复杂环境中的安全性,帮助开发更为鲁棒的智能系统,并为未来的安全研究提供新的工具和方法。
📄 摘要(原文)
Large language model (LLM) agents integrated with external tools are vulnerable to indirect prompt injections embedded in environmental states. However, existing studies largely rely on manually implemented or reused environments, stochastic LLM-based tool simulation, and predefined injection locations, limiting scalable security research across broader domains. To bridge this gap, we propose ToolHazard, a scalable adversarial environment synthesis framework that reduces human engineering and supports expansion with additional seed domains and compute. Through an Environment Simulator, an Attacker Agent, and a User Simulator, ToolHazard synthesizes executable stateful environments, discovers viable injection points and generates environment-specific payloads, and constructs state-grounded long-horizon tasks. Based on ToolHazard, we build ToolHazard-Bench for stress-testing agents under complex workflows and diverse environmental attacks. Experiments reveal substantial agent vulnerabilities and show that injection timing and placement affect attack effectiveness. Moreover, ToolHazard-generated alignment data improves security on both ToolHazard-Bench and AgentDojo while preserving benign task utility.