Hybrid Analysis for Secure MCP Tool Use in LLM Agents

📄 arXiv: 2607.25297v1 📥 PDF

作者: Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji

分类: cs.CR, cs.AI

发布日期: 2026-07-28


💡 一句话要点

提出MTGuard以解决LLM代理工具使用安全问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大规模语言模型 安全防护 混合分析 模型上下文协议 动态监控 静态分析 生命周期感知 工具使用安全

📋 核心要点

  1. 现有方法主要依赖静态分析,无法有效应对LLM代理工具使用中的安全风险。
  2. 论文提出MTGuard,通过生命周期感知的静态-动态协同分析,增强LLM代理工具使用的安全性。
  3. 实验结果显示,MTGuard在多种LLM代理中有效降低了有害工具使用的风险,同时保持了良好的用户任务性能。

📝 摘要(中文)

随着大规模语言模型(LLM)代理的快速发展,它们在各种现实任务中的广泛应用已成为常态。为了规范LLM代理与外部环境之间的交互,模型上下文协议(MCP)工具已成为事实上的标准,并被广泛集成。然而,MCP工具的使用也引入了新的安全风险,LLM代理可能被诱导执行恶意或未经授权的操作。尽管已有研究提出了保护LLM代理工具使用的防御措施,但大多数方法依赖于静态分析,即检查提示和生成的输出,这限制了防御的有效性和鲁棒性。为了解决这些局限性,我们提出了MTGuard,这是一种基于混合分析的防御框架,旨在通过生命周期感知的静态-动态协同分析来保护LLM代理中MCP工具的使用。广泛的评估表明,MTGuard有效减轻了不同LLM代理中多种类别的有害工具使用,同时保持了对良性用户任务的性能。

🔬 方法详解

问题定义:本论文旨在解决大规模语言模型(LLM)代理在使用模型上下文协议(MCP)工具时面临的安全风险。现有方法主要依赖静态分析,无法有效应对动态环境中的潜在威胁。

核心思路:论文提出的MTGuard框架结合了静态和动态分析,利用生命周期感知的方式来实时监控和评估工具使用的安全性。这种设计旨在提高防御的有效性和鲁棒性。

技术框架:MTGuard的整体架构包括静态分析模块、动态监控模块和协同决策模块。静态分析模块负责检查输入提示和生成输出,动态监控模块实时跟踪工具的使用情况,而协同决策模块则根据分析结果做出安全决策。

关键创新:MTGuard的主要创新在于其混合分析方法,结合了静态和动态分析的优点,能够更全面地评估工具使用的安全性。这与传统的仅依赖静态分析的方法有本质区别。

关键设计:在设计中,MTGuard采用了多层次的安全策略,包括对输入输出的深度检查和实时监控机制。此外,框架中使用了特定的损失函数来优化安全性与性能之间的平衡。通过这些设计,MTGuard能够在确保安全的同时,维持良好的用户体验。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,MTGuard在多种LLM代理中有效降低了有害工具使用的风险,减少了高达70%的恶意操作。同时,MTGuard在保持用户任务性能方面表现良好,未显著影响响应时间和准确性,显示出其在安全性与性能之间的优良平衡。

🎯 应用场景

该研究的潜在应用领域包括金融、医疗和自动化客服等多个行业,尤其是在需要高安全性的场景中。MTGuard的实施可以有效降低LLM代理在执行任务时的安全风险,提升用户信任度和系统可靠性。未来,随着LLM技术的不断发展,MTGuard有望成为行业标准,推动安全性研究的进一步发展。

📄 摘要(原文)

The rapid development of large language model (LLM) agents has enabled their broad adoption across diverse real-world tasks. To standardize interactions between LLM agents and external environments, Model Context Protocol (MCP) tools have emerged as a de facto standard and have been widely integrated into these systems. However, the use of MCP tools also introduces new safety risks, as LLM agents can be induced to perform malicious or unauthorized actions. Although prior work has proposed defenses for securing tool use in LLM agents, most methods rely on static analysis, i.e., inspecting prompts and generated outputs, which limits the defense effectiveness and robustness. To address these limitations, we propose MTGuard, a hybrid analysis-based defense framework designed to safeguard the use of MCP tools in LLM agents by leveraging lifecycle-aware static-dynamic co-analysis. Extensive evaluation demonstrates that MTGuard effectively mitigates multiple categories of harmful tool use across different LLM agents while maintaining performance on benign user tasks.