MNC: Scope-Bound Semantic Declassification for Private LLM-Agent Communication

📄 arXiv: 2608.01719v1 📥 PDF

作者: Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu

分类: cs.CR, cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出MNC以解决多代理大语言模型的隐私泄露问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐私保护 多代理系统 大语言模型 语义去分类 信息安全 通信协议

📋 核心要点

  1. 现有的隐私保护方法无法有效控制多代理大语言模型的内部信息披露,导致潜在的隐私泄露风险。
  2. 提出最小必要通信(MNC)协议,通过类型化的语义去分类机制,明确控制信息披露的范围和目的。
  3. 实验结果显示,MNC在保持授权交付的同时,有效阻止了未授权的信息转发和存储,提升了隐私保护能力。

📝 摘要(中文)

多代理大语言模型(LLM)系统可能通过内部消息、工具参数、日志和持久内存泄露受保护的状态,尽管其公共输出看似无害。现有的隐私提示、删减方法和源级访问控制仅限制表面内容或数据访问,但未明确合法知情代理应披露的内容及其后续使用方式。本文提出了最小必要通信(MNC),一种类型化的语义去分类协议,从应用作者的候选家族中选择任务所需的披露,并将其绑定到明确的接收者、目的、转发、生命周期、日志和内存范围。参考监视器在后续操作中强制执行这些范围,同时历史感知扩展考虑了重复披露所累积的推理风险。实验结果表明,传统防御措施可以在保持协议级效用的同时,阻止未授权的转发、日志记录、持久存储和过期后检索。

🔬 方法详解

问题定义:本文解决多代理大语言模型在内部通信中可能泄露敏感信息的问题。现有方法如隐私提示和删减技术未能有效限制信息的后续使用,导致隐私风险增加。

核心思路:MNC协议通过类型化的语义去分类,选择任务所需的最小信息披露,并绑定到特定的接收者和目的,从而实现更精细的隐私控制。

技术框架:MNC的整体架构包括信息披露选择模块、范围绑定模块和参考监视器。信息披露选择模块从候选家族中选择合适的披露内容,范围绑定模块确保信息的使用符合预设的目的和范围,参考监视器则在后续操作中强制执行这些范围。

关键创新:MNC的主要创新在于其范围绑定的语义去分类机制,与传统的文本级去分类器相比,MNC能够有效阻止未授权的信息转发和存储,增强了隐私保护的有效性。

关键设计:MNC协议设计了明确的接收者、目的、转发、生命周期、日志和内存范围等参数,确保信息披露的合法性和必要性,同时引入历史感知扩展来评估重复披露的推理风险。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,MNC协议在保持协议级效用的同时,成功阻止了未授权的转发和存储。与传统方法相比,MNC在信息保护方面表现出显著的提升,尤其是在多次披露的情况下,推理风险得到了有效控制。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化客服和多代理系统等,能够有效保护用户隐私,防止敏感信息在多代理交互中被泄露。未来,MNC协议有望在更广泛的人工智能应用中推广,提升信息安全性和用户信任度。

📄 摘要(原文)

Multi-agent large language model (LLM) systems can expose protected state through internal messages, tool arguments, logs, and persistent memory even when their public outputs appear innocuous. Existing privacy prompts, redaction methods, and source-level access controls restrict surface content or data access, but do not specify what a legitimately informed agent should disclose or how that disclosure may be reused downstream. We introduce Minimum-Necessary Communication (MNC), a typed semantic-declassification protocol that selects a task-sufficient disclosure from an application-authored candidate family and binds it to explicit recipient, purpose, forwarding, lifetime, logging, and memory scopes. A reference monitor enforces these scopes across subsequent operations, while a history-aware extension accounts for inference risk accumulated over repeated disclosures. Controlled semantic-join, memory, probing, and longitudinal experiments show that conventional defenses can preserve protocol-level utility while exposing substantial additional inference signal. Under identical receipt text, MNC preserves authorized delivery while blocking unauthorized forwarding, logging, durable storage, and retrieval after expiration that a text-only semantic declassifier permits. Two-backbone MAGPIE executions further show that mediated disclosures propagate through subsequent planning, tool use, coordination, and memory retrieval. These results support scope-bound semantic declassification as a practical communication boundary for private LLM-agent systems.