Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation
作者: Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao
分类: cs.CV, cs.AI
发布日期: 2026-08-21
备注: Findings of EMNLP, 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出Vis-Poison以解决多模态检索增强生成中的视觉知识中毒问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态检索 视觉知识中毒 对抗性攻击 生成模型 安全性评估
📋 核心要点
- 现有的多模态RAG系统在面对中毒视觉证据时存在显著脆弱性,尤其是当攻击者能够直接操控图像内容时。
- 本文提出的Vis-Poison攻击方法通过构建视觉上合理的中毒图像,绕过了对文本元数据的依赖,提供了一种新的攻击方式。
- 实验证明,Vis-Poison在多种模型上表现出色,攻击成功率在黑箱设置下可达65.40%,显示出其有效性和广泛适用性。
📝 摘要(中文)
随着多模态检索增强生成(RAG)系统越来越依赖图像作为外部知识源,注入中毒视觉证据可能严重影响多模态大语言模型(MLLM)的生成。与以往依赖修改文本元数据的攻击不同,本文提出了一种新颖的视觉知识中毒攻击——Vis-Poison,其中被中毒的图像本身是攻击者控制的有效载荷,而不涉及对标题、摘要、元数据或其他相关文本的操控。该攻击通过自动化多代理方法构建视觉上合理的中毒图像。我们在两个代表性多模态RAG管道、四个嵌入模型和六个生成模型上评估Vis-Poison的影响,实验证明其在30k条多模态知识库的黑箱设置下,攻击成功率达到40.16%至65.40%。此外,Vis-Poison在仅依赖参数知识的情况下,对各种MLLM仍然有效,平均成功率超过60%。代码和数据可在https://github.com/SWUFE-DB-Group/Vis-Poison获取。
🔬 方法详解
问题定义:本文旨在解决多模态RAG系统中由于视觉知识中毒导致的生成质量下降问题。现有方法主要依赖于文本元数据的修改,未能有效应对图像内容的直接操控带来的风险。
核心思路:Vis-Poison攻击的核心思想是直接利用被中毒的图像作为攻击载荷,而非依赖文本描述。这种设计使得攻击者能够在不改变文本信息的情况下,影响模型的生成结果。
技术框架:该方法采用自动化多代理系统,构建视觉上合理的中毒图像。整体流程包括图像生成、评估和注入阶段,确保生成的图像在视觉上具有迷惑性。
关键创新:Vis-Poison的最大创新在于其攻击方式的独特性,直接操控图像而非文本,突破了传统攻击方法的局限,提供了一种新的攻击视角。
关键设计:在实现过程中,采用了特定的损失函数来优化图像的视觉特性,并通过多种嵌入模型和生成模型进行验证,确保攻击的有效性和广泛适用性。具体参数设置和网络结构细节在论文中有详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,Vis-Poison在黑箱设置下的攻击成功率高达65.40%,在多种MLLM上平均成功率超过60%。这些结果表明,Vis-Poison在多模态知识库中具有显著的攻击效果,展示了其在实际应用中的潜在威胁。
🎯 应用场景
该研究的潜在应用领域包括安全性评估、对抗性攻击研究以及多模态系统的鲁棒性提升。通过理解和防御Vis-Poison攻击,研究人员可以增强多模态RAG系统的安全性,确保其在实际应用中的可靠性和稳定性。未来,该技术可能推动对抗性机器学习和安全AI的进一步发展。
📄 摘要(原文)
While multimodal retrieval-augmented generation (RAG) systems increasingly rely on images as external knowledge sources, the introduction of poisoned visual evidence can severely compromise multimodal large language model (MLLM) generation. Unlike prior attacks that rely on altering textual metadata, we introduce Vis-Poison, a novel visual knowledge poisoning attack where the poisoned image itself is the attacker-controlled payload, without manipulating captions, summaries, metadata, or other associated text. Specifically, this attack is instantiated through an automated multi-agent method that constructs visually plausible poisoned images. To assess its impact, we evaluate Vis-Poison across two representative multimodal RAG pipelines, four embedding models, and six generation models. Empirically, Vis-Poison achieves an end-to-end attack success rate of 40.16\% to 65.40\% against 30k-entry multimodal knowledge bases in \emph{black-box} settings. Moreover, Vis-Poison remains effective against various MLLMs that can answer correctly from parametric knowledge alone, with an average success rate above 60\%. Code and data are available at https://github.com/SWUFE-DB-Group/Vis-Poison.