Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models
作者: Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong
分类: cs.CR, cs.CV
发布日期: 2026-08-27
备注: Accepted by EMNLP 2026 Main Conference
🔗 代码/项目: GITHUB
💡 一句话要点
提出Meta-Adaptive Multimodal Jailbreaking以解决视觉语言模型的安全性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态越狱 视觉语言模型 攻击策略优化 对抗性攻击 模型安全性
📋 核心要点
- 现有的多模态越狱攻击方法在攻击策略和参数上缺乏灵活性,导致攻击效果受限。
- 本文提出的MAMJ通过优化攻击策略提示和攻击者权重,实现了攻击者的自适应调整,增强了攻击的有效性。
- 在实验中,MAMJ在多个视觉语言模型上显著提高了攻击成功率,展示了其优越性和广泛适用性。
📝 摘要(中文)
大型视觉语言模型的安全性正受到多模态越狱的严峻考验,现有攻击方法在元层面上大多是静态的。模板攻击固定了图像与文本的布局,而迭代攻击仅在固定的攻击策略和攻击者参数下调整图像与文本内容。本文提出了Meta-Adaptive Multimodal Jailbreaking (MAMJ),通过优化攻击者本身的攻击策略提示和攻击者权重,提升攻击效果。在MM-SafetyBench上,MAMJ对GPT-4o、Gemini-3-Pro-Preview和Seed 2.0的攻击成功率分别达到了81.0%、78.9%和82.3%,超越最强样本级基线高达24.1个百分点。所学习的攻击者在未见受害者上也能有效转移,且在代表性防御下依然有效。
🔬 方法详解
问题定义:本文旨在解决现有多模态越狱攻击方法在攻击策略和参数上的静态性问题,导致攻击效果不理想。
核心思路:MAMJ通过优化攻击者本身的攻击策略提示(ASP)和攻击者权重(φ),使得攻击者能够在攻击过程中自适应调整,从而提升攻击效果。
技术框架:MAMJ的整体架构包括两个主要模块:首先,使用基于大型语言模型的批评机制来优化攻击策略提示;其次,通过群体聚合的攻击成功率(ASR)奖励来更新攻击者权重。
关键创新:MAMJ的核心创新在于其元自适应的攻击机制,区别于传统的固定策略攻击,能够根据攻击效果动态调整攻击策略和参数。
关键设计:在设计中,攻击策略提示(ASP)和攻击者权重(φ)是通过优化算法进行更新的,具体的损失函数和更新规则在实验中经过精心调试,以确保最佳的攻击效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MAMJ在MM-SafetyBench上对GPT-4o、Gemini-3-Pro-Preview和Seed 2.0的攻击成功率分别达到了81.0%、78.9%和82.3%,相比最强样本级基线提升了高达24.1个百分点,展现了其显著的攻击效果和广泛的适用性。
🎯 应用场景
该研究的潜在应用领域包括对抗性攻击检测、模型安全性评估以及多模态系统的防御机制设计。随着视觉语言模型在实际应用中的广泛使用,提升其安全性将具有重要的实际价值和社会影响。未来,MAMJ的思路可以扩展到其他类型的模型和攻击场景中。
📄 摘要(原文)
The safety of large vision-language models is increasingly stress-tested by multimodal jailbreaks, yet existing attacks remain largely static at the meta level: template-based attacks freeze the image--text layout, while iterative attacks adapt only the image--text content with fixed attack strategies and frozen attacker parameters. We propose Meta-Adaptive Multimodal Jailbreaking (MAMJ), which instead optimizes the attacker itself along two axes: an attack strategy prompt (ASP) $θ$ governing attack iteration and attacker weights $φ$ determining attack effectiveness. Across groups of multimodal attack trajectories, an LLM-based critique first refines $θ$, after which group-aggregated attack-success-rate (ASR) rewards update $φ$. On MM-SafetyBench, MAMJ achieves $81.0\%$, $78.9\%$, and $82.3\%$ ASR against GPT-4o, Gemini-3-Pro-Preview, and Seed 2.0, respectively, outperforming the strongest sample-level baseline by up to $24.1$ percentage points. The learned attacker $(θ^\star,φ^\star)$ also transfers without retraining to unseen victims and remains effective under representative defenses. These results reveal a systemic vulnerability of frontier VLMs to meta-adaptive jailbreaks and motivate defenses against meta-level adversaries. Code is available at https://github.com/Alibaba-VELLDEPTH/MetaJailbreak-VLM.