MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities
作者: Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu
分类: cs.CR, cs.AI, cs.MM
发布日期: 2026-08-26
💡 一句话要点
提出MMJailBench以解决多模态大型语言模型的监狱突破脆弱性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大型语言模型 监狱突破 脆弱性评估 因素分解 安全审计
📋 核心要点
- 现有基准测试未能清晰区分多模态大型语言模型的监狱突破脆弱性来源,导致理解不足。
- 本文提出MMJailBench,通过系统性变化和组合影响因素,提供细粒度的比较与归因能力。
- 实验结果显示,监狱突破脆弱性在不同模型和伤害领域间差异显著,提示框架是主要变异来源。
📝 摘要(中文)
多模态大型语言模型(MLLMs)在实际应用中越来越普遍,但不同因素如何影响其监狱突破脆弱性仍不甚明了。现有基准测试往往将有害意图、提示框架、视觉语义和指令载体耦合在单个监狱突破实例中,模糊了观察到的脆弱性的具体来源。为了解决这一局限性,本文提出MMJailBench,一个系统性变化和组合这些因素的分解基准,能够进行细粒度比较和因素级归因。对16个开放权重和专有MLLMs的大规模评估揭示了高度异质和模型依赖的脆弱性特征。
🔬 方法详解
问题定义:本文旨在解决多模态大型语言模型的监狱突破脆弱性来源不明确的问题。现有方法将多个因素耦合在一起,导致无法单独分析各因素对脆弱性的影响。
核心思路:论文提出MMJailBench,通过分解影响因素并在受控配置下进行组合,允许对脆弱性进行细粒度的比较和归因,从而更好地理解不同因素的作用。
技术框架:MMJailBench的整体架构包括多个模块,首先是因素分解模块,其次是组合测试模块,最后是评估与分析模块。每个模块负责不同的任务,确保系统性评估。
关键创新:最重要的技术创新在于分解基准的设计,使得各因素的影响可以被独立评估。这与现有方法的耦合设计形成鲜明对比,提供了更清晰的脆弱性来源分析。
关键设计:在设计中,采用了多种评估指标和配置选项,确保评估的可重复性和可扩展性。同时,针对不同模型的特性,设计了轻量级和完整的评估配置,以适应不同的审计需求。
🖼️ 关键图片
📊 实验亮点
实验结果表明,监狱突破脆弱性在不同模型和伤害领域间存在显著差异,提示框架被识别为主要变异来源。具体而言,某些视觉语义提示显著提高了脆弱性,而视觉指令的效果则不如直接文本指令。整体评估显示,当前多模态安全对不同领域的覆盖不均。
🎯 应用场景
该研究的潜在应用领域包括安全审计、模型评估和多模态系统的安全性提升。通过提供系统化的评估工具,MMJailBench能够帮助开发者识别和修复模型中的脆弱性,从而提高多模态应用的安全性和可靠性。未来,该方法可能推动更广泛的多模态安全研究与实践。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) are increasingly deployed in real-world applications, yet how different factors shape their jailbreak vulnerabilities remains poorly understood. Existing benchmarks often couple harmful intent, prompt framing, visual semantics, and instruction carrier within individual jailbreak instances, obscuring the specific sources of observed vulnerabilities. To address this limitation, we introduce MMJailBench, a factorized benchmark that systematically varies and combines these factors under controlled configurations, enabling fine-grained comparison and factor-level attribution. Large-scale evaluations across 16 open-weight and proprietary MLLMs reveal highly heterogeneous and model-dependent vulnerability profiles. Jailbreak vulnerability varies markedly across harm domains, exposing uneven coverage in current multimodal safety alignment. Prompt framing emerges as the dominant source of variation, task-relevant visual semantics systematically increase jailbreak susceptibility with authority-like cues exposing particularly pronounced vulnerabilities, and visually rendered instructions do not consistently increase jailbreak susceptibility relative to direct textual instructions. To further investigate the risks introduced by multimodal context, we conduct diagnostic analyses on a representative open-weight model and identify vulnerability-associated patterns in internal representations and cross-modal interactions. Finally, we develop a modular multimodal jailbreak evaluation suite with full and lightweight configurations, multiple judge options, and multidimensional metrics, enabling reproducible, scalable, and cost-efficient multimodal jailbreak auditing.