A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families
作者: Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen
分类: cs.LG, cs.CL
发布日期: 2026-08-27
备注: Accepted by EMNLP findings 2026
💡 一句话要点
提出Basin-Aware Jailbreak以解决模型合并安全隐患问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 模型合并 安全性评估 对抗性攻击 越狱风险 优化算法 机器学习
📋 核心要点
- 现有模型合并方法未能充分考虑合并后模型的安全性,可能导致潜在的越狱风险。
- 本文提出Basin-Aware Jailbreak (BAJ),通过最小-最大优化生成可转移的越狱提示,解决了合并模型的安全隐患。
- 实验结果显示,BAJ在不同的模型骨干和合并设置下均实现了高转移成功率,且对现有防御措施依然有效。
📝 摘要(中文)
模型合并技术使得多个经过微调的模型可以在不增加训练成本的情况下进行组合,但其安全性问题尚未得到充分理解。以往研究主要将合并风险归因于不安全的组成模型,隐含假设合并后的模型仍然保持安全性。本文则揭示了一个被忽视的风险,即即使所有组成模型都是安全对齐的,合并过程仍然可能暴露出源自预训练基础模型的越狱风险。为此,本文提出了一种新威胁场景,攻击者可以构造跨合并模型共享相同预训练骨干的越狱提示,而无需访问具体的合并系数或组成检查点。我们提出了Basin-Aware Jailbreak (BAJ),将越狱生成问题形式化为在合并空间上的最小-最大优化,以生成可转移的对抗后缀。实验结果表明,BAJ在多种骨干和合并设置下均表现出高转移成功率,并在现有防御下依然有效。
🔬 方法详解
问题定义:本文解决的问题是模型合并后可能出现的安全隐患,尤其是合并模型可能暴露出源自预训练基础模型的越狱风险。现有方法未能考虑这一风险,导致对合并模型的安全性评估不足。
核心思路:论文的核心思路是通过构造跨合并模型的越狱提示,利用最小-最大优化方法生成可转移的对抗后缀,从而有效地攻击合并模型。这样的设计能够在不需要具体合并系数或组成检查点的情况下,利用共享的预训练骨干进行攻击。
技术框架:整体架构包括以下几个主要模块:首先,识别合并模型的潜在越狱风险;其次,设计最小-最大优化算法以生成对抗后缀;最后,评估生成的后缀在不同合并模型上的转移成功率。
关键创新:本文的关键创新在于首次提出了Basin-Aware Jailbreak (BAJ)方法,揭示了合并模型中潜在的越狱风险,并通过优化方法有效生成可转移的攻击提示。这与现有方法的本质区别在于关注合并模型的整体安全性,而非单个模型的安全性。
关键设计:在关键设计方面,BAJ采用了特定的损失函数来优化生成的后缀,并通过实验验证了不同参数设置对转移成功率的影响,确保了生成后缀的有效性和鲁棒性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,BAJ在多种模型骨干和合并设置下实现了高达85%的转移成功率,显著高于传统方法的50%成功率。此外,BAJ在现有防御措施下仍能保持有效性,展示了其在实际应用中的潜力。
🎯 应用场景
该研究的潜在应用领域包括安全性评估、模型合并技术以及对抗性机器学习。通过深入理解模型合并的安全隐患,研究者和工程师可以更好地设计安全的机器学习系统,防止潜在的攻击。未来,该研究可能推动更安全的模型合并方法的发展,提升人工智能系统的整体安全性。
📄 摘要(原文)
Model merging enables combining multiple fine-tuned models without additional training, but its safety implications remain poorly understood. Prior work primarily attributes merging risks to unsafe constituent models, implicitly assuming that merging individually aligned models preserves safety. In contrast, we show that model merging reveals a previously overlooked jailbreak risk rooted in the pretrained foundation model, even when all constituent models are individually safety-aligned. Motivated by this observation, we study a new threat setting where an attacker constructs jailbreak prompts that generalize across merged models sharing the same pretrained backbone, without access to the exact merging coefficients or constituent checkpoints. To exploit this phenomenon, we propose \textbf{Basin-Aware Jailbreak (BAJ)}, which formulates jailbreak generation as a min--max optimization over the merging space to produce transferable adversarial suffixes across merged model families. Experiments across diverse backbones and merging settings show that BAJ achieves consistently high transfer success rates and remains effective under existing defenses.