ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization
作者: Hujian Zhu, Yihao Huang, Felix Juefei-Xu, Xinfeng Li, Peng Zeng, Simeng Qin, Qing Guo, Geguang Pu
分类: cs.CL
发布日期: 2026-08-04
💡 一句话要点
提出ICO框架以优化语义转移越狱攻击效果
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语义转移 越狱攻击 上下文优化 基础模型 安全性测试 对抗性攻击 模型脆弱性
📋 核心要点
- 现有的语义转移越狱攻击在有效性上存在局限,未能充分利用上下文的语义转移能力。
- 本文提出了一种迭代上下文优化(ICO)框架,通过优化上下文特征来提升越狱攻击的成功率。
- 在三个数据集和八个基础模型上的实验结果显示,ICO的平均攻击成功率为74.6%,显著优于现有方法。
📝 摘要(中文)
基础模型在多种任务中取得了显著成功,但仍然存在脆弱性。最近,语义转移越狱攻击作为一种新兴的攻击范式,能够通过用无害替代词替换有害术语来绕过安全机制。然而,现有的语义转移越狱攻击效果有限。本文揭示了这一限制源于对上下文语义转移能力的忽视。通过系统分析,我们发现上下文在诱导语义转移方面具有显著不同的能力。基于此,我们提出了一种黑箱上下文感知的语义转移越狱框架——迭代上下文优化(ICO),并在每次迭代中利用上下文特征和目标模型反馈进行优化。大量实验表明,ICO在八个最先进的基线模型上表现优异,平均攻击成功率达到74.6%。
🔬 方法详解
问题定义:本文旨在解决现有语义转移越狱攻击效果有限的问题,主要痛点在于未能充分利用上下文的语义转移能力。
核心思路:提出的ICO框架通过迭代优化上下文特征,增强其诱导语义转移的能力,从而提高越狱攻击的成功率。
技术框架:ICO框架包括上下文特征提取、模型反馈收集和上下文优化三个主要模块。在每次迭代中,框架根据模型反馈调整上下文。
关键创新:ICO的核心创新在于系统识别和提炼有效上下文的特征,利用这些特征进行上下文的迭代优化,与现有方法相比,显著提升了攻击效果。
关键设计:在设计中,采用了特定的上下文特征提取算法,并结合模型的反馈信息进行动态调整,确保上下文在每次迭代中都能更好地诱导语义转移。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ICO框架在三个数据集和八个基础模型上均表现优异,平均攻击成功率达到74.6%,显著高于八个最先进的基线方法,展示了其在语义转移越狱攻击中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括安全性测试、对抗性攻击研究以及基础模型的安全防护。通过优化越狱攻击的效果,能够帮助研究人员更好地理解模型的脆弱性,从而设计出更为有效的防护机制,提升模型的安全性和鲁棒性。
📄 摘要(原文)
Foundation models have achieved remarkable success across diverse tasks, but they remain vulnerable. To investigate such vulnerabilities, semantic-shift jailbreaks have recently emerged as a promising attack paradigm. They bypass explicit safety mechanisms by replacing harmful terms in original harmful questions with benign alternatives and leveraging contextual information to induce the target model to reinterpret these alternatives as their corresponding harmful concepts. However, existing semantic-shift jailbreaks often achieve limited effectiveness. In this work, we reveal that this limitation arises from overlooking the semantic-shift capability of contexts. Through systematic analysis, we find that contexts exhibit substantially different abilities in inducing semantic shifts: contexts with stronger semantic-shift capabilities are more likely to guide models toward recovering harmful meanings and achieving successful jailbreaks. Based on this finding, we systematically identify and distill the characteristics of effective contexts and propose a black-box context-aware semantic-shift jailbreak framework with Iterative Context Optimization (ICO). In each iteration, ICO leverages these characteristics and feedback from the target model to optimize contexts. Extensive experiments on three datasets and eight target foundation models demonstrate that ICO consistently outperforms eight state-of-the-art baselines, achieving an average attack success rate of 74.6%.