Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence
作者: Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou
分类: cs.AI
发布日期: 2026-08-21
💡 一句话要点
提出多轮认证鲁棒性框架以提升LLM安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 多轮对话 认证鲁棒性 对抗攻击 安全性
📋 核心要点
- 现有的认证鲁棒性方法仅适用于单轮输入,无法有效应对多轮对话中的攻击,导致安全性界限显著下降。
- 论文提出了多轮认证鲁棒性(MTCR)框架,通过状态对抗MDPs建模对话安全性,定义k轮认证鲁棒性为最坏安全概率。
- 实验结果表明,在ε-有界和Crescendo风格攻击下,六个LLMs的经验安全性均超出认证界限,验证了方法的有效性。
📝 摘要(中文)
大型语言模型(LLMs)易受到多轮越狱攻击,这种攻击逐步操控对话上下文。现有的认证鲁棒性方法仅限于单轮输入,简单的多轮组合导致界限在轮数增加时呈指数级下降。本文提出了多轮认证鲁棒性(MTCR)框架,通过状态对抗马尔可夫决策过程(MDPs)建模对话安全性,并将k轮认证鲁棒性定义为k轮对抗中的最坏安全概率。MTCR包括:通过嵌入空间模式分解实现组合认证,提供比简单乘法更紧的认证下界;$(α,β)$-安全持久性,改善降级率;信息论上界的匹配,确保紧密性;以及结合这些结果的统一算法。对六个LLMs的实验表明,经验安全性始终超过认证界限。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在多轮对话中面临的安全性问题,现有方法在处理多轮输入时表现不佳,导致安全性界限迅速下降。
核心思路:提出多轮认证鲁棒性(MTCR)框架,通过状态对抗马尔可夫决策过程(MDPs)来建模对话的安全性,定义k轮认证鲁棒性为k轮对抗中的最坏安全概率。
技术框架:MTCR框架包括多个模块:组合认证模块通过嵌入空间模式分解实现更紧的认证下界;$(α,β)$-安全持久性模块改善降级率;信息论上界模块确保结果的紧密性;最后是一个统一算法将这些模块结合。
关键创新:最重要的创新在于通过嵌入空间模式分解实现组合认证,显著提高了认证下界的紧密性,与传统的简单乘法方法相比,提供了更优的安全性保证。
关键设计:关键设计包括$(α,β)$-安全持久性参数的选择,确保降级率从$ ext{p}^k$改善到$eta^k$(其中$eta > ext{p}$),并提供可解释的时间估计。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在六个大型语言模型下,经验安全性在ε-有界和Crescendo风格攻击下均超出认证界限,验证了MTCR框架的有效性和实用性,提升幅度显著。
🎯 应用场景
该研究的潜在应用领域包括对话系统、智能客服和其他基于LLM的交互式应用。通过提升多轮对话的安全性,能够有效防止恶意攻击,增强用户信任,推动相关技术的广泛应用。
📄 摘要(原文)
Large language models (LLMs) are vulnerable to multi-turn jailbreak attacks that progressively manipulate conversation context. Existing certified robustness methods are limited to single-turn inputs; naive multi-turn composition yields bounds that degrade exponentially in the number of turns. We introduce Multi-Turn Certified Robustness (MTCR), a framework that models conversational safety via State-Adversarial MDPs and defines $k$-turn certified robustness as the worst-case safety probability across $k$ adversarial turns. MTCR comprises: (i) compositional certification via embedding-space mode decomposition, yielding tighter certified lower bounds than naive multiplication; (ii) $(α,β)$-safety persistence, improving the degradation rate from $\underline{p}^{k}$ to $β^k$ (with $β> \underline{p}$) and yielding interpretable horizon estimates; (iii) matching information-theoretic upper bounds establishing tightness; and (iv) a unified algorithm combining these results. Experiments on six LLMs under $ε$-bounded and Crescendo-style attacks confirm that empirical safety consistently exceeds the certified bounds.