NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

📄 arXiv: 2608.23959v1 📥 PDF

作者: Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

分类: cs.CR, cs.AI, cs.IR, cs.LG

发布日期: 2026-08-25

备注: To appear in EMNLP 2026 (Findings)


💡 一句话要点

提出NeuronGuard以增强大型语言模型的安全性对齐

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 安全性对齐 监狱攻击 神经元级攻击 KL散度正则化 动态识别 防御机制

📋 核心要点

  1. 现有大型语言模型在面对监狱攻击和神经元级攻击时,安全性对齐表现脆弱,容易被绕过。
  2. NeuronGuard通过重新分配安全信号,增强了模型对多种攻击的抵御能力,动态识别安全关键神经元。
  3. 实验结果显示,NeuronGuard在多种设置下几乎实现零攻击成功率,同时保持任务性能,展现出显著的防御效果。

📝 摘要(中文)

大型语言模型(LLMs)的安全性对齐在面对多种攻击时仍显脆弱。监狱攻击通过精心设计的提示绕过安全机制,而神经元级攻击则在部署后直接修剪安全关键神经元。这两种攻击都利用了一个共同的弱点:安全相关信息集中在稀疏的神经元子集上。本文提出了NeuronGuard,这是一种在微调阶段的防御机制,通过在更广泛的神经元集上重新分配安全信号,增强LLMs对这两类攻击的抵御能力。NeuronGuard通过定期更新的每层线性分类器动态识别安全关键神经元,强制在故意神经元消融下表现拒绝行为,并应用KL散度正则化以保持分布一致性。实验结果表明,NeuronGuard在三种LLM、六种最先进的攻击策略和多模态设置下,几乎实现了零攻击成功率,同时保持了任务准确性,包括对抗白盒自适应对手的能力。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在面对监狱攻击和神经元级攻击时的安全性脆弱性。现有方法往往依赖于稀疏的神经元集,导致安全性对齐不够稳固。

核心思路:NeuronGuard的核心思路是通过在更广泛的神经元集上重新分配安全信号,增强模型的安全性。通过动态识别安全关键神经元,确保在神经元消融情况下仍能保持拒绝行为。

技术框架:NeuronGuard的整体架构包括三个主要模块:动态识别模块、拒绝行为强制模块和KL散度正则化模块。动态识别模块使用定期更新的线性分类器来识别安全关键神经元,拒绝行为强制模块确保在神经元消融时模型表现出拒绝行为,而KL散度正则化模块则用于保持分布一致性。

关键创新:NeuronGuard的主要创新在于其通过重新分配安全信号来增强模型的安全性,解决了现有方法中安全信息集中在稀疏神经元的问题。这种方法显著提高了对多种攻击的抵御能力。

关键设计:在设计上,NeuronGuard采用了定期更新的每层线性分类器来动态识别安全关键神经元,并使用KL散度作为损失函数来确保安全信号的分布一致性。此外,随机梯度投影策略用于在防御与任务目标之间解决冲突,确保下游任务的效用。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,NeuronGuard在三种大型语言模型和六种最先进的攻击策略下,几乎实现了零攻击成功率(ASR),同时保持了任务准确性。这一成果显示出NeuronGuard在抵御白盒自适应对手方面的强大能力,显著提升了模型的安全性。

🎯 应用场景

NeuronGuard的研究成果具有广泛的应用潜力,尤其是在需要高安全性的自然语言处理任务中,如自动客服、内容生成和信息检索等领域。通过增强大型语言模型的安全性,该方法能够有效防止潜在的安全威胁,提高模型在实际应用中的可靠性和安全性,未来可能对AI系统的安全标准制定产生深远影响。

📄 摘要(原文)

Safety alignment in large language models (LLMs) remains brittle against a growing spectrum of attacks. Jailbreak attacks bypass safety mechanisms through crafted prompts, while neuron-level attacks directly prune safety-critical neurons post-deployment. Both exploit a common weakness: safety-relevant information concentrates in a sparse neuron subset. We present NeuronGuard, a fine-tuning-stage defense that simultaneously hardens LLMs against both attack classes by redistributing safety signals across a broader set of neurons. NeuronGuard dynamically identifies safety-critical neurons via periodically refreshed per-layer linear classifiers, forces refusal behavior under deliberate neuron ablation, and applies KL-divergence regularization for distributional consistency. A randomized gradient projection strategy preserves downstream task utility by resolving conflicts between the defense and task objectives. We provide a formal guarantee that NeuronGuard strictly reduces the attack success rate (ASR) upper bound, and experiments across three LLMs, six state-of-the-art attack strategies, and multimodal settings confirm near-zero ASR while maintaining task accuracy, including against white-box adaptive adversaries.