When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning
作者: Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang
分类: cs.CR, cs.AI
发布日期: 2026-09-01
备注: Accepted to the Findings of EMNLP 2026
💡 一句话要点
提出Fisher几何解释以解决大语言模型安全对齐脆弱性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 安全对齐 良性微调 Fisher几何 低秩特性 多层感知机 对抗性训练 模型鲁棒性
📋 核心要点
- 现有研究多将安全对齐失败归因于梯度冲突,但缺乏对其脆弱性本质的深入理解。
- 论文提出了一种基于Fisher几何的解释,认为安全Fisher的低秩特性导致了对齐的脆弱性。
- 实验结果显示,LoRA和ASAM能够在一定程度上减轻安全性崩溃,但在大规模微调时效果减弱。
📝 摘要(中文)
本研究探讨了良性微调如何严重削弱大型语言模型的安全对齐,分析了拒绝行为脆弱性的原因。与以往研究将失败归因于梯度冲突不同,本文提出了一种基于Fisher几何的解释:安全Fisher是低秩的,对齐使安全几何变得更平坦,同时保留了输出路由路径。经过100个良性微调示例后,该路径在输出侧的多层感知机模块中被选择性地重新锐化,解释了不对称脆弱性:安全性可能崩溃至高攻击成功率,而通用效用则轻微下降。最后,研究表明LoRA和ASAM通过抑制输出侧的锐度来减轻早期崩溃,但其保护在较大微调规模下减弱。
🔬 方法详解
问题定义:本研究旨在解决大型语言模型在良性微调下安全对齐脆弱性的问题。现有方法主要将失败归因于梯度冲突,未能深入探讨其根本原因。
核心思路:论文提出了一种新的Fisher几何视角,认为安全Fisher的低秩特性使得对齐过程变得脆弱。通过分析输出路由路径的变化,揭示了安全性崩溃的机制。
技术框架:研究首先定义了安全Fisher的低秩特性,然后通过实验验证了在良性微调后输出侧多层感知机模块的路径变化,最后探讨了LoRA和ASAM的作用机制。
关键创新:最重要的创新在于提出了Fisher几何解释,强调了安全Fisher的低秩特性与对齐脆弱性之间的关系,这与传统的梯度冲突理论有本质区别。
关键设计:研究中使用了特定的损失函数和网络结构,重点关注输出侧多层感知机模块的锐度变化,并通过实验验证了不同微调规模下的安全性表现。
🖼️ 关键图片
📊 实验亮点
实验结果表明,经过100个良性微调示例后,模型的安全性崩溃率显著提高,而通用效用仅轻微下降。此外,LoRA和ASAM在抑制输出侧锐度方面表现出色,但在大规模微调时其保护效果减弱,提示了微调规模对安全性的影响。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性提升、对抗性训练以及模型微调策略的优化。通过深入理解安全对齐的脆弱性,可以为未来的模型设计提供理论支持,增强模型在实际应用中的鲁棒性和安全性。
📄 摘要(原文)
Benign fine-tuning severely weakens the safety alignment of large language models (LLMs), so we study why refusal behavior is so fragile. While prior work often attributes this failure to gradient conflict, we propose a fundamentally different Fisher-geometric explanation: safety Fisher is low-rank, and alignment makes the safety geometry flatter while preserving an output-routing pathway. After 100 benign fine-tuning examples, this pathway is selectively re-sharpened in output-side MLP modules, explaining the asymmetric fragility: safety can collapse to high attack success rates, while general utility degrades mildly. The routing view also explains why few safety examples can restore refusal behavior, indicating that internal safety-relevant representations are preserved. Finally, we show that LoRA and ASAM mitigate early collapse by suppressing output-side sharpness, but their protection weakens at larger fine-tuning scales. Overall, safety failure is best understood as a disruption of a low-rank output-routing mechanism