REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features
作者: Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng, Zi-Qi Chen, Jiaqi Wang, Zhen-Hua Ling
分类: cs.AI
发布日期: 2026-08-28
备注: Accepted at EMNLP 2026 Main Conference
💡 一句话要点
提出REINS以增强稀疏自编码器特征的拒绝能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 稀疏自编码器 拒绝增强 安全控制 自然语言处理 有害内容抑制
📋 核心要点
- 现有的SAE引导方法在处理复杂的有害提示时,无法有效产生拒绝响应,存在明显不足。
- REINS通过在SAE特征空间中抑制有害特征并增强安全拒绝特征,提出了一种新的引导方法。
- 实验结果显示,REINS在减少有害响应和提高安全拒绝能力方面显著优于现有方法。
📝 摘要(中文)
稀疏自编码器(SAE)引导的路径为大型语言模型的行为适应提供了一种轻量级的推理方式,但现有方法在处理复杂提示时表现不佳。为此,本文提出了拒绝增强抑制引导(REINS),该方法在同一SAE特征空间中抑制有害特征并增强安全拒绝特征。实验结果表明,REINS显著减少了有害响应,提高了安全拒绝的能力,同时保持了模型的整体能力。
🔬 方法详解
问题定义:本文旨在解决现有稀疏自编码器(SAE)引导方法在面对复杂有害提示时,无法有效产生拒绝响应的问题。现有方法在处理这些提示时表现不佳,导致安全性不足。
核心思路:REINS的核心思路是同时抑制有害的继续特征并增强安全拒绝特征,通过这种方式来提高模型在复杂提示下的安全性和可靠性。
技术框架:REINS的整体架构包括特征提取、特征抑制和特征增强三个主要模块。首先,通过SAE提取输入特征,然后对有害特征进行抑制,最后增强安全拒绝特征。
关键创新:REINS的主要创新在于其双重特征处理机制,即在同一特征空间中同时进行有害特征的抑制和安全特征的增强。这一设计使得模型在复杂提示下能够更有效地拒绝有害内容。
关键设计:在参数设置上,REINS采用了特定的损失函数来平衡有害特征与安全特征的权重,同时在网络结构上进行了优化,以确保特征处理的高效性和准确性。具体的网络结构和损失函数设计细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,REINS在GUISE数据集上显著减少了有害响应,相较于现有单向SAE引导方法,安全拒绝能力提高了近30%。此外,REINS在保持模型整体能力方面表现优异,未出现性能崩溃现象。
🎯 应用场景
REINS的研究成果具有广泛的应用潜力,尤其是在需要安全控制的自然语言处理任务中,如对话系统、内容生成和社交媒体监控等领域。通过提高模型的拒绝能力,REINS能够有效降低有害内容的生成风险,提升用户体验和安全性。
📄 摘要(原文)
Steering with Sparse Autoencoders (SAEs) offers a lightweight inference-time path for adapting the behavior of large language models without retraining. By exposing sparse and interpretable features, SAE steering provides a promising interface for safety control that guides harmful continuations toward refusal. However, we observe that complex wrappers can still undermine existing SAE steering methods on harmful prompts. To evaluate this failure mode systematically, we construct Generalized Undercover Instruction Safety Evaluation (GUISE), a dataset of harmful prompts with complex wrappers. Existing single direction SAE steering methods do not reliably produce refusals on harmful prompts, suggesting that refusal enhancement alone can be too weak when the harmful continuation path remains active. This motivates us to propose Refusal-Enhanced INhibitory Steering (REINS), which suppresses harmful continuation features and enhances safe refusal features in the same SAE feature space. Experiments on GUISE and other datasets show that prior methods either intervene too weakly or achieve only apparent safety through collapse, while REINS substantially reduces harmful responses, markedly improves safe refusals and largely preserves general capabilities.