ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

📄 arXiv: 2608.30197v1 📥 PDF

作者: Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim

分类: cs.CL, cs.SE

发布日期: 2026-08-31

备注: Accepted at EMNLP 2026 Main Conference


💡 一句话要点

提出ALTSTEER以解决安全引导中的拒绝问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 安全引导 语言模型 推理框架 选择性干预 建设性重定向 有害请求响应 模型评估

📋 核心要点

  1. 现有安全引导方法在触发机制上不稳定,且往往导致僵化的拒绝而非建设性指导。
  2. ALTSTEER通过选择性干预和拒绝锚定的建设性重定向相结合,提供了一种新的推理时框架。
  3. 实验结果显示,ALTSTEER在保持无害效用的同时,显著改善了模型对有害请求的响应行为。

📝 摘要(中文)

安全对齐是部署大型语言模型的关键,要求系统在防止有害响应的同时保持对无害请求的帮助。激活引导提供了一种无训练的推理时安全控制方法,但有效的安全引导需要解决两个相互关联的问题:何时干预以及干预后如何塑造生成内容。现有的安全引导方法在这两个方面都存在局限性,触发机制在不同领域中可能不稳定,而以拒绝为导向的引导往往导致僵化的拒绝,而非建设性的安全指导。为了解决这些局限性,我们提出了ALTSTEER,这是一种推理时框架,将选择性干预与基于拒绝的建设性重定向结合在单次推理过程中。ALTSTEER使用内部拒绝相关信号来决定何时进行引导,并应用分阶段引导将生成内容从拒绝导向控制转向建设性替代方案。对Llama-3.1和Qwen2.5的评估表明,ALTSTEER在保持无害效用的同时改善了建设性安全完成行为,尤其是在那些倾向于对有害请求产生短暂拒绝的模型上。

🔬 方法详解

问题定义:本论文旨在解决安全引导中的拒绝问题,现有方法在触发机制和生成内容的引导上存在不稳定性和僵化性。

核心思路:ALTSTEER的核心思路是结合选择性干预与拒绝锚定的建设性重定向,通过内部信号判断何时进行引导,从而实现更灵活的响应。

技术框架:ALTSTEER的整体架构包括两个主要模块:选择性干预模块和建设性重定向模块。选择性干预模块根据内部信号判断是否需要干预,而建设性重定向模块则负责将生成内容从拒绝导向转向建设性替代方案。

关键创新:ALTSTEER的创新在于将选择性干预与拒绝锚定的重定向结合在一起,形成了一个单次推理过程中的综合框架,这与现有方法的分离处理方式有本质区别。

关键设计:ALTSTEER采用了内部拒绝相关信号作为干预触发的依据,设计了分阶段的引导策略,以确保生成内容的灵活性和建设性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,ALTSTEER在Llama-3.1和Qwen2.5模型上显著改善了建设性安全完成行为,尤其是在对有害请求的响应中,模型的短暂拒绝率显著降低,提升幅度达到XX%(具体数据未知)。

🎯 应用场景

ALTSTEER的研究成果具有广泛的应用潜力,特别是在需要安全响应的对话系统、智能助手和自动内容生成领域。通过改善模型对有害请求的响应,ALTSTEER能够提升用户体验并降低潜在风险,未来可能在各类智能应用中得到广泛应用。

📄 摘要(原文)

Safety alignment is essential for deploying large language models, requiring systems to prevent harmful compliance while preserving helpfulness on benign requests. Activation steering offers a training-free inference-time approach to safety control, but effective safety steering requires addressing two coupled questions: when to intervene and how generation should be shaped after intervention. However, existing safety steering methods remain limited along both dimensions, as their triggering mechanisms can be unstable across domains and refusal-oriented steering often yields rigid refusals rather than constructive safe guidance. To address these limitations, we propose ALTSTEER, an inference-time framework that couples selective intervention with refusal-anchored constructive redirection within a single inference pass. ALTSTEER uses an internal refusal-relevant signal to decide when to steer, and applies staged steering to shift generation from refusal-oriented control toward constructive alternatives. Evaluations on Llama-3.1 and Qwen2.5 show that ALTSTEER preserves benign utility while improving constructive safe-completion behavior, especially on models that otherwise tend to produce short refusals for harmful requests.