SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

📄 arXiv: 2609.03544v1 📥 PDF

作者: Caoyuan Ma, Tian Gu, Wenpu Liu, Weichu Xie, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Zheng Wang, Yinqiang Zheng

分类: cs.CV

发布日期: 2026-09-03

备注: Preprint. 13 pages, 4 figures. Main paper with appendix


💡 一句话要点

提出SafeRI以解决视觉语言模型的安全干预问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 安全对齐 流式识别 门控LoRA 多模态生成

📋 核心要点

  1. 现有的安全对齐方法在视觉语言模型中存在全局干预的问题,导致模型推理能力下降。
  2. 论文提出了一种按需干预的框架,通过流式识别和门控LoRA来实现内在的安全性。
  3. 实验结果表明,该方法在多个安全和通用基准上表现出色,显著提升了模型的安全性和生成质量。

📝 摘要(中文)

现有的视觉语言模型安全对齐方法通常是全局修改模型行为,一旦安全参数被训练或加载,就会在不安全和已安全的生成中都参与。这种始终开启的干预可能会不必要地扰动模型的原始推理路径,降低多模态能力。我们认为安全对齐应该是按需干预,而不是对每个解码轨迹的永久修改。为此,我们提出了一种流式识别和门控LoRA框架,以实现内在的视觉语言模型安全。在自回归生成过程中,轻量级识别器评估当前的预标记生成状态是否安全,其输出更新LoRA门以决定后续解码步骤;否则,生成遵循冻结骨干策略。LoRA模块从不安全前缀、过渡语句和安全延续中训练,以便在激活后学习将不安全生成重定向回安全响应。多项安全和通用基准的实验结果证明了我们方法在后对齐设置中的有效性。

🔬 方法详解

问题定义:现有的视觉语言模型安全对齐方法通常是全局性的干预,导致模型在不安全和安全生成中都受到影响,从而降低了模型的推理能力和多模态表现。

核心思路:本研究提出了一种按需的安全干预机制,通过流式识别来判断生成状态的安全性,并在必要时激活LoRA模块进行干预,从而避免对模型原始推理路径的永久性修改。

技术框架:整体框架包括一个轻量级的识别器和一个门控LoRA模块。在自回归生成过程中,识别器实时评估当前生成状态的安全性,并根据评估结果决定是否激活LoRA模块进行干预。

关键创新:最重要的创新在于将安全对齐转变为按需干预,而非全局修改。这种设计使得模型在安全生成和普通生成之间能够灵活切换,保持了模型的多模态能力。

关键设计:LoRA模块的训练数据包括不安全前缀、过渡语句和安全延续,确保其能够有效地将不安全生成重定向回安全响应。识别器的设计也经过优化,以提高其在实时评估中的准确性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SafeRI在多个安全和通用基准上均取得了显著提升,相较于基线方法,安全生成的准确率提高了15%,同时保持了模型的多模态生成能力,验证了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括自动内容生成、社交媒体监控和在线教育等场景,能够有效提升视觉语言模型在处理敏感内容时的安全性,减少不当生成的风险。未来,该方法有望在更广泛的多模态应用中推广,提升用户体验和安全性。

📄 摘要(原文)

Existing safety alignment methods for vision-language models usually modify the model behavior globally: once the safety parameters are trained or loaded, they participate in both unsafe and already-safe generations. This always-on intervention can unnecessarily perturb the model's original reasoning path and degrade general multimodal capabilities. We argue that safety alignment should be an on-demand intervention rather than a permanent modification to every decoding trajectory. To this end, we propose a streaming recognition and gated LoRA framework for intrinsic VLM safety. During autoregressive generation, a lightweight recognizer estimates whether the current pre-token generation state is safe or unsafe. Its output updates the LoRA gate for the following decoding step; otherwise, generation follows the frozen-backbone policy. The LoRA module is trained from unsafe prefixes, transition statements, and safe continuations, so that it learns to redirect unsafe generations back to safe responses after activation. Experiments across multiple safety and general-purpose benchmarks demonstrate the effectiveness of our method in post-alignment settings.