When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models
作者: Mehak Gupta, Tanmoy Chakraborty
分类: cs.CV, cs.CL
发布日期: 2026-08-19
💡 一句话要点
探讨安全对视觉语言模型生成行为的影响
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 安全对齐 多模态学习 生成行为 内部解码动态 激活干预 感知基础 拒绝行为
📋 核心要点
- 现有的视觉语言模型在安全约束下,常常选择不回答可以正确回答的问题,影响了模型的实用性。
- 论文通过研究安全引发的拒绝行为,探讨了视觉证据在解码过程中的影响,提出了针对性激活干预的解决方案。
- 实验结果表明,抑制拒绝相关表示能够有效恢复模型的基础回答行为,展示了安全对齐的潜在问题。
📝 摘要(中文)
对齐的视觉语言模型(VLMs)旨在平衡基于视觉的推理与安全生成行为。然而,在安全约束指令下,模型经常选择不回答在默认指令下仍然可以正确回答的问题。本文探讨了安全引发的拒绝行为背后的内部解码动态,发现尽管模型拒绝回答,视觉证据在解码过程中仍然受到影响,表明感知基础在很大程度上得以保留。通过有针对性的激活干预,抑制与拒绝相关的表示可以可靠地恢复模型的基础回答行为,而无需重新训练或修改视觉输入。此研究揭示了对齐VLMs中一个未被充分探讨的失败模式:安全对齐可能会覆盖基于视觉的表达,即使感知证据仍然在内部保留。
🔬 方法详解
问题定义:本文解决的问题是安全对齐如何影响视觉语言模型的生成行为,特别是模型在安全约束下拒绝回答可回答问题的现象。现有方法未能充分理解这一拒绝行为的内在机制。
核心思路:论文的核心思路是研究安全引发的拒绝行为背后的内部解码动态,探讨视觉证据在解码过程中的保留情况,并通过激活干预来恢复基础回答行为。
技术框架:研究采用多种模型架构和多模态基准进行实验,分析不同架构中拒绝行为的表现,并通过激活干预调整模型的隐藏状态动态。
关键创新:最重要的技术创新在于揭示了安全对齐如何在不改变视觉输入的情况下,影响模型的生成行为,尤其是拒绝回答的动态过程。
关键设计:在实验中,设计了针对性的激活干预策略,抑制与拒绝相关的表示,确保模型能够恢复基础的回答能力,且不需要重新训练模型。具体的参数设置和损失函数设计未在摘要中详细说明。
🖼️ 关键图片
📊 实验亮点
实验结果显示,通过抑制拒绝相关表示,模型的基础回答行为得以恢复,且这一过程无需重新训练或修改视觉输入。这一发现表明,安全对齐的影响可以通过特定的激活干预有效缓解,展示了模型在拒绝行为中的潜在灵活性。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动问答系统和人机交互等场景。通过改善视觉语言模型的生成行为,可以提升这些系统的安全性和用户体验,确保在安全约束下仍能提供准确的信息。未来,研究成果可能推动更智能的多模态交互技术的发展。
📄 摘要(原文)
Aligned vision-language models (VLMs) are designed to balance grounded visual reasoning with safe generation behavior. However, we observe a striking phenomenon: under safety-constrained instruction, models frequently abstain from answering questions that remain correctly answerable under default instruction despite receiving identical image-question inputs. This raises a fundamental question: does safety alignment suppress perceptual grounding itself, or does visual evidence remain internally available while generation is redirected toward abstention? In this work, we investigate the internal decoding dynamics underlying safety-induced abstention in aligned VLMs. Across multiple architectures and multimodal benchmarks, we show that abstained generations remain consistently influenced by visual evidence throughout decoding, indicating that perceptual grounding is largely preserved despite refusal behavior. We further demonstrate that, although the representational organization of refusal differs substantially across architectures, safety-constrained instruction consistently alters late-stage hidden-state dynamics toward refusal-oriented decoding. Finally, through targeted activation-level interventions, we show that suppressing refusal-related representations reliably restores grounded answering behavior across models without retraining or modifying visual inputs. Together, these findings reveal a previously underexplored failure mode in aligned VLMs: safety alignment can override grounded visual expression even when perceptual evidence remains internally preserved.