SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning
作者: Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng
分类: cs.CV, cs.AI
发布日期: 2026-08-11
备注: 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap
💡 一句话要点
提出SafeCap以提升大型视觉语言模型的安全性
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 安全对齐 强化学习 多模态安全 图像描述生成 视觉效用 自我描述
📋 核心要点
- 现有大型视觉语言模型在面对视觉输入时容易受到攻击,导致安全对齐失效。
- SafeCap通过强化学习框架,利用自我描述生成安全相关的图像描述,从而提升模型的安全性。
- 在多项基准测试中,SafeCap在安全性平均分上提升了3.7-19.0分,且视觉效用保持不变或有所改善。
📝 摘要(中文)
大型视觉语言模型(LVLMs)仍然容易受到利用视觉输入绕过安全对齐的攻击。本文提出了SafeCap,一个通过学习自我描述来对齐LVLM的强化学习框架。SafeCap训练一个策略模型,首先生成与安全相关的图像描述,然后产生最终答案;该描述通过是否使冻结的语言模型达到安全对齐决策进一步优化。该目标鼓励策略模型暴露与安全响应生成相关的视觉线索,而不仅仅依赖直接拒绝监督。在五个多模态安全基准和六个视觉效用基准上,SafeCap在其预期的DirectCap协议下显著提高了安全性能,四种模型设置下安全平均提升3.7-19.0分,同时保持了相当或更好的视觉效用。在匹配的骨干网络和数据的对比中,SafeCap超越了安全SFT、DPO和SafeGRPO,展示了基于描述的强化学习在多模态安全对齐中的有效性。
🔬 方法详解
问题定义:本文旨在解决大型视觉语言模型在面对视觉输入时容易受到攻击的问题,现有方法在安全对齐方面存在明显不足,容易被绕过。
核心思路:SafeCap的核心思路是通过生成与安全相关的图像描述来引导模型决策,优化安全性,而不仅仅依赖于直接的拒绝监督。
技术框架:SafeCap的整体架构包括两个主要阶段:首先生成安全相关的图像描述,然后基于该描述生成最终答案。描述的质量通过其是否能使冻结的语言模型做出安全对齐的决策来优化。
关键创新:SafeCap的主要创新在于引入了描述介导的强化学习机制,这一机制与传统的安全对齐方法(如安全SFT、DPO等)有本质区别,强调了视觉线索的重要性。
关键设计:在设计中,SafeCap采用了特定的损失函数来优化描述生成的质量,同时保持了与冻结语言模型的有效交互,确保安全性与视觉效用的平衡。
🖼️ 关键图片
📊 实验亮点
在实验中,SafeCap在五个多模态安全基准和六个视觉效用基准上表现出色,安全性平均分提升了3.7-19.0分,且在对比实验中超越了现有的安全SFT、DPO和SafeGRPO方法,证明了其在多模态安全对齐中的有效性。
🎯 应用场景
SafeCap的研究成果在多个领域具有潜在应用价值,尤其是在需要高安全性的视觉识别和交互系统中,如自动驾驶、医疗影像分析和智能监控等。通过提升模型的安全性,能够有效减少误判和潜在的安全风险,推动相关技术的实际应用与发展。
📄 摘要(原文)
Large vision-language models (LVLMs) remain vulnerable to jailbreak attacks that exploit visual inputs to bypass safety alignment inherited from their language backbones. We propose SafeCap, a reinforcement-learning framework that aligns LVLMs through learned self-captioning. SafeCap trains a policy model to first generate a safety-relevant image caption and then produce a final answer; the caption is further optimized by whether it enables a frozen LLM to reach a safety-aligned decision. This caption-mediated objective encourages the policy to expose visual cues relevant to safe response generation rather than relying solely on direct refusal supervision. Across five multimodal safety benchmarks and six vision-utility benchmarks, SafeCap substantially improves aggregate safety performance under its intended DirectCap protocol, with gains of 3.7-19.0 points in safety average across four model settings while maintaining comparable or improved vision utility. Under controlled comparisons on matched backbones and data, SafeCap outperforms safety SFT, DPO, and SafeGRPO, demonstrating the effectiveness of caption-mediated reinforcement learning for multimodal safety alignment.