EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

📄 arXiv: 2608.23313v1 📥 PDF

作者: Xuetong Li, Gaofeng Liu

分类: cs.AI

发布日期: 2026-08-24


💡 一句话要点

提出EviSafe框架以解决视觉语言模型安全评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 安全评估 多模态学习 证据基础 反事实分析 自然语言处理 机器学习

📋 核心要点

  1. 现有的视觉语言模型安全评估方法仅关注最终响应,无法判断模型是否因正确原因而安全,存在评估盲点。
  2. EviSafe框架通过结合自然用户行为、证据基础和反事实敏感性,提供了一种全面的安全评估方法,旨在提高模型的安全性理解。
  3. 在对11个视觉语言模型的评估中,发现自然严重性准确率仅为27.6%到52.8%,显示出模型在安全性评估中的不足。

📝 摘要(中文)

视觉语言模型的安全基准通常仅评估最终响应,如拒绝、警告或遵从。然而,这种结果导向的视角无法揭示模型是否因正确的多模态原因而安全。EviSafe框架通过自然用户行为、文本和视觉证据的明确基础,以及对安全关键证据的反事实变化的行为敏感性,提供了一种证据基础的安全评估方法。EviSafeBench作为该框架的控制基准,包含1181个金标准图像-文本场景和2452个针对性的反事实变体,涵盖八个安全领域和八种风险源类型。通过三探针协议对模型进行评估,结果显示所评估的视觉语言模型在安全性方面存在显著差距。

🔬 方法详解

问题定义:本论文旨在解决现有视觉语言模型安全评估方法的不足,尤其是它们无法判断模型是否因正确的多模态原因而安全。现有方法仅关注最终的拒绝或遵从结果,忽视了模型行为背后的多样性和复杂性。

核心思路:EviSafe框架的核心思路是通过自然用户行为、明确的证据基础和对反事实变化的敏感性,全面评估视觉语言模型的安全性。这种设计旨在揭示模型在安全决策中的真实依据,超越简单的拒绝计数。

技术框架:EviSafe框架包括三个主要模块:自然响应评估、证据报告评估和反事实响应评估。每个模块通过特定的提示对模型进行查询,并使用证据意识评估者进行评分。EviSafeBench则提供了1181个金标准场景和2452个反事实变体,涵盖多个安全领域。

关键创新:EviSafe的主要创新在于其证据基础的评估方法,强调了模型决策的多模态依据。这与传统方法的单一结果导向评估形成鲜明对比,提供了更深入的安全性理解。

关键设计:在设计中,EviSafe使用了三探针协议,分别针对自然响应、证据报告和反事实响应进行评估。每个场景都附有金标准安全决策、证据注释和安全响应策略,确保评估的全面性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在对11个视觉语言模型的评估中,自然严重性准确率在27.6%到52.8%之间,放宽的诊断一致性为6.1%到29.3%,而不安全到安全的反事实转变成功率为30.4%到58.4%。这些结果表明,现有模型在安全性方面存在显著不足,强调了EviSafe框架的必要性。

🎯 应用场景

EviSafe框架的潜在应用领域包括自动驾驶、医疗影像分析和人机交互等安全关键领域。通过提供更全面的安全评估,EviSafe能够帮助开发更可靠的视觉语言模型,降低潜在风险,提升用户信任度。未来,该框架有望推动多模态模型的安全标准化和评估方法的改进。

📄 摘要(原文)

Vision-language model safety benchmarks typically evaluate only final responses: whether a model refuses, warns, or complies. This outcome-level view cannot tell whether a model is safe for the right multimodal reason. Safelooking behavior may reflect keyword-triggered refusal, missed visual hazards, or over-refusal of benign-sensitive inputs. We introduce EviSafe, an evidence-grounded framework for VLM safety that jointly evaluates natural user-facing behavior, explicit grounding in textual and visual evidence, and behavioral sensitivity to counterfactual changes in safety-critical evidence. EviSafeBench instantiates the framework as a controlled benchmark with 1,181 gold image-text scenarios and 2,452 targeted counterfactual variants across eight safety domains and eight risk-source types. Each scenario includes a gold safety decision, evidence annotations, a safe-response policy, and counterfactual interventions. The three-probe protocol queries models with natural-response, evidencereporting, and counterfactual-response prompts, then scores them using an evidence-aware judge. Across eleven evaluated VLMs, natural severity accuracy ranges from 27.6% to 52.8%, relaxed diagnostic consistency from 6.1% to 29.3%, and unsafe-to-safe counterfactual transition success from 30.4% to 58.4%. These gaps show that the evaluated VLMs are not reliably safe for the right multimodal reason and motivate evaluation beyond refusal counts.