Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers
作者: Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang
分类: cs.CV
发布日期: 2026-07-30
备注: 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP
💡 一句话要点
提出见证证据组合以解决闭合多模态答案的风险检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大型语言模型 风险检测 视觉答案 证据组合 可解释性
📋 核心要点
- 现有方法在判断视觉答案的可信度时,缺乏对置信度评分来源和分布的深入理解,导致风险检测不够可靠。
- 本文提出的见证证据组合(WEP)通过逐层分析视觉贡献,利用可解释的路径族来评估答案的可信度,提供更为透明的决策依据。
- 实验结果显示,WEP在多个基准上显著提升了模型的性能,平均错误AP提高了0.134,所有测试组合均表现出正向提升。
📝 摘要(中文)
多模态大型语言模型(MLLMs)的可靠部署需要判断视觉答案的可信度。现有的置信度评分无法揭示估计的视觉读数的来源及其分布。本文研究了闭合视觉答案的推理时风险检测,提出了见证证据组合(WEP),通过逐层估计支持或反驳预测候选的视觉贡献,并通过问题相关证据来源和签名证据集中两个可解释的路径族进行总结。WEP不需要图像扰动、解码变化、反向传播或外部验证器。在三个MLLM和四个二元答案基准上,WEP将平均错误AP提高了0.134,所有12个模型-数据集组合均有正向提升。
🔬 方法详解
问题定义:本文旨在解决闭合多模态视觉答案的风险检测问题。现有方法的痛点在于置信度评分无法揭示视觉读数的来源及其分布,导致对答案的可信度判断不够准确。
核心思路:论文提出的见证证据组合(WEP)通过逐层分析视觉贡献,识别支持或反驳预测候选的证据,利用可解释的路径族来总结这些贡献,从而提高风险检测的可靠性。
技术框架:WEP的整体架构包括两个主要模块:问题相关证据来源和签名证据集中。通过嵌套分组验证选择更可靠的路径族,并结合候选置信度生成稀疏的top-k路径组合。
关键创新:WEP的主要创新在于其白盒推理过程,能够在不需要图像扰动或外部验证的情况下,直接利用模型内部信息进行风险检测。这与现有方法的黑箱特性形成鲜明对比。
关键设计:WEP的设计中,关键参数包括证据来源和证据集中路径的选择,以及如何通过嵌套分组验证来优化路径组合。该方法不依赖于图像扰动、解码变化或反向传播,确保了高效性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,WEP在三个多模态大型语言模型和四个二元答案基准上均取得了显著提升,平均错误AP提高了0.134,所有12个模型-数据集组合均表现出正向提升,且在10对图像集群引导下的引导区间均为正值,显示出WEP的有效性和可靠性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、医疗影像分析和智能监控等场景。在这些领域中,准确判断视觉答案的可信度至关重要,WEP的提出将有助于提高系统的安全性和可靠性,推动多模态模型的实际应用。未来,WEP可能会与其他模型结合,进一步提升多模态系统的智能水平。
📄 摘要(原文)
Reliable deployment of multimodal large language models (MLLMs) requires deciding whether a confident visual answer should be trusted, reviewed, or routed to a stronger system. Confidence scores capture candidate margins, but not where the estimated signed visual readouts associated with those margins come from or how they are distributed. We study inference-time risk detection for closed visual answers using the same white-box prefill path that produces the answer. Witness Evidence Portfolios (WEP) first estimates, layer by layer, which visual contributions support or contradict the predicted candidate. It summarizes these contributions through two interpretable route families: question-related evidence provenance and signed evidence concentration. Nested grouped validation chooses the more reliable family and a sparse top-k route portfolio, which is fused with candidate confidence. WEP needs no image perturbation, decoding change, backward pass, or external verifier. Across three MLLMs and four binary-answer benchmarks, WEP improves mean error AP by 0.134. All 12 model--dataset gains are positive, and image-cluster bootstrap intervals are strictly positive on 10 pairs. WEP targets white-box closed-answer systems and uses a labeled calibration slice.