Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

📄 arXiv: 2608.09931v1 📥 PDF

作者: Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

分类: cs.CV

发布日期: 2026-08-10

备注: BMVC 2026


💡 一句话要点

提出CVPD框架以实现自我蒸馏解决视觉盲点问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉盲点 自我蒸馏 多模态学习 对比监督 深度学习 模型优化 智能系统

📋 核心要点

  1. 现有的自我改进方法主要依赖于粗略的奖励反馈,难以提供细粒度的监督信息。
  2. CVPD框架通过识别视觉盲点,实现了自我蒸馏,利用模型自身的响应生成密集的对比监督。
  3. 在Qwen3-VL-8B-Instruct上,CVPD在多个基准测试中超越了六个自我演化的基线,且没有出现回归现象。

📝 摘要(中文)

多模态大型语言模型(MLLMs)的自我改进通常依赖于奖励驱动的方法,这些方法仅提供粗略的标量反馈。蒸馏提供了一种更丰富的替代方案,通过密集的标记级监督来实现,但在视觉领域通常依赖于外部注释和工具或更强的模型。本文提出的CVPD(对比反事实视觉过程蒸馏)是首个完全自包含的框架,能够实现MLLMs的密集、在线、标记级视觉自蒸馏。CVPD识别出视觉盲点,通过放大某个区域来改变和锐化模型的答案分布,而移除该区域则使全图行为基本不变。这些区域揭示了模型能够编码但在全图条件下未能一致利用的感知信息。我们提出了三门反事实标准,直接从模型的响应中识别这些区域,并将其转化为密集的对比监督进行自蒸馏。

🔬 方法详解

问题定义:本文旨在解决多模态大型语言模型在视觉领域自我蒸馏时缺乏细粒度监督的问题。现有方法通常依赖外部注释或强模型,限制了自我改进的效果。

核心思路:CVPD框架通过识别模型在特定区域的视觉盲点,利用这些区域的对比信息进行自我蒸馏,从而提升模型的表现。这样的设计使得模型能够更好地利用其潜在的感知能力。

技术框架:CVPD的整体架构包括三个主要模块:视觉盲点识别、对比监督生成和自我蒸馏过程。首先,模型通过分析自身的响应来识别盲点区域,然后生成相应的对比监督,最后进行自我蒸馏以优化模型性能。

关键创新:CVPD的核心创新在于其三门反事实标准,能够直接从模型的输出中提取视觉盲点信息,并将其转化为有效的监督信号。这一方法与传统依赖外部信息的蒸馏方法本质上不同。

关键设计:在设计中,CVPD采用了特定的损失函数来优化盲点区域的对比监督,同时确保模型在全图条件下的表现不受影响。网络结构方面,模型通过多层次的特征提取来增强对视觉信息的理解。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CVPD在Qwen3-VL-8B-Instruct上表现优异,超越六个自我演化基线,在OCRBench上提升了3.60分,在MMStar细粒度感知上提升了3.38分,在逻辑推理上提升了3.08分,且在更广泛的多模态基准测试中保持或改善了性能。

🎯 应用场景

该研究的潜在应用领域包括智能视觉系统、自动驾驶、机器人感知等。通过提升多模态模型在视觉任务中的自我学习能力,CVPD能够为这些领域提供更高效的解决方案,推动智能系统的自主决策能力。未来,CVPD可能在更广泛的视觉理解任务中发挥重要作用。

📄 摘要(原文)

Self-improvement for multimodal large language models (MLLMs) is typically driven by reward-based methods that provide only coarse scalar feedback. Distillation offers a richer alternative through dense token-level supervision, but in the visual domain it usually depends on privileged context constructed using external annotations and tools, or stronger models. We introduce \textbf{CVPD} (Contrastive Counterfactual Visual Process Distillation), which, to the best of our knowledge, is the first fully self-contained framework for dense, on-policy, token-level visual self-distillation for MLLMs. CVPD identifies visual blind spots where zooming into a region changes and sharpens the model's answer distribution, while removing the same region leaves the full-image behavior largely unchanged. Such regions reveal perceptual information that the model can encode but fails to consistently utilize under full-image conditioning. We propose a three-gate Counterfactual Criterion that identifies these regions directly from the model's own responses and converts them into dense contrastive supervision for self-distillation. On Qwen3-VL-8B-Instruct, CVPD outperforms six self-evolving baselines across twelve benchmarks, including methods that rely on external GPT-4o supervision, without a single regression. It achieves gains of $+3.60$ on OCRBench, $+3.38$ on MMStar Fine-Grained Perception, and $+3.08$ on MMStar Logical Reasoning, while maintaining or improving performance on broader multimodal benchmarks.