Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework
作者: Shuyao Xiao, Shengling Wang, Haoyu Niu, Ke Chao, Changwei Xu, Xinran Duan, Chaoyong Jiang
分类: cs.CV
发布日期: 2026-09-02
💡 一句话要点
提出因果驱动评估框架以解析VLM生成过程
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 因果推断 多模态生成 自回归解码 信息源分析 结构因果模型 生成模式诊断
📋 核心要点
- 现有方法主要评估最终答案质量,无法深入理解信息源对生成过程的影响。
- 提出因果和时间评估框架,利用结构因果模型分析视觉输入、问题文本和生成前缀的作用。
- 实验表明QCD和PCD在恢复误差上分别比基线降低34.8%和47.1%,展示了因果驱动轨迹的有效性。
📝 摘要(中文)
随着视觉语言模型(VLMs)在复杂图像和视频理解任务中的应用日益增多,传统评估指标主要关注最终答案的质量,难以揭示不同信息源如何影响生成过程。本文提出了一种因果和时间评估框架,追踪视觉输入、问题文本和生成前缀在自回归解码过程中的演变角色。基于结构因果模型,采用干预和后门调整方法,提出了三种步骤索引的因果驱动指标——视觉因果驱动(VCD)、问题因果驱动(QCD)和前缀因果驱动(PCD),用于表征源特定的生成模式,而无需参考答案。实验结果表明,这些因果驱动轨迹为多模态生成提供了互补的源级诊断。
🔬 方法详解
问题定义:本文旨在解决传统评估指标无法揭示视觉语言模型生成过程中的信息源影响的问题,现有方法缺乏对生成过程的深入分析。
核心思路:通过构建因果和时间评估框架,追踪不同信息源在生成过程中的作用,提供源特定的生成模式分析。
技术框架:整体架构基于结构因果模型,包含视觉输入、问题文本和生成前缀的干预与后门调整,形成视觉因果驱动(VCD)、问题因果驱动(QCD)和前缀因果驱动(PCD)三种指标。
关键创新:提出的因果驱动指标能够在不依赖参考答案的情况下,深入分析生成过程中的信息源影响,显著提升了生成模式的可解释性。
关键设计:采用随机化干预验证方法,设置了不同的参数以优化QCD和PCD的性能,确保指标的准确性和可靠性。实验中使用了多种数据集进行验证,确保了结果的普适性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,QCD和PCD在恢复误差上分别比观察性PMI基线降低了34.8%和47.1%。在VLMBias数据集上,前缀与视觉不平衡得分达到了0.767 AUROC和0.873 AUPRC,成功区分了基于先验与视觉驱动的生成。
🎯 应用场景
该研究的潜在应用领域包括多模态生成任务、图像和视频理解等。通过提供源级诊断,研究成果可以帮助改进VLMs的设计与训练,提升其在实际应用中的表现,未来可能对人机交互、自动内容生成等领域产生深远影响。
📄 摘要(原文)
Vision-language models (VLMs) are increasingly evaluated on complex image and video understanding tasks, yet conventional metrics primarily assess final-answer quality and reveal little about how different information sources shape the generation process. We propose a causal and temporal evaluation framework that traces the evolving roles of visual input, question text, and generated prefixes during autoregressive decoding. Grounded in a Structural Causal Model, we use interventions and backdoor adjustment to derive three step-indexed causal-drive metrics---Visual Causal Drive (VCD), Question Causal Drive (QCD), and Prefix Causal Drive (PCD)---for characterizing source-specific generation patterns without requiring reference answers. Experiments on Qwen3-VL-8B-Instruct across MAVIS, LLaVA-Video-178K, and MiraData, together with cross-model validation on InternVL2-8B, reveal a consistent transition from stronger early question and visual guidance toward increasing reliance on generated prefixes. Randomized-intervention validation shows that QCD and PCD reduce recovery error over observational PMI baselines by 34.8\% and 47.1\%, respectively. On VLMBias, the prefix--visual imbalance score achieves 0.767 AUROC and 0.873 AUPRC for distinguishing prior-driven from visually grounded generations. These results show that causal-drive trajectories provide complementary source-level diagnostics for multimodal generation.