PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

📄 arXiv: 2608.09772v1 📥 PDF

作者: Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

分类: cs.CL

发布日期: 2026-08-10

备注: Under Review


💡 一句话要点

提出PragMatch以解决多模态讽刺检测中的实用不一致性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 视觉-语言模型 讽刺检测 捷径学习 实用推理 基准测试

📋 核心要点

  1. 现有大型视觉-语言模型在多模态讽刺检测中面临挑战,主要依赖表面相关性而非深层理解。
  2. 论文提出PragMatch基准,通过系统性掩蔽识别影响模型预测的捷径线索,评估其对模型性能的影响。
  3. 实验结果表明,注入表面信号显著改变模型预测,揭示了当前LVLM的局限性,并提供了新的评估框架。

📝 摘要(中文)

大型视觉-语言模型(LVLMs)在多模态基准测试中表现出色,但尚不清楚它们是否真正理解图像与文本之间的关系,还是依赖于表面的相关性,即捷径学习。特别是在多模态讽刺检测中,成功的预测依赖于识别实用不一致性,而非简单的图像-文本不匹配。本文提出PragMatch,一个由3000对图像-文本对构成的受控基准,旨在评估多模态实用推理。研究发现,LVLM的预测对词汇、OCR派生和风格线索敏感,注入表面信号会显著改变模型预测,尽管图像-文本关系未变。PragMatch为评估超越表面图像-文本对齐的多模态实用推理提供了系统的测试平台。

🔬 方法详解

问题定义:本文旨在解决大型视觉-语言模型在多模态讽刺检测中的实用不一致性问题,现有方法往往依赖于表面的图像-文本匹配,缺乏对深层语义的理解。

核心思路:提出PragMatch基准,通过构建包含讽刺和字面例子的图像-文本对,系统性地识别和评估影响模型预测的捷径线索。

技术框架:整体架构包括数据集构建、捷径线索识别、注入实验和模型评估四个主要模块。数据集包含3000对图像-文本对,涵盖不同类型的例子。

关键创新:最重要的创新在于通过系统性掩蔽和注入实验,揭示了LVLM对表面信号的敏感性,提供了一种新的评估多模态推理能力的方法。

关键设计:在实验中,采用了多种掩蔽策略和注入方式,评估不同类型的捷径线索(如词汇、OCR派生和风格线索)对模型预测的影响,确保实验的系统性和可重复性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,注入表面信号后,LVLM的预测发生了显著变化,表明模型对词汇和风格线索的敏感性。具体而言,某些注入信号导致预测准确率提高了20%以上,揭示了当前模型在理解深层语义方面的局限性。

🎯 应用场景

该研究的潜在应用领域包括社交媒体内容分析、在线评论理解和人机交互等。通过提高多模态模型对讽刺和隐喻的理解能力,能够增强模型在复杂语言环境中的表现,推动自然语言处理和计算机视觉的结合。未来,PragMatch基准可用于进一步研究多模态推理的深层次机制。

📄 摘要(原文)

Large Vision-Language Models (LVLMs) have demonstrated strong performance on multimodal benchmarks, yet it remains unclear whether they genuinely reason about relationships between images and text or rely on superficial correlations, known as shortcut learning. This question is particularly important for multimodal sarcasm detection, where successful prediction depends on recognizing pragmatic incongruity rather than treating sarcasm as simple image-text mismatch. We introduce PragMatch, a controlled benchmark of 3,000 image-text pairs derived from MMSD2.0, including original sarcastic examples and constructed literal and hard-negative pairs. We identify influential shortcut cues through systematic masking and evaluate their impact through targeted injection experiments. Our results show that LVLM predictions are sensitive to lexical, OCR-derived and stylistic cues, with injected surface signals causing substantial changes in model predictions despite unchanged underlying image-text relationships. Our findings reveal limitations in current LVLMs while PragMatch provides a systematic testbed for evaluating multimodal pragmatic reasoning beyond surface-level image-text alignment.