Same Semantics, Different Outcome: On the Modality Robustness of Multimodal LLMs under Knowledge Conflict
作者: Jungyeon Lee, Yejin Yoon, Taeuk Kim
分类: cs.CL
发布日期: 2026-09-01
备注: Accepted to Findings of EMNLP 2026
💡 一句话要点
研究多模态大语言模型在知识冲突下的鲁棒性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 知识冲突 模态鲁棒性 监督微调 对抗攻击
📋 核心要点
- 现有多模态大语言模型在处理知识冲突时表现出明显的不一致性,影响其鲁棒性和性能。
- 论文通过对多种技术的比较,提出了监督微调(SFT)作为改善模型鲁棒性的有效方法。
- 实验结果显示,SFT在多模态任务中取得了适度的性能提升,强调了对模型训练阶段不一致性的关注。
📝 摘要(中文)
多模态大语言模型(MLLMs)越来越多地接收异构形式的上下文证据,如文本段落和相应的图像。然而,当证据与模型的参数知识发生冲突时,这些表面形式的处理一致性仍不明确。本文研究了13个MLLMs在知识冲突下的模态鲁棒性,发现其鲁棒性远未达到预期。研究表明,模型更倾向于接受与参数知识相矛盾的图像形式,而非文本形式;当矛盾的文本和图像同时出现时,优先选择的模态几乎是任意的,受输入顺序、模型和数据集的影响。此外,这种不稳定性会降低多模态检索增强生成(RAG)的性能,并可能被对抗攻击利用。为缓解这种脆弱性,本文考察了多种简单技术,发现大多数无效,而监督微调(SFT)取得了适度成功。由此,呼吁对这种不一致性给予更多关注,认为其在多个训练阶段都需重视。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在知识冲突情况下的鲁棒性问题。现有方法在处理矛盾证据时表现出不一致性,导致性能下降。
核心思路:论文的核心思路是通过比较不同的技术手段,尤其是监督微调(SFT),来提高模型在知识冲突情况下的表现。设计上强调了对模型训练阶段不一致性的关注。
技术框架:研究首先对13个多模态大语言模型进行评估,使用两个数据集分析其在知识冲突下的表现。接着,应用不同的技术(如提示、引导、SFT等)进行实验,比较其效果。
关键创新:最重要的技术创新点在于揭示了图像形式的证据在知识冲突情况下的优先选择性,挑战了传统观点,并提出了SFT作为有效的解决方案。
关键设计:在实验中,采用了多种参数设置和损失函数来评估模型的表现,特别关注输入顺序对模态选择的影响。
🖼️ 关键图片
📊 实验亮点
实验结果显示,模型在面对知识冲突时,图像形式的证据更易被接受,且在同时提供矛盾文本和图像时,模态选择表现出任意性。监督微调(SFT)在提升模型性能方面取得了适度成功,强调了对训练阶段不一致性的关注。
🎯 应用场景
该研究的潜在应用领域包括多模态信息检索、对话系统和智能助手等。通过提高模型在知识冲突情况下的鲁棒性,可以显著提升这些系统的可靠性和用户体验,具有重要的实际价值和未来影响。
📄 摘要(原文)
Multimodal large language models (MLLMs) are increasingly provided with contextual evidence in heterogeneous forms: as a text passage, as a rendered image of the same passage, or as both together. However, it remains unclear how consistently these surface forms are processed, especially when the evidence conflicts with the model's parametric knowledge. We study modality robustness under knowledge conflict across 13 MLLMs and two datasets, and find them far from robust. (1) Contrary to common belief, models favor a context that contradicts parametric knowledge more readily in image form than in text form; (2) when a contradicting text and image are presented together, the preferred modality is essentially arbitrary, varying with input order, model, and dataset. We further demonstrate that this instability has practical consequences: it degrades performance in multimodal RAG and can be exploited by adversarial attacks. To alleviate this brittleness, we examine several simple techniques---prompting, steering, supervised fine-tuning (SFT), and direct preference optimization; the majority prove ineffective, whereas SFT achieves moderate success. We therefore call for greater awareness of this inconsistency and argue that it is fundamental, demanding attention at multiple training stages.