MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

📄 arXiv: 2607.27637v1 📥 PDF

作者: Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

分类: cs.CV

发布日期: 2026-07-30

备注: project page:https://zhuwenjie98.github.io/MMOOC-project-page/


💡 一句话要点

提出MMOOC基准以解决多模态大语言模型的上下文评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 上下文评估 基准测试 图像-问题对 模型稳健性

📋 核心要点

  1. 现有的多模态大语言模型在处理上下文变化时表现不佳,尤其是在拒绝不相关问题和回答相关问题之间的平衡。
  2. 本文提出MMOOC基准,包含大量图像-问题对,专注于评估模型在不同上下文变化下的拒绝和回答能力。
  3. 实验结果显示,当前模型在变化上下文下仍存在显著的性能不足,后训练可以提升模型的稳健性。

📝 摘要(中文)

多模态大语言模型(MLLMs)在视觉-语言任务上表现出色,但在不完美或变化的上下文中常常失败。一个可靠的MLLM应能拒绝真正的上下文外(OOC)问题,同时回答具有非主题上下文变化的变化内(Shifted IC)问题。现有基准主要关注OOC或视觉上无法回答的问题,忽略了可回答的Shifted IC情况,并且覆盖的OOC变化有限。为填补这一空白,本文提出了MMOOC,一个用于评估MLLM拒绝和稳健回答能力的大规模基准。MMOOC包含超过41K的图像-问题对,涵盖三种问题格式、八种变化类型和六种视觉场景,数据质量通过MLLM过滤和人工验证确保。实验表明,当前模型在变化上下文下仍难以平衡回答能力和拒绝率。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在上下文变化情况下的评估问题,现有方法未能有效处理可回答的Shifted IC情况和多样化的OOC变化。

核心思路:提出MMOOC基准,通过构建包含多种上下文变化的图像-问题对,来全面评估MLLM的拒绝和回答能力,确保模型在不同情境下的可靠性。

技术框架:MMOOC基准包含41K图像-问题对,涵盖三种问题格式、八种变化类型和六种视觉场景。数据质量通过MLLM过滤和人工验证,确保了基准的有效性。评估指标包括准确率和拒绝率,并引入LLM-as-a-Judge指标来评估模型推理的正确性。

关键创新:MMOOC基准的创新在于其全面性,涵盖了可回答的Shifted IC情况和多样化的OOC变化,填补了现有基准的空白。

关键设计:在数据构建过程中,采用了MLLM过滤和人工验证相结合的方式,确保数据的高质量。此外,评估过程中引入了新的评估指标,以更好地反映模型的推理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前多模态大语言模型在变化上下文下的回答能力和拒绝率之间存在显著的矛盾,后训练方法能够有效提升模型的稳健性,具体性能数据和提升幅度尚待进一步验证。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、教育技术和人机交互等。通过提升多模态大语言模型在复杂上下文中的表现,MMOOC基准将推动相关技术的实际应用,提升用户体验和系统的可靠性。

📄 摘要(原文)

Multimodal Large Language Models (MLLMs) have achieved strong performance on a wide range of vision-language tasks, but often fail under imperfect or shifted contexts. A reliable MLLM should refuse truly out-of-context (OOC) questions with subject-level context shifts while still answering shifted in-context (Shifted IC) questions with non-subject context shifts. Existing benchmarks mainly target OOC or visually unanswerable questions, but overlook answerable Shifted IC cases and cover limited OOC shifts. To fill this gap, we present MMOOC, a large-scale benchmark for evaluating refusal and robust answering abilities of MLLMs. MMOOC contains over 41K image-question pairs, including answerable Shifted IC cases and unanswerable OOC cases, spanning three question formats, eight shift types and six visual scenarios, with data quality ensured through MLLM-based filtering and human verification. We evaluate model responses using Accuracy and Refusal Rate, and further introduce an LLM-as-a-Judge metric to assess the correctness of model reasoning. Experiments on diverse MLLMs show that current models still struggle to balance answer-ability and refusal under shifted contexts. We further analyze key failure patterns and show that post-training can improve robustness. MMOOC will be made publicly available.