Fine-Grained Multi Image Object Hallucination Benchmark
作者: Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee
分类: cs.CV, cs.AI, cs.LG
发布日期: 2026-08-31
备注: Accepted at CVPR 2026
期刊: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 18295-18305
💡 一句话要点
提出MIOH基准以解决多图像对象幻觉问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大型语言模型 对象幻觉 多图像推理 评估基准 视觉复杂性 深度学习 人工智能
📋 核心要点
- 现有的多模态大型语言模型在多图像场景中面临对象幻觉问题,生成的描述缺乏事实一致性。
- 本文提出MIOH基准,通过细粒度评估对象幻觉,涵盖多种推理模式和任务,填补现有评估的空白。
- 实验结果表明,当前最先进的模型在不同任务和推理模式下存在明显的失败模式,揭示了对象表示整合阶段的局限性。
📝 摘要(中文)
多模态大型语言模型(MLLMs)在需要复杂视觉推理的多图像场景中越来越多地被部署。然而,当前的MLLMs在生成对象描述时存在对象幻觉问题,即生成看似合理但在事实上一致性不足的描述。现有基准主要针对单图像设置或仅提供高层次的多图像评估,无法系统性地诊断视觉复杂性和推理需求如何触发幻觉。为了解决这一问题,本文提出了MIOH,一个细粒度的多图像对象幻觉基准,通过四个基础任务(存在性、计数、属性、位置)和三种多图像推理模式(综合、比较、选择)在三种控制的对抗压力下(视觉上下文规模、感知难度、上下文偏见)系统评估对象幻觉。通过对29个模型的评估,我们发现即使是最先进的系统如GPT-5和Gemini-2.5-Pro在不同的推理模式和任务中也表现出明显的失败模式。
🔬 方法详解
问题定义:本文旨在解决多模态大型语言模型在多图像场景中产生对象幻觉的问题。现有方法主要集中于单图像评估,无法有效诊断视觉复杂性和推理需求对幻觉的影响。
核心思路:MIOH基准通过细粒度的评估框架,系统性地考察对象幻觉,涵盖存在性、计数、属性和位置四个基础任务,结合综合、比较和选择三种推理模式。
技术框架:MIOH的整体架构包括任务定义、评估标准和对抗压力控制。每个任务通过不同的推理模式进行评估,确保全面覆盖多图像场景的复杂性。
关键创新:MIOH的主要创新在于其细粒度的评估方式,能够揭示对象幻觉的根本原因,尤其是在对象表示整合阶段的局限性,与现有方法的高层次评估形成鲜明对比。
关键设计:在设计上,MIOH设置了多种对抗压力,如视觉上下文规模和感知难度,以确保评估的全面性和准确性。同时,采用了多种推理模式,以便更好地理解模型在不同情境下的表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,29个模型在MIOH基准下表现不一,尤其是GPT-5和Gemini-2.5-Pro在不同推理模式和任务中展现出明显的失败模式。这表明,当前最先进的模型在处理多图像场景时仍存在显著的对象幻觉问题,亟需进一步改进。
🎯 应用场景
MIOH基准的提出为多模态AI系统的开发提供了重要的评估工具,能够帮助研究人员更好地理解和改进模型在复杂视觉场景中的表现。其潜在应用领域包括自动驾驶、智能监控和人机交互等,未来有望推动更可靠的多模态系统的实现。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) are increasingly deployed in multi-image scenarios requiring complex reasoning across visual contexts. However, current MLLMs remain fundamentally limited by object hallucination-generating plausible yet factually inconsistent descriptions about objects. Existing benchmarks, designed primarily for single-image settings or providing only high-level multi-image assessments, cannot systematically diagnose how visual complexity and reasoning demands trigger hallucination. To address this gap, we introduce MIOH, a fine-grained multi-image object hallucination benchmark that systematically evaluates object hallucination across four foundational tasks (existence, counting, attribute, position) through three multi-image reasoning patterns (comprehensive, comparative, selective) under three controlled adversarial pressures (visual context scale, perceptual difficulty, contextual bias). Through evaluation of 29 models, we reveal that even state-of-the-art systems like GPT-5 and Gemini-2.5-Pro exhibit distinct failure patterns across different reasoning patterns and tasks. Our evaluation reveals that hallucination stems not merely from perceptual failures but from integration-stage limitations when maintaining object representations across multiple images. MIOH provides a controlled framework for analyzing multi-image object hallucination and serves as a critical evaluation tool for developing more reliable multimodal AI systems.