Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

📄 arXiv: 2608.12158v1 📥 PDF

作者: Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

分类: cs.CV

发布日期: 2026-08-12

备注: Accepted at ECCV2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出C²-DPO以解决多模态大语言模型中的物体幻觉问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 物体幻觉 上下文校准 偏好优化 机器学习 计算机视觉 自然语言处理

📋 核心要点

  1. 现有的多模态大语言模型在生成描述时容易出现物体幻觉,导致生成内容与视觉输入不一致。
  2. 本文提出上下文校准偏好优化(C²-DPO),通过最大化上下文偏好增益(CPG)来增强模型对上下文信息的利用。
  3. 在多个基准测试中,C²-DPO显著降低了幻觉率,相较于基线模型,Qwen2-VL-Instruct-2B的幻觉率降低了36%。

📝 摘要(中文)

多模态大语言模型(MLLMs)在快速发展的同时,仍然存在物体幻觉的问题,生成与视觉输入不一致的合理但错误的描述。直接偏好优化(DPO)通过训练模型偏好非幻觉响应来缓解这一问题,但其是否真正利用了上下文信息仍不明确。为此,本文提出了上下文偏好增益(CPG)这一简单度量,发现更高的CPG与更低的幻觉率一致。为解决DPO在上下文利用上的不足,本文提出了上下文校准DPO(C²-DPO),该方法在保持原有偏好排序的同时,直接最大化CPG。实验结果表明,C²-DPO显著降低了幻觉率,同时保持了推理能力。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型(MLLMs)中物体幻觉的问题,即生成与视觉输入不一致的描述。现有的直接偏好优化(DPO)方法在利用上下文信息方面存在不足,导致幻觉现象依然普遍。

核心思路:论文提出上下文偏好增益(CPG)作为度量标准,评估模型在提供相关上下文时偏好的增强程度。通过直接最大化CPG,C²-DPO能够更有效地利用上下文信息,从而减少幻觉现象。

技术框架:C²-DPO的整体架构包括数据收集、偏好学习和上下文校准三个主要模块。首先收集包含上下文的偏好数据,然后通过优化算法训练模型,最后校准模型以最大化CPG。

关键创新:C²-DPO的核心创新在于其直接最大化上下文偏好增益(CPG),而不是仅依赖于传统的偏好排序。这一方法使得模型在处理上下文信息时更加高效,显著降低了幻觉率。

关键设计:在模型训练中,采用了新的损失函数来优化CPG,同时保持原有的偏好排序。此外,模型结构经过调整,以增强对上下文信息的敏感性,确保在生成描述时更准确地反映视觉输入。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,C²-DPO在多个基准测试中显著降低了幻觉率,特别是在Object HalBench上,Qwen2-VL-Instruct-2B的幻觉率降低了36%。这一提升表明C²-DPO在处理多模态信息时的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动图像描述生成和多模态搜索引擎等。通过减少物体幻觉,C²-DPO能够提高这些系统的准确性和用户体验,未来可能在更广泛的多模态交互场景中发挥重要作用。

📄 摘要(原文)

Multimodal large language models (MLLMs) have made rapid progress, yet they still exhibit object hallucination, generating plausible but incorrect descriptions that are inconsistent with the visual input. Direct Preference Optimization (DPO) mitigates this by training models to prefer non-hallucinated responses over hallucinated ones, and recent efforts further enrich the preference data with relevant context. However, it remains unclear whether DPO actually leverages such context. To investigate this, we propose Contextual Preference Gain (CPG), a simple metric that measures how much a model's preference strengthens when relevant context is provided. We find that higher CPG consistently corresponds to lower hallucination, yet standard DPO and its variants exhibit only limited CPG, indicating that they underutilize contextual information and thus remain prone to hallucination. To address this, we propose Context-Calibrated DPO (C$^2$-DPO), which directly maximizes CPG while preserving the original preference ordering. Across multiple benchmarks, C$^2$-DPO substantially reduces hallucination without compromising general reasoning, relatively reducing the Object HalBench hallucination rate of Qwen2-VL-Instruct-2B by 36%. Code is available at https://github.com/mlvlab/C2-DPO