PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
作者: Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He
分类: cs.CV, cs.AI, cs.CL, cs.MM
发布日期: 2026-08-20
期刊: Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil
💡 一句话要点
提出PEA-DPO以解决多模态偏好优化中的视觉不敏感问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态对齐 直接偏好优化 视觉不敏感性 感知增强 大型语言模型 幻觉现象 视觉信号提取
📋 核心要点
- 现有的直接偏好优化方法在多模态设置中存在视觉不敏感性,导致模型无法有效区分重要的视觉信息。
- PEA-DPO框架通过引入视觉偏好信号,旨在增强多模态LLMs的对齐能力,克服视觉不敏感性问题。
- 实验结果表明,PEA-DPO在多个基准测试中显著提高了多模态对齐效果,并有效减少了幻觉现象。
📝 摘要(中文)
直接偏好优化(DPO)已成为将大型语言模型(LLMs)与人类偏好对齐的有效方法。然而,其在多模态环境中的适应性尚未得到探索。通过表征分析,本文识别出多模态偏好优化中的一个关键限制,称为视觉不敏感性:模型常常无法区分图像及其关键视觉上下文被移除的情况。理论分析进一步揭示了这一问题的两个表现形式,即跨图像不敏感性和图像内不敏感性。为了解决这些挑战,本文提出了感知增强对齐DPO(PEA-DPO),该框架明确利用视觉偏好信号来克服视觉不敏感性。实验证明,PEA-DPO增强了对视觉上下文的敏感性,同时保持了基础模型的语言建模能力。
🔬 方法详解
问题定义:本文旨在解决多模态偏好优化中的视觉不敏感性问题,现有方法未能有效区分图像及其重要视觉上下文的缺失,导致对齐效果不佳。
核心思路:PEA-DPO框架通过显式利用视觉偏好信号,增强模型对视觉信息的敏感性,从而改善多模态对齐效果。
技术框架:PEA-DPO的整体架构包括数据预处理、视觉信号提取、偏好信号整合和模型训练四个主要模块,确保模型能够有效学习多模态信息。
关键创新:PEA-DPO的核心创新在于引入视觉偏好信号,显著提升了模型对视觉上下文的敏感性,与传统DPO方法相比,能够更好地处理多模态数据。
关键设计:在模型设计中,采用了特定的损失函数来平衡语言和视觉信息的学习,同时优化了网络结构以提高对视觉特征的提取能力。通过这些设计,PEA-DPO能够在保持语言建模能力的同时,增强视觉信息的利用。
🖼️ 关键图片
📊 实验亮点
实验结果显示,PEA-DPO在三个幻觉基准测试中表现优异,相较于基线模型,显著提高了多模态对齐效果,并减少了幻觉现象,验证了其有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括多模态内容生成、图像描述生成和人机交互等场景。通过提高模型对视觉信息的敏感性,PEA-DPO能够在实际应用中提供更准确的多模态理解和生成能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Direct Preference Optimization (DPO) has emerged as an effective approach for aligning large language models (LLMs) with human preferences. However, its adaptation to multimodal settings remains unexplored. Through representational analysis, we identify a key limitation in multimodal preference optimization, which we term visual insensitivity: models often fail to distinguish between images and those with critical visual context removed. Our theoretical analysis further uncovers two manifestations of this problem, namely Across-Image Insensitivity and Within-Image Insensitivity. To address these challenges, we propose Perception-Enhanced Alignment DPO (PEA-DPO), a framework for multimodal LLMs alignment, which explicitly leverages visual preference signals to overcome visual insensitivity. We further provide a theoretical analysis demonstrating that PEA-DPO provably mitigates both failure modes. Empirical results demonstrate that PEA-DPO enhances sensitivity to visual context while preserving the language modeling capacity of the base model. Evaluations across three hallucination benchmarks using MLLMs of varying scales show that PEA-DPO effectively mitigates visual insensitivity, achieves stronger multimodal alignment, and substantially reduces hallucinations.