FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval
作者: Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao
分类: cs.CV, cs.IR
发布日期: 2026-07-30
期刊: Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)
💡 一句话要点
提出FiRE以解决复杂图像检索中的细粒度上下文建模问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 图像检索 细粒度上下文建模 细调策略 零-shot学习
📋 核心要点
- 现有的多模态大语言模型在复杂图像检索任务中表现不足,尤其是在细粒度上下文建模方面。
- 本文提出了一种新的细粒度多模态五元组数据集构建管道和两阶段细调策略,以增强MLLMs的检索能力。
- 在五个数据集上的广泛实验表明,本文方法在零-shot检索中表现优越,且使用了更轻量的MLLM骨干网络。
📝 摘要(中文)
由于多模态大语言模型(MLLMs)在处理和推理方面的强大能力,已显示出作为通用图像检索器的显著潜力。然而,现有研究忽视了细粒度上下文建模和解耦细调目标在提升MLLMs检索性能中的潜力。为此,本文提出了一种自动化的细粒度多模态五元组数据集构建管道和一种新颖的两阶段细粒度多模态细调策略。该数据集生成管道生成了一个全面的细粒度图像检索数据集,促进了细粒度上下文建模。我们的细调过程分为两个阶段,旨在逐步增强模型的上下文理解和查询-目标对齐能力,从而提高检索性能。实验结果表明,在零-shot检索设置下,我们的方法在多个复杂图像检索任务中显著优于现有方法。
🔬 方法详解
问题定义:本文旨在解决复杂图像检索任务中,现有多模态大语言模型(MLLMs)在细粒度上下文建模和检索性能提升方面的不足。现有方法未能充分利用细粒度上下文建模的潜力,导致在长文本到图像检索、视觉对话检索等复杂任务中的表现不佳。
核心思路:论文提出了一种自动化的细粒度多模态五元组数据集构建管道,并设计了两阶段的细调策略。第一阶段专注于细粒度上下文推理,第二阶段则针对细粒度检索进行优化,旨在逐步提升模型的上下文理解和查询-目标对齐能力。
技术框架:整体架构包括数据集生成和细调两个主要模块。数据集生成模块负责创建包含细粒度图像标题和修改文本的CIR数据集,而细调模块则分为两个阶段,分别进行上下文推理和检索优化。
关键创新:最重要的创新在于将细调过程解耦为两个阶段,分别针对不同的任务目标进行优化。这种设计使得模型在复杂任务中的表现显著提升,与现有的单一细调方法形成鲜明对比。
关键设计:在细调过程中,采用了特定的损失函数以优化上下文理解和检索对齐,网络结构则基于轻量级的MLLM骨干网络,确保在保持性能的同时降低计算复杂度。实验中还考虑了不同的超参数设置,以达到最佳效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,本文方法在五个复杂图像检索数据集上均表现出色,尤其在零-shot检索设置下,相较于现有方法,检索性能提升幅度达到了显著的水平,验证了细粒度上下文建模的重要性。
🎯 应用场景
该研究的潜在应用领域包括智能图像检索、视觉问答系统和多模态交互等。通过提升MLLMs在复杂图像检索任务中的表现,能够为用户提供更精准的检索结果,进而推动相关领域的技术进步和应用普及。
📄 摘要(原文)
Due to their strong generalizable multimodal processing and reasoning capabilities, Multimodal Large Language Models (MLLMs) have demonstrated significant potential as universal image retrievers, effectively addressing diverse real-world image retrieval tasks. Nevertheless, pioneering studies, while promising, overlook the potential of fine-grained context modeling and disentangled fine-tuning objectives in enhancing MLLMs' retrieval performance, particularly for complex tasks such as long-text-to-image retrieval, visual dialog retrieval, and composed image retrieval (CIR). Therefore, in this work, we propose an automated fine-grained multimodal quintuple dataset construction pipeline and a novel two-stage fine-grained multimodal fine-tuning strategy. The dataset generation pipeline produces a comprehensive CIR dataset with fine-grained image captions and modification text, facilitating fine-grained context modeling. Beyond the previously entangled fine-tuning paradigm, our approach separates the fine-tuning process into two distinct stages: (1) fine-grained context reasoning-oriented fine-tuning and (2) fine-grained retrieval-oriented fine-tuning. These stages aim to sequentially enhance the model's context understanding and query-target alignment capabilities, thereby improving retrieval performance. Extensive experiments across five datasets encompassing diverse and complex image retrieval tasks demonstrate the remarkable superiority of our method over existing approaches in zero-shot retrieval settings, even with a more lightweight MLLM backbone compared to those methods.