CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
作者: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu, Pengjun Xie, Yilun Zhao, Shu Wu
分类: cs.CV, cs.AI, cs.CL, cs.IR
发布日期: 2026-09-03
💡 一句话要点
提出CORE以改善MLLM嵌入模型的组合推理能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 组合推理 MLLM嵌入 重排序 蒸馏训练 Rank-KL目标 多层次监督 图像检索 自然语言处理
📋 核心要点
- 现有的MLLM嵌入模型在组合检索中表现不足,无法有效区分相似场景的细微差别。
- 论文提出CORE,通过蒸馏重排序器的判断来增强嵌入模型的组合推理能力,采用Rank-KL目标进行训练。
- 实验结果显示,CORE在多个基准测试中表现优异,尤其在组合推理任务上超越了对比学习方法。
📝 摘要(中文)
MLLM基础的嵌入模型在组合检索中仍然存在局限,常常无法区分包含相同概念但属性-对象绑定不同的场景。论文提出CORE,通过将跨注意力重排序器的组合判断蒸馏到嵌入模型中,来解决这一问题。CORE综合了五个组合匹配层次的候选列表,并引入Rank-KL目标,训练嵌入模型重现重排序器的细粒度排名。实验表明,CORE在多个基准测试中表现优异,尤其在COLA、SUGARCREPE++和NEGBENCH上,CORE-RERANKER-8B的总平均达82.7%,超越了Jina-Reranker 10.7个百分点。
🔬 方法详解
问题定义:论文旨在解决现有MLLM嵌入模型在组合检索中的局限性,尤其是无法区分相似场景的属性-对象绑定问题。现有方法在处理复杂场景时表现不佳,导致检索效果下降。
核心思路:CORE的核心思路是将跨注意力重排序器的组合判断蒸馏到嵌入模型中,通过引入Rank-KL目标,使嵌入模型能够学习重排序器的细粒度排名,从而提升组合推理能力。
技术框架:CORE的整体架构包括候选列表的生成、Rank-KL目标的训练和评估协议的引入。候选列表涵盖五个组合匹配层次,训练过程中通过多层次监督来优化模型性能。
关键创新:论文的主要创新在于引入Rank-KL目标和多层次监督机制,使得嵌入模型能够更有效地学习复杂的组合关系。这一方法与传统的对比学习方法相比,能够更好地捕捉细微的场景差异。
关键设计:在技术细节上,论文设计了特定的损失函数Rank-KL,并在模型训练中使用了多层次的监督信号。此外,模型的参数设置和网络结构经过精心调整,以确保最佳的学习效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CORE-RERANKER-8B在COLA、SUGARCREPE++和NEGBENCH基准测试中取得了82.7%的总平均分,超越了Jina-Reranker 10.7个百分点。同时,CORE-EMBED-8B在所有评估的嵌入模型中表现最佳,总平均为0.666,显示出显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括图像检索、视频分析和自然语言处理等多个领域。通过提升嵌入模型的组合推理能力,CORE可以在复杂场景的理解和检索中发挥重要作用,未来可能推动相关技术的进一步发展与应用。
📄 摘要(原文)
MLLM-based embedding models remain limited in compositional retrieval, often failing to distinguish scenes containing the same concepts but different attribute-object bindings. Yet the same backbone can resolve such distinctions when used as a cross-attentive reranker, motivating us to distill its compositional judgments into the embedding model. We propose CORE, which synthesizes candidate lists spanning five compositional matching levels and introduces a Rank-KL objective that trains the embedding model to reproduce the reranker's fine-grained ranking. We further introduce a graded evaluation protocol and compare contrastive learning, pairwise CoSENT, and listwise Rank-KL under the same data and tuning budget. Our comparison shows that both CoSENT and Rank-KL use the multi-level supervision more effectively than contrastive learning, with Rank-KL achieving the strongest overall performance. Across three compositional reasoning benchmarks (COLA, SUGARCREPE++, NEGBENCH), CORE-RERANKER-8B achieves an 82.7% total average, outperforming Jina-Reranker by 10.7 points, while CORE-EMBED-8B achieves the best total average (0.666) among all evaluated embedding models. The improvements transfer to the MCMR benchmark without sacrificing retrieval performance on COCO and Flickr30K.