EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

📄 arXiv: 2608.20886v1 📥 PDF

作者: Enjun Du, Siyi Liu, Zirong Chen, Xinyu Zuo, Jinwen Luo, Ruiwen Tao, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

分类: cs.CV, cs.LG

发布日期: 2026-08-21


💡 一句话要点

提出EviRank以解决多模态图像重排序问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态图像检索 图像重排序 语义约束 证据包 蒸馏训练 自然语言处理 结构化监督

📋 核心要点

  1. 现有的图像重排序方法无法有效处理多模态和组合性的查询,导致相关性信息的丢失或错误解释。
  2. EviRank通过将查询解析为结构化的证据包,明确区分实体、属性和关系等语义槽,从而提高了重排序的准确性。
  3. 在五个基准测试中,EviRank展现出最先进的性能,且蒸馏模型在成本显著降低的情况下仍能保持高达90%的能力保留率。

📝 摘要(中文)

现实世界中的图像搜索查询通常是多模态和组合性的,例如“找到这件粉色衬衫”,这要求保留实体、修改属性并忽略上下文。然而,现有的重排序方法要么将这种多方面的相关性压缩为不透明的嵌入,要么依赖于容易遗漏或虚构细粒度约束的自由形式思维链。基于自然语言处理中的评分标准和检查表评估,本文将多模态图像重排序重新构建为语义约束满足问题,并提出EviRank,该方法将任何查询(仅文本、仅图像或组合)解析为统一的证据包:跨六个语义槽(如实体、属性、关系)的类型化标准,每个标准标记为必需、禁止或可忽略。重排序过程则简化为基于证据的验证,结合确定性的评分标准和基于证据的列表比较,形成单一的无训练过程。通过五个基准测试,EviRank在文本到图像、图像到图像和组合图像检索中实现了最先进的性能,且蒸馏后的学生模型在显著降低成本的同时保留了超过90%的教师模型能力。

🔬 方法详解

问题定义:本文旨在解决多模态图像重排序中的相关性信息压缩和细粒度约束遗漏的问题。现有方法往往无法有效处理复杂的查询,导致检索结果不准确。

核心思路:EviRank的核心思路是将查询解析为结构化的证据包,涵盖多个语义槽,并通过明确的标签来指导重排序过程,从而避免信息的丢失和误解。

技术框架:EviRank的整体架构包括查询解析模块、证据包生成模块和重排序验证模块。查询解析模块将输入的查询分解为不同的语义槽,证据包生成模块则构建出包含这些槽的证据包,最后重排序验证模块基于证据进行排序。

关键创新:EviRank的主要创新在于将多模态图像重排序视为语义约束满足问题,并通过结构化的证据包来实现这一目标。这与现有方法的嵌入式处理方式形成了鲜明对比。

关键设计:在设计上,EviRank使用了六个语义槽来分类查询信息,并为每个槽设置了必需、禁止或可忽略的标签。此外,重排序过程采用了无训练的评分标准和基于证据的列表比较方法,确保了高效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在五个基准测试中,EviRank实现了最先进的性能,超越了现有的重排序方法。蒸馏后的学生模型在成本降低的情况下,仍然保留了超过90%的教师模型能力,展示了其高效性和实用性。

🎯 应用场景

EviRank的研究成果在多模态图像检索、电子商务、社交媒体内容搜索等领域具有广泛的应用潜力。通过提高图像重排序的准确性,该方法能够显著提升用户体验,并为相关行业提供更精准的搜索结果。未来,EviRank还可能推动更复杂的多模态交互系统的发展。

📄 摘要(原文)

Real-world image search queries are multimodal and compositional: ``find this shirt in pink'' specifies an entity to retain, an attribute to modify, and context to ignore. Yet existing re-rankers either compress such multifaceted relevance into an opaque embedding or rely on free-form chain-of-thought that easily omits or hallucinates fine-grained constraints. Drawing on rubric- and checklist-based evaluation from NLP, we recast multimodal image re-ranking as a semantic constraint satisfaction problem and propose EviRank, which parses any query - text-only, image-only, or composed - into a unified evidence package: typed criteria across six semantic slots (e.g., entities, attributes, relations), each labelled required, forbidden, or ignorable. Re-ranking then reduces to evidence-conditioned verification, combining deterministic rubric scoring and evidence-grounded listwise comparison in a single training-free procedure. The explicit evidence can further serve as structured supervision for optionally distilling a lightweight student. Across five benchmarks spanning text-to-image, image-to-image, and composed image retrieval, EviRank achieves state-of-the-art performance, and the distilled student preserves over 90% of the teacher's capability at substantially lower cost.