MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval
作者: Debanjan Mahata, Atharva Tendle, Daniel Preotiuc-Pietro, Yong Zhuang, Ozan Irsoy
分类: cs.IR, cs.AI, cs.CL, cs.CV, cs.LG
发布日期: 2026-09-01
备注: To appear in Proceedings of EMNLP 2026
💡 一句话要点
提出MIDR以解决多模态文档检索中的表示问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态检索 文档检索 增强索引 大语言模型 信息提取 BM25F 视觉信息处理 查询优化
📋 核心要点
- 现有方法在处理视觉丰富的文档时,常常无法有效提取表格和图形中的重要信息,导致信息丢失。
- MIDR框架通过在索引时间进行多模态推理,利用多模态大语言模型将页面内容转化为文本字段,提升检索效果。
- 实验表明,MIDR在多个领域的表现优于BM25和ColQwen2.5,且在索引内存和查询延迟上具有显著优势。
📝 摘要(中文)
在视觉丰富的文档检索中,重要内容常常存在于表格、图表、图形及布局关系中,而传统的OCR方法会将其线性化、损坏或遗漏。ColPali系列视觉检索器通过补丁级多向量索引和后期交互评分来解决这一问题,保持图像派生检索在查询时的服务路径。本文提出MIDR(多模态文档检索索引),这是一个无训练的框架,通过增强索引来转移多模态推理至索引时间。在数据摄取过程中,多模态大语言模型将渲染页面转换为经过验证的文本字段,并使用BM25F进行索引,且可选择与密集检索融合,从而实现基于文本的服务。实验结果显示,MIDR Hybrid在ViDoRe V3上实现了0.6219的平均nDCG,相较BM25提升23.0%,在两个法语文档领域中也表现优异。
🔬 方法详解
问题定义:本文旨在解决在视觉丰富文档检索中,传统OCR方法无法有效提取表格、图形等重要信息的问题,导致信息的丢失和检索效果的下降。
核心思路:MIDR框架通过在索引时间进行多模态推理,利用多模态大语言模型将渲染页面转换为经过验证的文本字段,从而增强索引的质量和检索的准确性。
技术框架:整体架构包括数据摄取、文本字段转换、BM25F索引和可选的密集检索融合。首先,渲染页面被转换为文本字段,然后使用BM25F进行索引,最后实现基于文本的检索服务。
关键创新:MIDR的主要创新在于将多模态推理转移至索引时间,而非查询时间,这一设计显著提升了检索的效率和准确性。
关键设计:在参数设置上,采用BM25F作为基础索引方法,并通过多模态大语言模型进行文本字段的验证和转换,确保索引的质量和检索的相关性。实验中还对比了不同的检索策略,以验证MIDR的有效性。
🖼️ 关键图片
📊 实验亮点
MIDR Hybrid在ViDoRe V3数据集上实现了0.6219的平均nDCG,相较于BM25提升了23.0%。在法语文档领域,MIDR将BM25的nDCG从0.1532提升至0.5448,超越了ColQwen2.5。此外,MIDR在索引内存使用上约为ColQwen2.5的1/9,查询延迟也降低了约2倍。
🎯 应用场景
MIDR框架在多模态文档检索中具有广泛的应用潜力,特别是在需要处理复杂视觉信息的领域,如法律文档分析、学术论文检索和医疗记录管理等。其提升的检索效果和效率将为相关行业带来显著的价值,促进信息获取的便利性和准确性。
📄 摘要(原文)
Retrieval over visually rich documents has a representation problem: important content often lives in tables, charts, figures, and layout relations that plain OCR linearizes, corrupts, or omits. ColPali-family visual retrievers address this with patch-level multi-vector indexes and late-interaction scoring, keeping image-derived retrieval on the query-time serving path. We introduce MIDR (Multimodal Indexing for Document Retrieval), a training-free framework for enrichment-augmented indexing that shifts multimodal reasoning to index time. During ingestion, a multimodal LLM converts rendered pages into verified textual fields that are indexed with BM25F and optionally fused with dense retrieval, enabling text-centric serving over multimodally grounded evidence. On ViDoRe V3, MIDR Hybrid achieves 0.6219 average nDCG across five English domains, a 23.0% relative gain over BM25, remaining competitive with ColQwen2.5. On two French-document domains, enrichment bridges English queries and French page text, lifting BM25 from 0.1532 to 0.5448 nDCG and outperforming ColQwen2.5. Across all seven domains, MIDR leads ColQwen2.5 on four while using approximately 9x smaller index memory and approximately 2x lower query latency. These results establish index-time multimodal reasoning as a compelling accuracy-deployment alternative to serving-time visual late interaction.