Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation

📄 arXiv: 2608.30163v1 📥 PDF

作者: Ruofan Hu, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Ke Lei, Tao Jin, Zhou Zhao

分类: cs.IR, cs.CV

发布日期: 2026-08-31

备注: Accepted by EMNLP 2026 Main

🔗 代码/项目: GITHUB


💡 一句话要点

提出Doc-REFRAG以解决多模态文档检索增强生成问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态文档 检索增强生成 问答系统 强化学习 视觉标记压缩 信息检索 数据集构建

📋 核心要点

  1. 现有的多模态RAG模型在处理真实的多图像场景时准确性有限,且计算开销较大。
  2. 本文提出Doc-REFRAG框架,通过压缩视觉标记并使用强化学习选择器优化与问题相关的标记。
  3. 实验结果显示,Doc-REFRAG在多个基准测试中超越了强基线,显著提高了准确性和推理速度。

📝 摘要(中文)

现实世界的知识存在于多模态文档中,因此需要检索增强生成(RAG)来实现准确的问答。然而,现有的多模态RAG模型主要针对单图像或封闭文档设置,且在真实的多图像场景中准确性有限。此外,处理大量检索到的图像会因无关视觉标记而产生显著的计算开销。为了解决这些挑战,本文引入了DocLongRAG,一个包含343K问答对的大规模数据集,每个问答对平均关联37.4个检索图像,以反映真实的RAG工作流程。基于该数据集,我们提出了Doc-REFRAG,一个基于问题引导的框架,通过轻量级的强化学习选择器将视觉标记压缩为粗略块,并选择性地扩展与问题相关的标记。实验结果表明,Doc-REFRAG在六个基准测试中超越了十一种强基线,以显著更低的推理延迟实现了最先进的准确性。

🔬 方法详解

问题定义:本文旨在解决现有多模态RAG模型在真实多图像场景中的准确性不足和计算开销过大的问题。现有方法主要针对单一图像或封闭文档,无法有效处理复杂的多图像输入。

核心思路:Doc-REFRAG的核心思路是通过问题引导的方式,压缩无关的视觉标记,并使用轻量级的强化学习选择器来选择与问题相关的视觉信息,从而提高问答的准确性和效率。

技术框架:Doc-REFRAG的整体架构包括数据预处理、视觉标记压缩、问题引导选择和生成模块。首先,输入的多模态文档经过预处理,提取出视觉标记;然后,通过压缩算法减少无关标记,接着利用强化学习选择器进行相关标记的扩展,最后生成答案。

关键创新:本文的主要创新在于提出了一种新的问题引导框架,能够有效地压缩和选择视觉标记,从而显著降低计算开销并提高问答准确性。这一方法与传统的全图像处理方式形成了鲜明对比。

关键设计:在设计中,采用了轻量级的强化学习选择器,优化了选择过程的效率。此外,损失函数的设计也考虑了标记的相关性,以确保生成的答案更具针对性和准确性。整体网络结构经过精心调整,以适应大规模数据集的训练需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在六个基准测试中,Doc-REFRAG超越了十一种强基线,达到了最先进的准确性,且推理延迟显著降低,具体性能数据未详述,但提升幅度明显,展示了其在多模态问答中的优越性。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、信息检索和多模态数据分析等。通过提高多模态文档的处理能力,Doc-REFRAG能够在教育、医疗和法律等行业中提供更为精准的信息服务,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Real-world knowledge resides in multimodal documents, necessitating retrieval-augmented generation (RAG) for accurate question answering. However, existing multimodal RAG models are primarily designed for single-image or closed-document settings and exhibit limited accuracy in realistic multi-image scenarios. Moreover, processing numerous retrieved images incurs substantial computational overhead from irrelevant visual tokens. To address these challenges, we introduce DocLongRAG, a large-scale dataset of 343K question--answer pairs, each associated with an average of 37.4 retrieved images to reflect authentic RAG workflows. Building on this dataset, we propose Doc-REFRAG, a question-guided framework that compresses visual tokens into coarse chunks and selectively expands question-relevant ones via a lightweight RL-based selector. Experiments on six benchmarks show that Doc-REFRAG outperforms eleven strong baselines, achieving state-of-the-art accuracy with significantly lower inference latency. Our resources are available at https://github.com/Collab-Gen/Doc-REFRAG.