KoViDoRe: Korean Visual Document Retrieval

📄 arXiv: 2608.20840v1 📥 PDF

作者: Yongbin Choi, Yongwoo Song, Mujeen Sung

分类: cs.IR, cs.CV

发布日期: 2026-08-21


💡 一句话要点

提出KoViDoRe以解决韩文视觉文档检索问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉文档检索 多模态检索 韩文处理 数据集构建 结构化内容

📋 核心要点

  1. 现有的多模态检索方法在处理韩文视觉文档时存在显著不足,尤其是对复杂结构和多页内容的支持不足。
  2. 论文提出了KoViDoRe基准数据集,专注于多样化的韩文视觉文档,并开发了多阶段的数据整理流程以提高检索效果。
  3. 实验结果表明,当前的多模态检索模型在处理韩文视觉文档时效果不佳,论文通过Ko-VDR Train Public数据集提供了改进的基础。

📝 摘要(中文)

近年来,多模态检索的进展提升了从视觉丰富的文档(如PDF和报告)中检索信息的能力。然而,现有基准主要集中在英语文档上,且对复杂结构的韩文视觉文档覆盖有限。此外,大多数现有韩文资源主要评估单页检索,未能捕捉需要跨多页聚合证据的真实场景。为了解决这些问题,我们引入了KoViDoRe,一个针对韩文视觉文档检索的基准数据集。该数据集由多种布局的公开韩文文档构成,包括表格、图形和多列结构。我们开发了一个多阶段的数据整理流程,包括结构化文档解析、基于摘要和上下文的合成查询生成,以及经过人工验证的相关性映射。使用KoViDoRe,我们评估了多种多模态检索模型,发现当前模型在处理韩文视觉文档检索时,尤其是在涉及结构化内容和多样查询类型的设置中表现不佳。基于这一发现,我们进一步整理了一个大规模训练数据集Ko-VDR Train Public,以支持针对韩文视觉文档的检索模型开发。KoViDoRe和Ko-VDR Train Public共同提供了一个统一的基准和训练资源。

🔬 方法详解

问题定义:本论文旨在解决现有多模态检索方法在韩文视觉文档检索中的不足,特别是在复杂结构和多页内容的处理上存在挑战。

核心思路:提出KoViDoRe基准数据集,通过多阶段的数据整理流程,增强对韩文视觉文档的检索能力,特别是针对多样化的查询类型和结构化内容。

技术框架:整体架构包括结构化文档解析、合成查询生成(基于摘要和上下文)、以及经过人工验证的相关性映射等主要模块,形成一个完整的检索流程。

关键创新:最重要的创新在于构建了一个专注于韩文视觉文档的多样化数据集,并通过多阶段的整理流程提升了检索的准确性和有效性,与现有方法相比,显著增强了对复杂文档的处理能力。

关键设计:在数据整理过程中,采用了结构化解析技术,设计了合成查询生成策略,并通过人工验证确保了相关性映射的准确性,这些设计细节为模型的训练和评估提供了坚实基础。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,当前多模态检索模型在处理KoViDoRe数据集时表现不佳,尤其是在结构化内容和多样查询类型的设置中,检索准确率提升幅度有限。通过引入Ko-VDR Train Public数据集,未来模型的性能有望得到显著改善。

🎯 应用场景

该研究的潜在应用领域包括教育、法律、金融等行业中对韩文视觉文档的检索需求。通过提升韩文文档的检索能力,能够帮助用户更高效地获取信息,促进知识的传播与利用。未来,该研究可能推动更多针对非英语文档的检索技术的发展。

📄 摘要(原文)

Recent advances in multimodal retrieval have improved the ability to retrieve information from visually rich documents such as PDFs and reports. However, existing benchmarks remain largely centered on English and provide limited coverage of Korean visual documents with complex structures. Furthermore, most existing Korean resources primarily evaluate single-page retrieval, failing to capture realistic scenarios that require evidence aggregation across multiple pages. To address these gaps, we introduce KoViDoRe, a benchmark for Korean visual document retrieval. The dataset is constructed from publicly available Korean documents with diverse layouts, including tables, figures, and multi-column structures. We develop a multi-stage data curation pipeline consisting of structured document parsing, synthetic query generation using both summary-based and context-based strategies, and relevance mapping with human verification. Using KoViDoRe, we evaluate a wide range of multimodal retrieval models and observe that current models struggle to effectively handle Korean visual document retrieval, particularly in settings involving structured content and diverse query types. Motivated by this finding, we further curate a large-scale training dataset, Ko-VDR Train Public, to support the development of retrieval models tailored to Korean visual documents. Together, KoViDoRe and Ko-VDR Train Public provide a unified benchmark and training resource for Korean visual document retrieval.