DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents
作者: Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park, Xinyi Gu, Zexue He, Soochahn Lee, Rogerio Feris, Yong Jae Lee
分类: cs.AI, cs.CV, cs.LG
发布日期: 2026-09-02
备注: Accepted by ICML 2026
💡 一句话要点
提出DocHop以解决信息密集型文档中的多跳推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 文档推理 图表理解 大型语言模型 信息检索 智能问答 推理能力
📋 核心要点
- 现有的多模态大型语言模型在图表和文档问答任务中表现良好,但缺乏对图表证据选择和聚合的综合推理能力。
- DocHop基于文档叙述定义多步组合约束,要求模型在聚合多个图表证据前从上下文中解析目标实体。
- 实验表明,人工标注者的准确率超过90%,而最佳模型仅达到62.83%,推理增强模型在复杂性增加时性能下降。
📝 摘要(中文)
多模态大型语言模型(MLLMs)在结构化视觉理解任务中表现出色,但现有基准通常孤立评估这些领域,未能充分探讨模型如何利用文本上下文选择、解释和聚合图表证据。为此,本文提出DocHop,一个用于文档风格图像中集成图表与上下文推理的基准。DocHop通过随机逻辑优先生成管道构建,涵盖2074个示例,涉及六个任务类别。实验结果显示,尽管推理增强模型表现有所提升,但在推理复杂性增加时性能下降,表明DocHop为多跳文档推理提供了一个受控的测试平台。
🔬 方法详解
问题定义:本文旨在解决现有多模态大型语言模型在信息密集型文档中进行多跳推理的不足,尤其是在图表证据的选择和聚合方面存在的挑战。
核心思路:DocHop通过引入文档叙述与图表数据的结合,要求模型在回答问题前解析上下文中的目标实体,从而实现更为复杂的推理过程。
技术框架:DocHop的构建采用随机逻辑优先生成管道,允许控制推理深度和视觉密度,涵盖多个任务类别。整体流程包括文档生成、图表数据整合及问题生成等主要模块。
关键创新:DocHop的创新在于其综合性推理能力,要求模型在多步推理中整合文本和图表信息,这与以往单一任务评估方法有本质区别。
关键设计:在构建DocHop时,设置了可控的推理深度和视觉密度,确保生成的示例具有多样性和挑战性,同时采用了适合多跳推理的损失函数和网络结构。
🖼️ 关键图片
📊 实验亮点
实验结果显示,人工标注者的准确率超过90%,而最佳模型的准确率仅为62.83%。推理增强模型在多跳推理任务中表现出一致的提升,但随着推理复杂性的增加,性能有所下降,显示出该基准的挑战性。
🎯 应用场景
DocHop的研究成果可广泛应用于信息检索、智能问答系统及教育领域,帮助提升模型在复杂文档理解中的表现。未来,该基准有望推动多模态推理技术的发展,促进更智能的文档分析工具的出现。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) have achieved strong performance on structured visual understanding tasks such as chart and document question answering. However, existing benchmarks typically evaluate these domains in isolation, leaving underexplored a key capability: whether models can use textual context to determine how chart evidence should be selected, interpreted, and aggregated. We introduce DocHop, a benchmark for integrated chart--context reasoning in document-style images. In DocHop, the document narrative specifies multi-step compositional constraints, while charts provide the corresponding data values. Questions are grounded on a semantic reference label defined in the narrative, requiring models to resolve target entities from context before aggregating evidence across multiple charts. To enable systematic evaluation, we construct DocHop via a stochastic logic-first generation pipeline with controllable reasoning depth and visual density, covering 2,074 examples across six task categories. Experiments on a wide range of proprietary and open-source MLLMs show a substantial gap to human performance: annotators achieve over 90% accuracy, while the best model reaches only 62.83%. Reasoning-enhanced models consistently show improved results, but performance degrades as reasoning complexity increases. Overall, DocHop provides a controlled testbed for challenging multi-hop document reasoning.