OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

📄 arXiv: 2608.30678v1 📥 PDF

作者: Gengxu Li, Yuan Wu, Yi Chang

分类: cs.CL

发布日期: 2026-08-31

备注: EMNLP 2026 Findings camera-ready version

🔗 代码/项目: GITHUB


💡 一句话要点

提出OCR-MetaReasoning基准以评估MLLMs在文本丰富图像理解中的推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 光学字符识别 推理能力评估 文本丰富图像理解 元推理基准

📋 核心要点

  1. 现有评估方法将提取与推理混淆,缺乏对模型推理方向的有效测试,导致推理能力评估不全面。
  2. 论文提出OCR-MetaReasoning基准,通过将演绎、归纳和溯因视为独立方向,明确区分推理过程与最终答案的正确性。
  3. 实验结果显示,当前MLLMs在可见规则应用和布局敏感推理方面仍存在显著不足,推理过程合规性与最终答案的准确性并不总是相符。

📝 摘要(中文)

文本丰富的图像理解要求多模态大语言模型(MLLMs)在单词、布局、领域、图表和视觉对应关系中组织基于OCR(光学字符识别)的证据。现有评估往往将提取与推理混为一谈,且很少测试模型是否遵循所需的推理方向:应用可见规则、抽象隐藏规律或恢复缺失前提。我们引入OCR-MetaReasoning,这是一个受控的单图像基准,将演绎、归纳和溯因视为不同方向,并将最终答案的正确性与推理过程的合规性分开。该基准包含1500个经过验证的样本,采用平衡的3×5分类法,涵盖三种推理类型和五种OCR对象类别,并提供参考推理步骤、自动答案评分、元推理宏评分(MRMS)和推理过程合规评分(RPCS)。实验表明,基于OCR的元推理仍远未饱和:模型在可见规则应用和布局敏感推理方面表现不佳,而过程合规的推理理由可能伴随不正确的最终答案。

🔬 方法详解

问题定义:本论文旨在解决现有多模态大语言模型在文本丰富图像理解中的推理能力评估不足的问题。现有方法往往将提取与推理混为一谈,缺乏对推理方向的有效测试,导致评估结果不准确。

核心思路:我们提出OCR-MetaReasoning基准,通过将推理类型分为演绎、归纳和溯因,明确区分推理过程与最终答案的正确性,从而提供更为细致的评估框架。

技术框架:该基准包含1500个经过验证的样本,采用平衡的3×5分类法,涵盖三种推理类型和五种OCR对象类别。每个样本提供参考推理步骤、自动答案评分、元推理宏评分(MRMS)和推理过程合规评分(RPCS)。

关键创新:本研究的主要创新在于将推理过程的合规性与最终答案的正确性分开评估,提供了一个更为全面的评估标准,能够更好地反映模型的推理能力。

关键设计:在设计过程中,我们设置了明确的评分标准,包括MRMS和RPCS,以便对模型的推理过程进行量化评估。此外,样本的选择经过严格验证,以确保基准的有效性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前的多模态大语言模型在可见规则应用和布局敏感推理方面表现不佳,尤其是在准确匹配评估下,过程合规的推理理由可能伴随不正确的最终答案。这表明OCR基础的元推理能力仍有很大的提升空间。

🎯 应用场景

该研究的潜在应用领域包括智能文档分析、自动化客服、以及任何需要结合视觉信息和文本信息的场景。通过提升模型的推理能力,可以在实际应用中实现更高效的信息提取和决策支持,未来可能对多模态学习和人机交互产生深远影响。

📄 摘要(原文)

Text-rich image understanding requires multimodal large language models (MLLMs) to organize OCR (Optical Character Recognition)-grounded evidence across words, layout, fields, charts, and visual correspondences. Existing evaluations often conflate extraction with reasoning and rarely test whether models follow the required reasoning direction: applying visible rules, abstracting hidden regularities, or recovering missing premises. We introduce OCR-MetaReasoning, a controlled single-image benchmark that treats deduction, induction, and abduction as distinct directions and separates final-answer correctness from reasoning-process compliance. The benchmark contains 1,500 verified samples in a balanced (3\times5) taxonomy crossing three reasoning types with five OCR-object categories, along with reference reasoning steps, automatic answer scoring, the Meta-Reasoning Macro Score (MRMS), and the Reasoning Process Compliance Score (RPCS). Experiments with representative closed-source and open-source MLLMs show that OCR-grounded meta-reasoning remains far from saturated: models struggle with visible-rule application and layout-sensitive inference, while process-compliant rationales can accompany incorrect final answers under exact-match evaluation. The code is available at https://github.com/gengxuli/OCR-MetaReasoning.