BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

📄 arXiv: 2608.17895v1 📥 PDF

作者: Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev

分类: cs.CL, cs.AI

发布日期: 2026-08-18


💡 一句话要点

提出BEAR-Bench以解决多模态模型在专业文档推理中的不足

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态模型 推理能力 双语基准 专业文档 幻觉检测

📋 核心要点

  1. 现有多模态模型在处理文本密集的专业文档时推理能力不足,且评估方法多集中于信息提取。
  2. 提出BEAR-Bench基准,涵盖英语和俄语的复杂问题,专注于商业和科学文档的推理能力评估。
  3. 对16个多模态模型进行评估,发现即使是最强模型在BEAR-Bench上仍有提升空间,且对幻觉检测方法进行了比较。

📝 摘要(中文)

尽管多模态大型语言模型(MLLMs)在视觉理解方面取得了显著进展,但它们在处理文本密集型的专业文档时的推理能力仍未得到充分评估。现有基准主要集中于信息提取,需依赖外部领域知识,且多以英语或中文为主,其他语言尤其是俄语的代表性不足。为了解决这些问题,本文提出了BEAR-Bench(双语企业与学术推理基准),这是一个包含1000个基于文本丰富的商业和科学文档的人类标注问题的自包含复杂基准。我们对16个专有和开放权重的MLLMs进行了评估,发现即使是最强的系统也存在明显的提升空间。最后,我们利用模型输出比较现有的幻觉检测方法,评估模型在BEAR-Bench上的失败频率及其可识别性。

🔬 方法详解

问题定义:本文旨在解决多模态大型语言模型在推理文本密集型专业文档时的能力不足,现有基准多集中于信息提取,且缺乏对非英语文档的评估。

核心思路:通过构建BEAR-Bench基准,提供一个包含英语和俄语的复杂问题集,专注于商业和科学文档,以全面评估多模态模型的推理能力。

技术框架:BEAR-Bench由1000个基于人类标注的问题组成,涵盖多种文本丰富的文档类型。评估流程包括模型输出的收集、性能分析及与现有幻觉检测方法的比较。

关键创新:BEAR-Bench的创新在于其双语特性和针对专业文档的专注,填补了现有基准在语言和内容上的空白。

关键设计:在设计上,BEAR-Bench采用了人类标注的问题集,确保问题的多样性和复杂性,同时评估模型在不同领域的推理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在对16个多模态模型的评估中,发现即使是最强的系统在BEAR-Bench上仍有明显的提升空间,且模型在幻觉检测方面的表现也得到了系统的分析和比较,为未来的研究提供了重要的参考。

🎯 应用场景

该研究的潜在应用领域包括商业智能、学术研究和法律文档分析等。BEAR-Bench能够帮助开发更强大的多模态模型,提高其在专业领域的推理能力,进而推动相关技术在实际应用中的落地和发展。

📄 摘要(原文)

While Multimodal Large Language Models (MLLMs) have made significant strides in visual comprehension, their ability to reason about text-dense, professional documents remains incompletely evaluated. Existing benchmarks emphasize information extraction, require external domain knowledge, or cover professional documents only as one of many settings. They are also largely English- or Chinese-centric, leaving other languages and Russian, in particular, substantially underrepresented. To address these limitations, we introduce BEAR-Bench (Bilingual Enterprise and Academic Reasoning), a self-contained, complex English-and-Russian benchmark comprising 1000 human-annotated questions based on text-rich business and scientific documents. We evaluate 16 proprietary and open-weight MLLMs, including Gemini 3.1 Pro and Qwen3.5-397B, on BEAR-Bench and observe clear headroom even for the strongest systems. Finally, we use the resulting model outputs to compare existing hallucination detection methods, evaluating not only how often models fail on BEAR-Bench but also how reliably those failures can be identified.