Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

📄 arXiv: 2608.12262v1 📥 PDF

作者: Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

分类: cs.CV, cs.AI

发布日期: 2026-08-12

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Diagram-MMU基准以评估科学图表解析能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大型语言模型 科学图表解析 图表到代码 基准评估 机器学习

📋 核心要点

  1. 现有的多模态大型语言模型在科学图表解析和理解方面存在显著挑战,尤其是在图表到代码的转换任务中表现不佳。
  2. 本文提出Diagram-MMU基准,通过3700个图表和18300个问题,系统评估MLLMs在图表解析、编辑和问答任务中的表现。
  3. 实验结果表明,尽管大多数模型在代理设置下提高了解析和编辑性能,但在问答任务上却出现了性能下降,显示出不同任务间的能力差异。

📝 摘要(中文)

多模态大型语言模型(MLLMs)在科学写作和协作方面的能力不断增强。本文构建了Diagram-MMU,这是一个多模态基准,旨在评估MLLMs在科学图表解析和理解方面的能力。该基准包含3700个精心策划的图表和18300个经过人工验证的问题,涵盖六个领域。评估结果显示,图表到代码的解析和编辑任务比图表问答更具挑战性,强调了提升MLLMs在图表到代码生成能力方面的必要性。

🔬 方法详解

问题定义:本文旨在解决多模态大型语言模型在科学图表解析和理解中的不足,尤其是图表到代码的转换任务面临的挑战。现有方法在解析和编辑图表时表现不佳,亟需改进。

核心思路:通过构建Diagram-MMU基准,系统地评估和比较不同MLLMs在科学图表处理中的能力,特别关注图表到代码的解析和编辑任务。该基准的设计旨在提供全面的评估框架,促进模型能力的提升。

技术框架:Diagram-MMU基准包括三个主要任务:图表到代码解析、图表到代码编辑和图表问答。每个任务都在不同的代理设置下进行评估,以观察模型在不同场景下的表现。

关键创新:最重要的创新点在于构建了一个包含大量图表和问题的多模态基准,系统评估了MLLMs在科学图表解析方面的能力,填补了现有研究的空白。

关键设计:在实验中,使用了12个不同的MLLMs进行评估,设置了多种代理环境,并通过对比分析了模型在不同任务中的表现差异,特别关注了图表到代码任务的难度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,图表到代码的解析和编辑任务比图表问答更具挑战性,12个MLLMs在这些任务上的表现差异显著。在代理设置下,大多数模型在解析和编辑任务中有所提升,但在问答任务上却出现了性能下降,Claude-4.6 Opus在所有任务中均表现出一致的提升。

🎯 应用场景

该研究的潜在应用领域包括科学写作、教育和科研协作平台。通过提升MLLMs在图表解析和生成方面的能力,可以大幅提高科学研究的效率和准确性,推动科学知识的传播与共享。

📄 摘要(原文)

Multimodal Large Language Models (MLLMs) have been growing the capability for scientific writing and collaboration. For example, OpenAI Prism is a free workspace for scientific writing and collaboration. One important feature in Prism is turning scientific diagrams directly into LaTeX TikZ code. In this paper, we build a benchmark, Diagram-MMU, a multi-modal benchmark designed to assess MLLMs' ability for scientific diagram parsing and understanding. Diagram-MMU features 3.7k curated diagrams and 18.3k human-validated questions across six domains. It evaluates MLLMs on three tasks common in vibe writing workspaces: diagram-to-code parsing, diagram-to-code editing, and diagram question answering, alongside agentic settings per task. The evaluation of 12 MLLMs reveals that diagram-to-code tasks are more challenging than diagram question answering: models can reason well over diagrams but struggle to parse and edit them, underscoring the need for methods to enhance MLLMs' capability in diagram-to-code generation. Under agentic settings, most models improve parsing and editing performance but degrade on question answering, while Claude-4.6 Opus consistently improves across all three tasks. Project Page: https://vi-ocean.github.io/projects/diagram-mmu.