MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence
作者: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren
分类: cs.AI
发布日期: 2026-08-10
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出MMArch基准以解决多模态推理在建筑工程中的挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态推理 建筑工程 基准测试 大型语言模型 视觉证据 工程原理 智能决策
📋 核心要点
- 现有的多模态大型语言模型在建筑工程领域的应用面临挑战,尤其是在结合视觉证据与工程原理方面。
- 论文提出MMArch基准,通过1212个简答题测试模型的多模态推理能力,强调对证据的感知和原则的应用。
- 实验结果显示,现有模型的表现远低于人类专家,最强开源模型仅30%,而人类专家达到95%,表明研究的必要性和潜力。
📝 摘要(中文)
多模态大型语言模型(MLLMs)在工程图像处理上表现出色,但现有基准主要测试绘图识别、信息提取或合规检查,尚未验证模型能否结合分散的视觉证据与工程原理得出结论。为此,我们引入MMArch,这是一个涵盖十个子领域的建筑与土木工程基准,完全基于同行评审论文中的图形构建。其1212个简答题通过解耦的规划-写作流程生成,并经过自动筛选、盲审计和专家审查验证,回答这些问题需要感知相关证据、识别主导原则并加以应用,而非利用文本或单一图形的捷径。对18个开放权重和专有MLLMs的评估显示,存在显著差距:最强的开源模型仅达到约30%,而最佳的专有系统为52%,而人类专家则达到了95%,领先超过40个百分点。我们的错误分析表明,失败主要集中在应用原则和跨图形结合证据上,而非定位证据,这为未来研究提供了广阔的空间。
🔬 方法详解
问题定义:本论文旨在解决现有多模态大型语言模型在建筑工程领域无法有效结合视觉证据与工程原理的问题。现有方法多集中于绘图识别和信息提取,未能全面评估模型的推理能力。
核心思路:论文通过引入MMArch基准,设计了一套涵盖多个子领域的测试题目,要求模型不仅识别图形,还需理解并应用工程原理,从而提升多模态推理的能力。
技术框架:MMArch基准由1212个简答题构成,采用解耦的规划-写作流程生成题目,并经过自动筛选、盲审计和专家审查,确保题目的有效性和可靠性。
关键创新:最重要的创新点在于通过综合视觉证据与工程原理的方式,设计出一套新的评估标准,突破了传统方法的局限,强调了多模态推理的复杂性。
关键设计:在题目生成过程中,采用了自动化筛选和专家审查的双重验证机制,确保题目的质量和难度适中,同时设计了针对性的评估指标,以便更好地衡量模型的推理能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,最强的开源模型在MMArch基准上的表现仅为30%,而最佳的专有系统为52%。相比之下,人类专家的表现高达95%,显示出模型在多模态推理方面的显著不足,且与人类专家的差距超过40个百分点,表明该领域仍有巨大的研究空间。
🎯 应用场景
该研究的潜在应用领域包括建筑设计、土木工程教育及相关领域的智能辅助决策系统。通过提升多模态推理能力,MMArch基准可为工程师提供更为精准的决策支持,推动工程领域的智能化发展。未来,随着模型性能的提升,可能会在实际工程项目中得到广泛应用。
📄 摘要(原文)
Multimodal large language models (MLLMs) perform strongly on engineering imagery, yet existing benchmarks mostly test drawing recognition, information extraction, or compliance checking, leaving open whether models can combine distributed visual evidence with engineering principles to reach a conclusion. We introduce MMArch, a benchmark for architecture and civil engineering spanning ten subdomains and built entirely from figures in peer-reviewed papers. Its $1{,}212$ short-answer items are produced by a decoupled planner--writer pipeline and validated through automated screening, a blind adversarial audit, and expert review, so that answering requires perceiving the relevant evidence, identifying the governing principle, and applying it, not exploiting textual or single-figure shortcuts. Evaluating $18$ open-weight and proprietary MLLMs against a domain-expert panel, we find a wide gap: the strongest open-source model attains about $30\%$ and the best proprietary system $52\%$, while human experts reach $95\%$, more than forty points ahead. Our error analysis shows that failures concentrate in applying principles and combining evidence across figures rather than in locating it, pointing to substantial headroom for future research. Code and data are available at https://dcx-swjtu.github.io/MMArch/.