GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models
作者: Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan
分类: cs.CV
发布日期: 2026-08-07
备注: 33 pages, 16 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出GraphVerse以解决多模态大语言模型的视觉图推理挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 视觉图推理 图中心图像编辑 VGR-Score 推理能力评估
📋 核心要点
- 现有的视觉图推理基准往往将任务简化为视觉感知后跟随文本推理,限制了模型的真实推理能力评估。
- 本文提出GraphVerse基准,通过图中心图像编辑策略,联合评估感知、视觉推理和文本推理,增强了评估的全面性。
- 实验结果表明,当前多模态大语言模型在视觉图推理方面存在显著局限,同时验证了GIE策略和GraphVerse的有效性。
📝 摘要(中文)
近年来,多模态大语言模型(MLLMs)在各种视觉语言任务上取得了显著进展,迫切需要更具挑战性的基准。然而,现有评估仍然对这些模型在结构化视觉信息上的推理能力提供有限的洞察。视觉图推理(VGR)为这一挑战提供了一个引人注目的测试平台,要求模型整合感知、结构理解和基于图的视觉输入的多步推理。为此,本文提出了GraphVerse,一个统一的基准,联合评估MLLMs在单图像和配对图像设置下的感知、视觉推理和基于文本的图推理。核心是图中心图像编辑(GIE)策略,这些策略在保留语义的同时修改图像,成为视觉推理的主动测试。我们还提出了VGR-Score,这是一种超越最终答案准确性的过程敏感度指标。大量实验揭示了当前MLLMs在VGR中的若干关键局限性,同时验证了GIE策略的有效性及GraphVerse在更广泛的多模态推理能力上的可迁移性。
🔬 方法详解
问题定义:本文旨在解决现有视觉图推理基准在评估多模态大语言模型推理能力时的不足,尤其是对图结构信息的理解和推理能力的评估。现有方法往往将任务简化为视觉感知和文本推理的分离过程,无法全面反映模型的推理能力。
核心思路:论文提出GraphVerse基准,旨在通过图中心图像编辑(GIE)策略,结合视觉和文本推理,提供更具挑战性的评估环境。通过这种方式,模型不仅需要理解图像内容,还需进行多步推理,提升推理的复杂性和真实性。
技术框架:GraphVerse的整体架构包括图像编辑模块、视觉推理模块和文本推理模块。图像编辑模块负责生成图中心图像,视觉推理模块评估模型对图像的理解能力,而文本推理模块则评估模型在图结构上的推理能力。
关键创新:最重要的技术创新在于引入了GIE策略,使得图像在保持语义的同时进行修改,从而创建出更具挑战性的视觉推理任务。这一方法与现有方法的本质区别在于,它不仅关注最终答案的准确性,还强调推理过程的质量。
关键设计:在设计中,GIE策略的实现依赖于特定的图像处理算法,确保图像的语义信息不丢失。同时,VGR-Score作为一种新的评估指标,关注推理过程中的各个环节,提供更全面的性能评估。
🖼️ 关键图片
📊 实验亮点
实验结果显示,当前多模态大语言模型在视觉图推理任务中表现出显著的局限性,尤其是在多步推理能力上。通过引入GIE策略,模型在视觉推理任务中的表现有了明显提升,VGR-Score的引入也为评估推理质量提供了新的视角。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、视觉内容生成和多模态信息检索等。通过提升多模态大语言模型在视觉图推理方面的能力,GraphVerse能够推动更复杂的人工智能应用的发展,提升人机交互的智能化水平。
📄 摘要(原文)
Recent Multimodal Large Language Models (MLLMs) have achieved remarkable progress across diverse vision-language tasks, creating an urgent need for more challenging benchmarks. Yet existing evaluations still provide limited insight into whether these models can truly reason over structured visual information. Visual Graph Reasoning (VGR) offers a compelling testbed for this challenge, requiring models to integrate perception, structural understanding, and multi-step reasoning over graph-based visual inputs. However, prior VGR benchmarks often reduce the task to visual perception followed by text-based reasoning, restrict evaluation to single-image settings, rely on answer-only metrics, and underrepresent realistic graph-centric scenarios. To bridge the gap, we introduce GraphVerse, a unified benchmark that jointly evaluates perception, visual reasoning, and text-based graph reasoning in MLLMs under both single-image and paired-image settings. At its core is a suite of Graph-centric Image Editing (GIE) strategies that modify graph images while preserving their semantics, turning them into active tests of visual reasoning. We further propose VGR-Score, a process-sensitive metric that evaluates reasoning quality beyond final-answer accuracy. Extensive experiments reveal several key limitations of current MLLMs in VGR, while also validating the effectiveness of GIE strategies and the transferability of GraphVerse to broader multimodal reasoning capabilities. The code is available at https://github.com/sunyuanfu/GraphVerse.