GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

📄 arXiv: 2609.03892v1 📥 PDF

作者: Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

分类: cs.CV, cs.AI, cs.RO

发布日期: 2026-09-03


💡 一句话要点

提出GraFT框架以解决多模态大语言模型中的空间推理问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 空间推理 多模态大语言模型 3D场景图 无训练框架 几何推理 视觉属性基础 机器人导航 增强现实

📋 核心要点

  1. 当前多模态大语言模型在3D空间推理方面存在显著不足,特别是在几何测量和视角转换上表现不佳。
  2. GraFT框架通过引入3D场景图(3DSG),提供无训练的空间推理能力,解决了现有方法的局限性。
  3. 实验结果表明,GraFT在ScanQA和VSI-Bench上均显著提升了性能,尤其在CIDEr和整体准确率上有显著提高。

📝 摘要(中文)

3D空间推理是理解和在物理世界中行动的基础,但当前多模态大语言模型(MLLMs)在这一领域表现不佳,尤其在精确几何测量、视角转换和细粒度外观基础方面。现有方法通常依赖于在大规模空间推理数据集上进行微调或附加专用编码器,这些方法通常需要昂贵的监督和特定的骨干网络。为此,本文提出了GraFT,一个无训练的框架,通过紧凑且易于维护的3D场景图(3DSG)提供缺失的3D结构。GraFT提供三种空间推理能力:确定性几何、鸟瞰图布局和视觉属性基础。在ScanQA上,GraFT在所有指标上均优于相同骨干的基线,CIDEr提高了27%。在VSI-Bench上,GraFT使冻结的MLLMs性能提升高达65%,超越了所有专有和通用开源基线,以及多个显著的微调空间模型。

🔬 方法详解

问题定义:本文旨在解决当前多模态大语言模型在3D空间推理中的不足,特别是在几何测量、视角转换和外观基础方面的挑战。现有方法通常依赖于昂贵的监督和特定的模型架构,限制了其广泛应用。

核心思路:GraFT框架的核心思想是通过构建一个紧凑的3D场景图(3DSG)来提供必要的3D结构,从而实现无训练的空间推理能力。这种设计使得模型能够在不依赖大量标注数据的情况下,进行有效的空间推理。

技术框架:GraFT的整体架构包括三个主要模块:1) 确定性几何推理模块,利用符号工具进行几何计算;2) 鸟瞰图布局模块,通过BEV渲染实现全局视角;3) 视觉属性基础模块,使用任务相关的自我中心帧进行细粒度外观基础。

关键创新:GraFT的主要创新在于其无训练的框架设计,通过3D场景图提供空间推理能力,这与传统方法依赖于微调和特定编码器的方式本质上不同。

关键设计:在关键设计上,GraFT采用了符号工具进行几何推理,结合鸟瞰图和自我中心帧的渲染技术,确保了在不同视角下的空间推理准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

GraFT在ScanQA上提升了27%的CIDEr分数,并在VSI-Bench上使冻结的多模态大语言模型性能提升高达65%。这些结果超越了所有现有的专有和开源基线,显示出其在空间推理任务中的显著优势。

🎯 应用场景

GraFT框架在机器人导航、增强现实和自动驾驶等领域具有广泛的应用潜力。通过提供高效的空间推理能力,能够提升这些系统在复杂环境中的理解和决策能力,进而推动智能系统的实际应用和发展。

📄 摘要(原文)

3D spatial reasoning underpins understanding and acting in the physical world, yet it remains unreliable in current multimodal large language models (MLLMs). These models falter at precise geometric measurement, at transforming between egocentric and allocentric viewpoints, and at grounding fine-grained appearance. The most common remedies fine-tune the model on large-scale curated spatial-reasoning datasets or attach dedicated encoders for 3D geometry, which typically couples the solution to costly supervision and a specific backbone. We instead introduce GraFT, a training-free framework that supplies the missing 3D structure through a compact, easily maintained 3D scene graph (3DSG). From this 3DSG, GraFT provides three spatial reasoning capabilities: (1) deterministic geometry through symbolic tools, (2) allocentric layout through a bird's-eye-view (BEV) rendering, and (3) visual-attribute grounding through task-relevant egocentric frames. On ScanQA, GraFT improves every metric over the same-backbone baseline, raising CIDEr by 27%. On VSI-Bench, GraFT improves frozen MLLMs by up to 65%, surpassing every proprietary and general-purpose open-source baseline, and several prominent fine-tuned spatial models.