Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
作者: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin
分类: cs.CV, cs.CL
发布日期: 2026-08-05
备注: 19 pages, 7 figures
💡 一句话要点
提出无训练框架以解决多模态大语言模型的空间推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 空间推理 无训练框架 空间证据图 推理验证与修正 视觉证据评估 智能助手 机器人导航
📋 核心要点
- 现有多模态大语言模型在空间推理中可能产生与输入图像不一致的判断,导致最终答案准确性降低。
- 提出了一种模块化的无训练框架,通过构建空间证据图和评估空间证据的可靠性来验证和修正推理过程。
- 在15个模型-数据集设置中,提出的方法平均准确率达到68.94%,显著优于对比基线,提升幅度达到8.55个百分点。
📝 摘要(中文)
尽管多模态大语言模型(MLLMs)取得了显著进展,但其空间推理仍可能产生与输入图像不一致的中间判断,导致错误在推理链中传播并影响最终答案。现有方法主要通过训练或额外的空间信息来改善空间推理,而未考虑推理过程是否忠实于模型输入。我们的研究表明,不忠实的推理链显著降低了最终答案的准确性。为了解决这一问题,我们提出了一种模块化且无训练的空间推理验证与修正框架。该框架构建了空间证据图(SEG),将从思维链推理中提取的原子空间证据与视觉实体、空间关系、源步骤和视觉证据关联。空间证据可靠性评估(SERA)基于对象存在性、定位和几何测量评估视觉证据的可靠性。该框架识别出与可靠视觉证据相矛盾的最早空间证据单元,并指导原始MLLM修正后续推理和最终答案。在15个模型-数据集设置中,我们的方法平均准确率达到68.94%,比对比基线平均提高8.55个百分点。我们的代码将开源。
🔬 方法详解
问题定义:本论文旨在解决多模态大语言模型在空间推理中产生不一致判断的问题。现有方法主要依赖训练或额外信息,未关注推理过程的忠实性,导致最终答案准确性下降。
核心思路:本研究提出了一种无训练的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA),对推理过程进行验证和修正,从而提高最终答案的准确性。
技术框架:整体架构包括空间证据图的构建、空间证据的提取与评估、以及推理修正三个主要模块。首先提取原子空间证据,然后评估其可靠性,最后识别矛盾证据并指导模型修正推理。
关键创新:最重要的创新点在于提出了空间证据图和空间证据可靠性评估机制,使得推理过程的验证与修正成为可能。这一方法与现有依赖训练的方式本质上不同。
关键设计:在设计中,空间证据图将视觉实体、空间关系和证据关联,SERA则基于对象存在性和几何测量进行评估,确保推理的准确性和可靠性。
🖼️ 关键图片
📊 实验亮点
在15个模型-数据集设置中,提出的方法平均准确率达到68.94%,比对比基线平均提高8.55个百分点,显示出显著的性能提升,验证了框架的有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动驾驶、机器人导航等需要空间推理的场景。通过提高多模态大语言模型的推理准确性,能够显著提升这些系统的智能水平和用户体验,未来可能在更多复杂任务中发挥重要作用。
📄 摘要(原文)
Although Multimodal Large Language Models (MLLMs) have made substantial progress, their spatial reasoning may still produce intermediate judgments inconsistent with the input image, allowing errors to propagate through the reasoning chain and affect the final answer. Existing methods mainly improve spatial reasoning through training or additional spatial information, without considering whether the reasoning process itself is faithful to the model input. Our study shows that unfaithful reasoning chains significantly reduce final-answer accuracy. To address this issue, we propose a modular and training-free framework for spatial reasoning verification and correction. The framework constructs a Spatial Evidence Graph (SEG), which associates atomic spatial evidence extracted from Chain-of-Thought reasoning with visual entities, spatial relations, source steps, and visual evidence. Spatial Evidence Reliability Assessment (SERA) evaluates the reliability of visual evidence based on object existence, localization, and geometric measurements. The framework then identifies the earliest spatial evidence unit contradicted by reliable visual evidence and guides the original MLLM to revise the subsequent reasoning and final answer. Across 15 model-dataset settings, our method achieves an average accuracy of 68.94%, outperforming the compared baselines by 8.55 percentage points on average. Our code will be open-sourced.