Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

📄 arXiv: 2608.21170v1 📥 PDF

作者: Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

分类: cs.CV, cs.AI

发布日期: 2026-08-21

备注: Accepted at EMNLP 2026 (Findings)


💡 一句话要点

提出轻量级视觉支架以提升视觉语言模型空间推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 空间推理 多模态推理 视觉支架 模型训练 性能提升

📋 核心要点

  1. 现有视觉语言模型在空间推理任务中表现不佳,尤其是在视觉基础与推理过程的相互作用方面存在不足。
  2. 本文提出了轻量级的视觉支架,通过改善空间结构的可访问性,旨在提升VLMs在空间推理任务中的表现。
  3. 实验结果显示,使用这些支架后,模型的任务准确率提高了最多34.0个百分点,并且在GRPO训练下进一步提升了4.6个百分点。

📝 摘要(中文)

视觉语言模型(VLMs)在多模态推理方面取得了快速进展,但其失败往往反映了视觉基础与下游推理之间的相互作用。本文研究了任务的视觉呈现如何影响模型性能和失败模式,提出了轻量级输入侧支架,以提高空间结构的可访问性。通过在SPaRC基准上进行实验,发现这些支架在多个VLMs上将任务准确率提高了最多34.0个百分点,并进一步补充了基于GRPO的训练,带来了额外的4.6个百分点的准确率提升。分析表明,这些提升与减少基础相关错误密切相关,而规则推理仍然相对具有挑战性。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型在空间推理任务中由于视觉基础不足而导致的性能下降问题。现有方法在视觉呈现上存在局限,影响了模型的推理能力。

核心思路:通过引入轻量级的视觉支架,增强任务的空间结构可访问性,从而改善模型的推理表现。这样的设计使得模型在处理空间推理时能够更好地理解视觉信息。

技术框架:研究采用SPaRC基准进行实验,整体流程包括引入视觉支架、模型训练及性能评估。主要模块包括视觉输入处理、模型推理和结果分析。

关键创新:最重要的创新在于引入了轻量级的视觉支架,这一设计显著改善了模型在空间推理任务中的表现,与传统方法相比,能够有效减少基础相关错误。

关键设计:在实验中,支架的设计考虑了视觉信息的呈现方式,采用了特定的参数设置和损失函数,以确保模型能够更好地利用这些支架进行推理。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,使用轻量级视觉支架后,多个视觉语言模型的任务准确率提升了最多34.0个百分点,并在GRPO训练下进一步提高了4.6个百分点。这些结果显示出视觉呈现对模型性能的关键影响。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动驾驶、机器人导航等需要视觉与语言结合的场景。通过提升视觉语言模型的空间推理能力,可以更好地支持复杂任务的自动化处理,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision-language models (VLMs) have advanced rapidly in multimodal reasoning, yet recent work shows that their failures often reflect an interaction between visual grounding and downstream reasoning. What remains less clear is how the visual presentation of a task shapes model performance and failure modes when the underlying reasoning problem is unchanged. We study this question in SPaRC, a benchmark for grid-based visual spatial planning, by introducing lightweight input-side scaffolds that preserve the visual modality while making spatial structure more accessible. Across multiple VLMs, these scaffolds improve task accuracy over the original visual setting by up to 34.0 percentage points and further complement GRPO-based training, yielding up to 4.6 additional accuracy points compared with near-zero gains on the original visual input. Analyses on both end-to-end task solving and object detection show that these gains are closely tied to reductions in grounding-related errors, while rule reasoning remains comparatively challenging. We find that visual presentation is a central factor that determines whether VLM benchmarks measure grounded perception, downstream reasoning, or a mixture of both.