SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

📄 arXiv: 2607.27703v1 📥 PDF

作者: Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

分类: cs.AI

发布日期: 2026-07-30


💡 一句话要点

提出SpatialCLI框架以解决视觉语言模型的空间推理问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting)

关键词: 视觉语言模型 空间推理 工具使用 强化学习 感知能力 任务决策 基准测试

📋 核心要点

  1. 现有的视觉语言模型在空间推理上存在能力不匹配,无法有效利用视觉细节进行任务决策。
  2. SpatialCLI框架通过三个阶段教会VLMs如何使用空间工具,逐步内化专用感知能力。
  3. 在MindCube实验中,SpatialCLI显著提升了模型性能,从29.3%提高到84.6%,并在无工具情况下保持73.8%的准确率。

📝 摘要(中文)

视觉语言模型(VLMs)在具身智能体中越来越多地用于解释视觉输入、推理空间关系并基于此做出任务级决策。然而,现有的VLMs在整体任务推理上表现良好,但往往忽视决定成功的视觉细节;而专用视觉模型能够捕捉这些细节,但无法将其转化为任务级决策。为了解决这一能力不匹配问题,本文提出了SpatialCLI框架,旨在教会VLMs如何利用空间工具进行推理,并逐步内化这些工具所提供的专用感知能力。SpatialCLI分为三个阶段:调用、学习和内化。我们还引入了SpatialCLI-Bench,一个包含516个示例的基准,涵盖定位、分割、深度和姿态等复合感知任务。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型在空间推理中对视觉细节的忽视问题,现有方法无法有效结合整体任务推理与细节捕捉。

核心思路:SpatialCLI框架通过引入空间工具,增强VLMs的感知能力,并通过逐步内化这些能力来提升模型的任务决策能力。

技术框架:SpatialCLI分为三个主要阶段:1) 调用阶段,通过空间工具增强VLM的感知;2) 学习阶段,采用冷启动SFT和自主强化学习来改进工具使用;3) 内化阶段,将成功的工具使用轨迹进行语言化,以内化专用感知能力。

关键创新:最重要的创新在于通过空间工具的使用,解决了VLMs与专用视觉模型之间的能力不匹配问题,使得模型能够在任务决策中有效利用视觉细节。

关键设计:在学习阶段,采用冷启动SFT和强化学习相结合的方式,确保模型能够有效学习工具的使用,并在内化阶段通过语言化成功轨迹来巩固学习成果。具体的参数设置和损失函数设计尚未详细披露。

📊 实验亮点

在MindCube实验中,SpatialCLI框架使Qwen3-VL-8B-Instruct的性能从29.3%提升至84.6%,超越了使用工具的GPT-5.6 Sol(72.1%),并在内化后无工具情况下保持73.8%的准确率,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、智能助手和增强现实等场景,能够提升这些系统在复杂环境中的决策能力和任务执行效率。未来,SpatialCLI框架有望推动更高效的视觉语言模型发展,促进人机交互的智能化。

📄 摘要(原文)

Vision-language models (VLMs) are increasingly used in embodied agents to interpret visual inputs, reason about spatial relationships, and make task-level decisions based on that reasoning. However, a fundamental capability mismatch remains: general VLMs can reason about the overall task but often miss the visual details that determine success, while specialist vision models can capture those details but cannot translate them into task-level decisions. In this work, we propose SpatialCLI, a framework that teaches VLMs to reason with spatial tools and progressively internalize the specialist perceptual capabilities they provide. SpatialCLI proceeds in three stages: (1) Call exposes specialist vision models as spatial tools to augment the VLM's perception; (2) Learn uses Cold-Start SFT and agentic RL to improve tool use; and (3) Internalize verbalizes successful tool-use trajectories to internalize specialist perceptual capabilities. We further introduce SpatialCLI-Bench, a 516-example benchmark for compositional perception across localization, segmentation, depth, and pose. On MindCube, SpatialCLI raises Qwen3-VL-8B-Instruct from 29.3% to 84.6% with tools, surpassing GPT-5.6 Sol with tools (72.1%), while retaining 73.8% without tools after internalization.