SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

📄 arXiv: 2608.14138v1 📥 PDF

作者: Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

分类: cs.CV, cs.AI

发布日期: 2026-08-14


💡 一句话要点

提出SPARGen以统一空间感知与推理问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 空间感知 空间推理 多模态生成 3D重建 密集对应 知识转移 指令条件生成

📋 核心要点

  1. 现有方法通常将空间感知与推理分开处理,导致知识转移受限,无法充分利用互补信息。
  2. SPARGen通过将3D重建、密集对应和空间推理统一为指令条件生成任务,提出了一种新的多模态框架。
  3. 实验结果显示,SPARGen在多个空间任务上表现出竞争力,证明了其在多模态生成框架中的有效性。

📝 摘要(中文)

空间感知与推理需要从视觉观察中恢复几何结构、建立对应关系并理解空间关系。现有方法通常将这些能力分开处理,使用特定任务的架构或外部几何模块,限制了同一物理场景的互补表示之间的知识转移。本文提出SPARGen,一个统一的多模态框架,将3D重建、密集对应和空间推理视为基于指令的生成任务。SPARGen将紧凑的结构化和语言输出序列化为令牌序列,同时以图像对齐的形式生成密集几何场,使空间监督共同塑造共享表示。实验结果表明,SPARGen在单一的多模态生成框架内,在3D重建、对应和空间推理的基准测试中表现出竞争力。

🔬 方法详解

问题定义:本文旨在解决空间感知与推理任务中现有方法的局限性,特别是它们在处理几何结构和空间关系时的分离性,导致知识转移不足。

核心思路:SPARGen的核心思路是将3D重建、密集对应和空间推理视为基于指令的生成任务,通过统一的多模态框架来实现这些任务的协同处理。这样的设计使得不同任务之间可以共享知识,提升整体性能。

技术框架:SPARGen的整体架构包括多个模块,首先是输入的视觉观察,然后通过指令条件生成密集几何场,最后输出结构化和语言形式的结果。整个流程通过空间监督来优化共享表示。

关键创新:SPARGen的主要创新在于将空间感知与推理任务统一为生成任务,打破了传统方法的局限,使得不同任务之间的知识能够有效转移。

关键设计:在设计上,SPARGen采用了紧凑的结构化输出和图像对齐的几何场生成,使用特定的损失函数来优化生成质量,并通过多模态生成模型来实现任务的协同学习。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在多个基准测试中,SPARGen在3D重建、密集对应和空间推理任务上均表现出色,取得了与现有最先进方法相当的性能,证明了其在单一多模态生成框架中的有效性和竞争力。

🎯 应用场景

SPARGen的研究成果在机器人导航、增强现实和自动驾驶等领域具有广泛的应用潜力。通过统一的空间感知与推理能力,该框架能够提升机器对复杂环境的理解和决策能力,推动智能系统的发展。未来,SPARGen可能会在多模态学习和人机交互中发挥更大的作用。

📄 摘要(原文)

Spatial perception and reasoning from visual observations require recovering geometric structure, establishing correspondences, and understanding spatial relations. Existing approaches typically address these capabilities separately using task-specific architectures or external geometric modules, limiting knowledge transfer among complementary representations of the same physical scene. We introduce SPARGen, a unified multimodal framework that casts 3D reconstruction, dense correspondence, and spatial reasoning as instruction-conditioned generation tasks. SPARGen serializes compact structured and linguistic outputs as token sequences while generating dense geometric fields in image-aligned forms, enabling spatial supervision to jointly shape shared representations within a native multimodal generative model. Experiments across benchmarks for 3D reconstruction, correspondence, and spatial reasoning show that SPARGen achieves competitive performance across heterogeneous spatial tasks within a single native multimodal generative framework.