GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
作者: Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li
分类: cs.CV
发布日期: 2026-08-06
💡 一句话要点
提出GST-Bench以解决视频理解中的全球空间意识问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)
关键词: 全球空间意识 视频理解 视觉问答 长视频流 空间推理
📋 核心要点
- 现有方法主要关注局部空间感知,缺乏对长时间视频流的全球空间意识,导致模型性能不足。
- 本文提出GST-Bench基准,要求模型在新视角下进行空间推理,并映射自我中心观察到全球图像。
- 实验表明,当前最强的视觉语言模型在GST-Bench上仅得42.68,远低于人类的79.08,显示出显著的性能差距。
📝 摘要(中文)
空间智能是具身智能体的基础,但现有基准测试主要集中于局部空间感知,忽视了对连续长时间视觉流的全球空间意识。为了解决这一局限性,本文提出了全球空间时间基准(GST-Bench),这是一个针对视频理解的全球空间智能的视觉问答基准,包含来自6790分钟合成视频的人类验证问题。该基准要求模型从输入视频中未见的新视角进行准确的空间推理,并将自我中心观察映射到全球自上而下的图像。对22种最先进的视觉语言模型的全面评估显示,模型与人类之间存在显著差距:最强的零-shot模型仅达到42.68,远低于人类的79.08。为探究这一差距的原因,本文构建了GST-Bench-Local,发现尽管模型在相同任务下具有强大的局部空间理解能力,但仍未能将长时间观察整合为全球一致的场景表示。此外,本文还提供了GST-Train数据集,以促进未来在这一挑战上的研究。
🔬 方法详解
问题定义:本文旨在解决现有视觉语言模型在长视频理解中缺乏全球空间意识的问题。现有方法通常只关注局部视角,无法有效整合长时间观察。
核心思路:提出GST-Bench基准,要求模型从未见的新视角进行空间推理,并将自我中心观察映射到全球视图,以提升模型的全球空间理解能力。
技术框架:GST-Bench包含多个模块,包括问题生成、视频处理和空间推理。模型需要在不同视角下进行推理,并与人类验证的问题进行对比。
关键创新:最重要的创新在于引入了GST-Bench-Local,揭示了模型在局部理解强但全球一致性差的现象,推动了对长时间视频理解的研究。
关键设计:在模型设计中,采用了特定的损失函数以优化空间推理能力,并通过多视角数据增强来提高模型的泛化能力。
🖼️ 关键图片
📊 实验亮点
在GST-Bench基准测试中,最强的视觉语言模型仅获得42.68的得分,远低于人类的79.08,显示出模型在全球空间推理方面的显著不足。这一结果强调了当前技术在长时间视频理解中的局限性,并为未来研究提供了明确的方向。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动驾驶、视频监控和虚拟现实等。通过提升模型的全球空间意识,能够使得具身智能体在复杂环境中更好地理解和互动,从而提高其决策能力和适应性。未来,该研究可能推动更智能的视觉理解系统的发展,促进人机协作的进步。
📄 摘要(原文)
Spatial intelligence is fundamental to embodied agents, yet existing benchmarks focus on local spatial perception from single or few viewpoints, overlooking global spatial awareness over continuous, long-horizon visual streams. To address this limitation, we introduce the Global-Spatial-Temporal Benchmark (GST-Bench), a VQA benchmark for global spatial intelligence in video understanding, comprising human-verified questions derived from 6,790 minutes of synthetically generated video. It requires models to perform accurate spatial inference from novel viewpoints unseen in the input video and to map egocentric observations onto global top-down images. A comprehensive evaluation of 22 state-of-the-art VLMs exposes a striking gap between models and humans: the strongest zero-shot model attains only 42.68, far below the human score of 79.08. To probe the cause of this gap, we construct GST-Bench-Local and find that models, despite strong local spatial understanding under the same task formulation, still fail to consolidate long-horizon observations into a globally consistent scene representation. We further provide GST-Train, a dataset for global spatial reasoning, as a complementary resource to facilitate future research on this challenge.