Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments
作者: Antoni Valls, Jordi Sanchez-Riera
分类: cs.CV
发布日期: 2026-08-24
💡 一句话要点
提出Spotter以解决城市环境中视觉定位精度不足的问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视觉定位 城市环境 建筑立面 GPS信号 实时处理 深度学习 多视图立体 智能导航
📋 核心要点
- 现有的视觉定位方法在城市环境中依赖GPS,但GPS信号在城市峡谷中常常受到干扰,导致定位精度下降。
- Spotter通过利用建筑立面作为全球地理参考,结合多视图立体深度和制图数据,构建紧凑的度量数据库,从而实现高效的视觉定位。
- 实验结果显示,Spotter在多个城市区域的测试中超越了传统的里程计方法,定位精度与先进的地图方法相当,同时帧率显著提高。
📝 摘要(中文)
在密集的城市环境中,机器人和可穿戴设备的准确视觉定位仍然面临挑战。现有方法通常依赖GPS进行绝对定位,但在城市峡谷中,GPS信号常常受到多路径传播的影响而降级。因此,标准解决方案如视觉里程计在时间上会出现不可避免的漂移,而地图匹配技术则难以获取所需的可靠GPS先验,并且计算负担过重,无法满足实时边缘执行的需求。为了解决这些局限性,本文提出了Spotter,一个稳健且实时的视觉定位框架,利用建筑立面作为可靠的全球地理参考,同时在可用时集成GPS信号。Spotter在离线阶段处理Google街景全景,通过语义分割立面并将多视图立体深度与制图数据配对,构建紧凑的度量数据库。在运行时,查询图像通过级联检索和几何验证管道进行匹配,以恢复精细的全球相机定位。实验结果表明,Spotter在多个巴塞罗那地区的可穿戴智能眼镜采集的行人序列数据集上表现优于基于里程计的基线,并在显著更高的帧率下实现了与最先进的基于地图的方法相当的定位精度。
🔬 方法详解
问题定义:本文旨在解决在密集城市环境中,现有视觉定位方法因GPS信号降级而导致的定位精度不足和实时性差的问题。现有技术如视觉里程计和地图匹配在此环境下表现不佳,无法满足实际应用需求。
核心思路:Spotter的核心思路是利用建筑立面作为可靠的全球地理参考,结合多视图立体深度信息和制图数据,构建一个紧凑的度量数据库,以提高定位的准确性和实时性。
技术框架:Spotter的整体架构包括离线处理和在线定位两个阶段。在离线阶段,系统处理Google街景全景图像,进行语义分割和深度信息配对,构建数据库;在在线阶段,查询图像通过级联检索和几何验证进行匹配,以实现精确定位。
关键创新:Spotter的主要创新在于将建筑立面作为全球定位的基础,克服了传统方法对GPS的依赖,同时通过高效的检索和验证机制实现了实时定位。与现有方法相比,Spotter在定位精度和计算效率上均有显著提升。
关键设计:在设计中,Spotter采用了多视图立体深度信息与制图数据的结合,使用了高效的语义分割算法,并在检索和验证阶段引入了级联机制,以提高匹配的准确性和速度。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Spotter在多个巴塞罗那地区的行人序列数据集上,定位精度优于传统的里程计方法,且在帧率上显著提高,达到了与最先进的地图方法相当的水平。这表明Spotter在实时视觉定位任务中的有效性和实用性。
🎯 应用场景
Spotter的研究成果在城市导航、自动驾驶、机器人定位等领域具有广泛的应用潜力。通过提高在GPS信号弱的环境中的定位精度,Spotter能够为智能交通系统、无人机导航和增强现实等技术提供更可靠的支持,推动相关领域的发展。
📄 摘要(原文)
Accurate visual localization on robotic and wearable platforms remains challenging in dense urban environments. Existing methodologies typically rely on GPS for absolute positioning, yet GPS signals frequently degrade in urban canyons due to multipath propagation. Consequently, standard solutions like visual odometry suffer from unmitigated drift over time, while map-matching techniques struggle to acquire the reliable GPS priors they need, on top of being too computationally heavy for real-time edge execution. To address these limitations, we propose Spotter, a robuts and real-time visual localization framework that uses building facades as a reliable source of global geo-reference, while retaining the capability to integrate GPS signals when available. In an offline stage, Spotter processes Google Street View panoramas by semantically segmenting facades and pairing multi-view stereo depth with cartographic data to build a compact metric database. At runtime, query images are matched via a cascaded retrieval and geometric verification pipeline to recover fine-grained global camera localization. We benchmark Spotter on a newly collected dataset of pedestrian sequences acquired with wearable smart glasses across several districts of Barcelona. Experimental results show that Spotter outperforms odometry-based baselines and achieves localization accuracy comparable to state-of-the-art map-based methods while operating at significantly higher frame rates.