GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

📄 arXiv: 2608.09285v1 📥 PDF

作者: Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

分类: eess.SP, cs.AI

发布日期: 2026-08-10

备注: 13 pages, single column


💡 一句话要点

提出GLocFM以解决3D室内无线定位中的几何信息利用不足问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无线定位 几何感知 最大似然估计 3D点云 非视距传播 多模态学习 鲁棒性

📋 核心要点

  1. 现有的学习型无线定位方法未能有效利用几何信息,导致在非视距传播和场景泛化方面存在局限性。
  2. 本文提出GLocFM模型,通过结合WiFi测量和3D点云几何信息,优化定位过程,解决了现有方法的不足。
  3. 在多模态合成室内定位数据集上,GLocFM相较于先进基线模型,3D定位误差降低了49.5%,在真实测量数据集上降低了48.8%。

📝 摘要(中文)

基于学习的无线定位方法往往未能充分利用传播环境的几何信息,限制了其在非视距传播中的能力和跨场景的泛化能力。为了解决这一问题,本文提出了GLocFM,一个几何感知的定位基础模型,联合利用WiFi测量和以3D点云表示的场景几何。我们将定位问题形式化为最大似然估计问题,目标是找到一个最大化无线观测条件于场景几何的发射器位置。候选发射器位置的似然性通过学习的评分函数计算,该函数将观察到的延迟-到达角谱与为该候选位置预测的谱进行匹配。针对同步不完美的场景,我们进一步引入了一个时间飞行(ToF)鲁棒的GLocFM模型,以处理未知的ToF偏移。实验结果表明,GLocFM在合成和真实测量数据集上均显著降低了3D定位误差。

🔬 方法详解

问题定义:本文旨在解决现有无线定位方法未能充分利用几何信息的问题,尤其是在非视距传播场景中的局限性。现有方法往往忽视了环境几何特征,导致定位精度不足。

核心思路:GLocFM模型通过将WiFi信号测量与场景几何信息(3D点云)相结合,提出了一种新的最大似然估计方法,以提高定位的准确性和鲁棒性。

技术框架:GLocFM的整体架构包括一个层次化场景编码器,用于提取与传播相关的特征,并生成针对直射和一次反射路径的几何先验。模型通过学习的评分函数计算候选发射器位置的似然性。

关键创新:GLocFM的主要创新在于将几何信息与无线信号测量结合,提出了一种新的定位框架,显著提升了在复杂环境中的定位性能。与传统方法相比,GLocFM更好地处理了非视距传播和场景变化。

关键设计:模型设计中采用了多模态合成数据集进行训练,损失函数通过最大化似然估计进行优化。此外,针对时间飞行(ToF)偏移问题,设计了鲁棒的GLocFM模型,以适应不同的同步条件。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,GLocFM在合成数据集上相较于最先进的基线模型,3D定位误差降低了49.5%,在基于真实测量的NeRF$^{2}$数据集上降低了48.8%。这些结果验证了模型在不同场景下的有效性和鲁棒性。

🎯 应用场景

GLocFM模型在室内无线定位领域具有广泛的应用潜力,特别是在智能家居、机器人导航和增强现实等场景中。通过提高定位精度,该模型能够显著提升用户体验和系统性能,未来可能推动相关技术的进一步发展与应用。

📄 摘要(原文)

Learning-based wireless localizers often fail to utilize geometric information about the propagation environment, limiting their ability to exploit non-line-of-sight (NLoS) propagation and generalize across scenes. To bridge this gap, we propose GLocFM, a Geometry-aware Localization Foundation Model, which jointly exploits WiFi measurements and scene geometry represented as a 3D point cloud. We formulate localization as a maximum-likelihood (ML) estimation problem, where the goal is to find a transmitter position that maximizes the likelihood of the wireless observations conditioned on the scene geometry. The likelihood of a candidate transmitter position is calculated by a learned scoring function that matches the observed delay--angle-of-arrival (AoA) spectrum against the spectrum predicted for that candidate. A hierarchical scene encoder extracts propagation-relevant features to produce geometric priors for LoS and one-bounce reflection paths. For scenarios with imperfect synchronization, we further introduce a time-of-flight (ToF)-robust GLocFM model to handle unknown ToF offsets. GLocFM is trained on a multi-modal synthetic indoor localization dataset comprising 221 diverse scenes whose associated wireless signals are generated using Sionna RT. On both synthetic and the NeRF$^{2}$ dataset based on real measurements, GLocFM reduces mean 3D localization error relative to one of the state-of-the-art localization baselines by 49.5\% and 48.8\%, respectively. Ablations across different number of receiver, bandwidths, and array sizes further demonstrate the effectiveness and robustness of the proposed framework.