Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring

📄 arXiv: 2607.25448v1 📥 PDF

作者: Adam Scicluna, Gavin Paul, Alen Alempijevic

分类: cs.RO

发布日期: 2026-07-28

备注: 8 pages. Accepted to IROS 2026


💡 一句话要点

提出基于房间介导共现的零-shot物体中心语义导航方法

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 零-shot导航 物体中心 语义理解 房间概率向量 空间共现 无训练方法 路径规划

📋 核心要点

  1. 现有的零-shot物体导航方法在空间共现方面存在不足,直接的物体间相似性无法有效反映物体的空间关系。
  2. 论文提出了一种无训练的语义导航管道,通过房间概率向量(RPV)来调解物体关系,从而实现更有效的导航。
  3. 实验结果显示,该方法在HM3D数据集上相较于基线提高了3%的成功率和1.3%的加权逆路径长度成功率,表现出色。

📝 摘要(中文)

零-shot物体导航方法越来越多地使用视觉-语言先验,但在潜在空间中直接的物体间相似性往往是空间共现的弱代理。我们提出了一种分析性的、无训练的语义导航管道,通过紧凑的房间词汇来调解物体关系。每个物体标签被映射到一个基于CLIP的房间概率向量(RPV),并通过RPV分布重叠计算物体-目标共现。这些分数通过测地线洪水填充传播(快速行进方法)投影到价值图上,并用于根据语义分数对前沿进行排名。这些组件共同形成了一个集成的、无训练的、物体中心的开放词汇零-shot导航管道。结果表明,我们的物体中心方法在HM3D数据集验证集上相较于图像整体基线提高了3%的成功率(SR)和1.3%的加权逆路径长度成功率(SPL),同时保持了解释性和开放词汇灵活性。

🔬 方法详解

问题定义:本论文旨在解决现有零-shot物体导航方法在空间共现方面的不足,尤其是物体间相似性作为空间关系的代理效果较差的问题。

核心思路:我们提出通过房间概率向量(RPV)来调解物体关系,利用RPV的分布重叠来计算物体-目标共现,从而提高导航的语义准确性。

技术框架:整体架构包括三个主要模块:首先是物体标签到RPV的映射,其次是通过RPV分布重叠计算共现分数,最后是使用快速行进方法进行价值图的生成和前沿排名。

关键创新:本研究的核心创新在于提出了一种无训练的、基于房间介导共现的物体中心导航方法,显著区别于传统的图像整体方法,提升了导航的语义理解能力。

关键设计:关键设计包括RPV的构建和共现分数的计算方法,采用测地线洪水填充传播技术以实现信号的自适应衰减,确保导航的有效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的物体中心方法在HM3D数据集验证集上相较于图像整体基线提高了3%的成功率(SR)和1.3%的加权逆路径长度成功率(SPL),显示出显著的性能提升,同时保持了良好的可解释性和开放词汇灵活性。

🎯 应用场景

该研究的潜在应用领域包括智能机器人导航、虚拟现实环境中的交互以及自动化仓库管理等。通过提高物体中心的语义导航能力,该方法能够在复杂环境中实现更高效的路径规划和任务执行,具有重要的实际价值和未来影响。

📄 摘要(原文)

Zero-shot ObjectNav methods increasingly use vision-language priors, but direct object-object similarity in the latent space is often a weak proxy for spatial co-occurrence. We present an analytical, training-free semantic navigation pipeline that mediates object relationships through a compact room lexicon. Each object label is mapped to a CLIP-derived Room Probability Vector (RPV), and object-target co-occurrence is computed from RPV distribution overlap. These scores are projected onto a value map using geodesic flood-fill propagation (Fast Marching Method), with adaptive signal decay, and are used to rank frontiers by semantic score for navigation. Together, these components form an integrated, training-free, object-centric pipeline for open-vocabulary zero-shot navigation. Results show that our object-centric approach improves Success Rate (SR) and Success by weighted inverse Path Length (SPL) by a relative 3% and 1.3%, respectively, compared to image-holistic baselines on the HM3D dataset validation split, while preserving interpretability and open-vocabulary flexibility. Code is available at: uts-ri.github.io/RPV-SemNav.