Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring
作者: Adam Scicluna, Gavin Paul, Alen Alempijevic
分类: cs.RO
发布日期: 2026-07-28
备注: 8 pages. Accepted to IROS 2026
💡 一句话要点
提出基于房间介导共现的零-shot物体中心语义导航方法
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 零-shot导航 物体中心 语义理解 房间概率向量 空间共现 无训练方法 路径规划
📋 核心要点
- 现有的零-shot物体导航方法在空间共现方面存在不足,直接的物体间相似性无法有效反映物体的空间关系。
- 论文提出了一种无训练的语义导航管道,通过房间概率向量(RPV)来调解物体关系,从而实现更有效的导航。
- 实验结果显示,该方法在HM3D数据集上相较于基线提高了3%的成功率和1.3%的加权逆路径长度成功率,表现出色。
📝 摘要(中文)
零-shot物体导航方法越来越多地使用视觉-语言先验,但在潜在空间中直接的物体间相似性往往是空间共现的弱代理。我们提出了一种分析性的、无训练的语义导航管道,通过紧凑的房间词汇来调解物体关系。每个物体标签被映射到一个基于CLIP的房间概率向量(RPV),并通过RPV分布重叠计算物体-目标共现。这些分数通过测地线洪水填充传播(快速行进方法)投影到价值图上,并用于根据语义分数对前沿进行排名。这些组件共同形成了一个集成的、无训练的、物体中心的开放词汇零-shot导航管道。结果表明,我们的物体中心方法在HM3D数据集验证集上相较于图像整体基线提高了3%的成功率(SR)和1.3%的加权逆路径长度成功率(SPL),同时保持了解释性和开放词汇灵活性。
🔬 方法详解
问题定义:本论文旨在解决现有零-shot物体导航方法在空间共现方面的不足,尤其是物体间相似性作为空间关系的代理效果较差的问题。
核心思路:我们提出通过房间概率向量(RPV)来调解物体关系,利用RPV的分布重叠来计算物体-目标共现,从而提高导航的语义准确性。
技术框架:整体架构包括三个主要模块:首先是物体标签到RPV的映射,其次是通过RPV分布重叠计算共现分数,最后是使用快速行进方法进行价值图的生成和前沿排名。
关键创新:本研究的核心创新在于提出了一种无训练的、基于房间介导共现的物体中心导航方法,显著区别于传统的图像整体方法,提升了导航的语义理解能力。
关键设计:关键设计包括RPV的构建和共现分数的计算方法,采用测地线洪水填充传播技术以实现信号的自适应衰减,确保导航的有效性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的物体中心方法在HM3D数据集验证集上相较于图像整体基线提高了3%的成功率(SR)和1.3%的加权逆路径长度成功率(SPL),显示出显著的性能提升,同时保持了良好的可解释性和开放词汇灵活性。
🎯 应用场景
该研究的潜在应用领域包括智能机器人导航、虚拟现实环境中的交互以及自动化仓库管理等。通过提高物体中心的语义导航能力,该方法能够在复杂环境中实现更高效的路径规划和任务执行,具有重要的实际价值和未来影响。
📄 摘要(原文)
Zero-shot ObjectNav methods increasingly use vision-language priors, but direct object-object similarity in the latent space is often a weak proxy for spatial co-occurrence. We present an analytical, training-free semantic navigation pipeline that mediates object relationships through a compact room lexicon. Each object label is mapped to a CLIP-derived Room Probability Vector (RPV), and object-target co-occurrence is computed from RPV distribution overlap. These scores are projected onto a value map using geodesic flood-fill propagation (Fast Marching Method), with adaptive signal decay, and are used to rank frontiers by semantic score for navigation. Together, these components form an integrated, training-free, object-centric pipeline for open-vocabulary zero-shot navigation. Results show that our object-centric approach improves Success Rate (SR) and Success by weighted inverse Path Length (SPL) by a relative 3% and 1.3%, respectively, compared to image-holistic baselines on the HM3D dataset validation split, while preserving interpretability and open-vocabulary flexibility. Code is available at: uts-ri.github.io/RPV-SemNav.