LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

📄 arXiv: 2608.07079v1 📥 PDF

作者: Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

分类: cs.RO, cs.AI

发布日期: 2026-08-07

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出LifelongCrossNav以解决跨楼层多目标导航问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 多目标导航 跨楼层导航 持久语义记忆 3D可通行性 室内环境 机器人导航 智能家居

📋 核心要点

  1. 现有方法在多目标导航和跨楼层导航方面的处理通常是分开的,缺乏持久的语义记忆支持。
  2. 本文提出的LifelongCrossNav框架,通过共享的稀疏3D语义体素记忆,支持顺序多目标导航并实现跨楼层搜索。
  3. 实验结果显示,LifelongCrossNav在HM3D-MFMON基准上表现优异,超越了传统的平面持久语义地图方法。

📝 摘要(中文)

对象目标导航在语义感知和探索方面取得了显著进展,但多目标导航和跨楼层导航通常被分开处理。本文提出LifelongCrossNav框架,用于在未知的多层室内环境中进行顺序多目标导航。代理在每个回合中接收有序的对象目标查询,同时持续维护共享的稀疏3D语义体素记忆。该记忆逐步积累几何结构、可通行状态和视觉-语言特征,使后续对象目标查询能够检索先前获取的场景信息,而无需重建地图。为了支持跨楼层的持续搜索,LifelongCrossNav结合了支持感知的3D可通行性映射、特定楼梯的感知和方向感知的楼梯遍历。实验结果表明,LifelongCrossNav在HM3D-MFMON基准上始终优于代表性的平面持久语义地图基线,证明了持久3D语义记忆和跨楼层可通行性建模有效支持多层环境中的顺序多目标导航。

🔬 方法详解

问题定义:本文旨在解决在未知多层室内环境中进行顺序多目标导航时,缺乏持久语义记忆和跨楼层导航能力的问题。现有方法通常将多目标导航与跨楼层导航分开处理,导致信息重建和效率低下。

核心思路:LifelongCrossNav框架通过维护一个共享的稀疏3D语义体素记忆,能够在接收对象目标查询时持续更新和利用先前的场景信息,从而实现高效的多目标导航。

技术框架:该框架包括多个模块:首先是3D可通行性映射模块,负责生成和更新环境的可通行性信息;其次是楼梯特定感知模块,处理楼梯的识别和导航;最后是统一导航策略模块,协调同层探索、历史信息检索和目标对象搜索。

关键创新:最重要的创新在于引入了持久的3D语义记忆和跨楼层可通行性建模,使得代理能够在多层环境中高效地进行顺序多目标导航,这与现有方法的单层处理方式有本质区别。

关键设计:在设计中,采用了稀疏体素表示来存储环境信息,使用了支持感知的可通行性映射技术,并设计了针对楼梯的特定感知机制,以提高导航的准确性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LifelongCrossNav在HM3D-MFMON基准上相较于平面持久语义地图基线,性能提升显著,具体表现为成功率和导航效率的提高,验证了其在多层环境中的有效性。

🎯 应用场景

该研究的潜在应用场景包括智能家居、机器人配送和室内导航等领域,能够显著提升机器人在复杂多层环境中的自主导航能力。未来,该技术有望在更广泛的智能系统中得到应用,推动智能机器人技术的发展。

📄 摘要(原文)

Object-goal navigation has made substantial progress in semantic perception and exploration, yet persistent memory for multi-object navigation and cross-floor navigation are still commonly addressed separately. We present LifelongCrossNav, a framework for sequential multi-object ObjectNav in unknown multi-floor indoor environments. Within each episode, the agent receives an ordered sequence of object-goal queries while continuously maintaining a shared sparse 3D semantic voxel memory. This memory incrementally accumulates geometric structure, traversability states, and vision-language features, allowing subsequent object-goal queries to retrieve previously acquired scene information without rebuilding the map. To support persistent search across floors, LifelongCrossNav combines support-aware 3D traversability mapping, stair-specific perception, and direction-aware stair traversal. A unified navigation policy coordinates same-floor frontier exploration, live and historical point-of-interest retrieval, stair navigation, and target-object search and approach. We further introduce HM3D-MFMON, a benchmark for sequential Multi-Floor Multi-Object Navigation built on HM3D scenes, including a dedicated subset in which completing the full sequence of object-goal subtasks requires at least one floor transition. Experimental results show that LifelongCrossNav consistently outperforms a representative planar persistent semantic-map baseline on HM3D-MFMON, demonstrating that persistent 3D semantic memory and cross-floor traversability modeling effectively support sequential multi-object navigation in multi-floor environments. Project page: https://flageval-baai.github.io/LifelongCrossNavPage.