OpenBelief-Nav: Evidence-Preserving Object Memory for Open-Vocabulary Language-Guided Navigation
作者: Dinh Tuan Nguyen, Anh Dao, Phuong Nam Dang, Quan-Dung Pham, Tuyen P. Le, Truong Nguyen, Quan Nguyen
分类: cs.CV, cs.RO
发布日期: 2026-08-14
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出OpenBelief-Nav以解决开放词汇语言引导导航中的对象记忆问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇 语言引导导航 对象记忆 3D场景图 语义整合 机器人导航 智能系统 自主决策
📋 核心要点
- 现有的开放词汇导航方法在对象记忆方面存在不足,容易丢失少数但重要的任务相关假设。
- OpenBelief-Nav通过保留观察级别的短语和可靠性线索,提供了一种新的对象记忆机制,支持更灵活的任务特定读取。
- 实验结果显示,OpenBelief-Nav在多个场景中显著提高了mIoU得分和导航成功率,展示了其有效性。
📝 摘要(中文)
开放词汇的3D场景图为语言引导导航提供了紧凑的语义记忆,但现有方法通常通过单一的融合特征或语义标签来映射对象,这可能会去除任务时间接口中少数但相关的假设。本文提出OpenBelief-Nav,一种保留观察级短语、可靠性线索和帧掩码来源的证据保留对象记忆,同时保持独立的几何和视觉表示。语义相关短语被整合为一个与词汇无关的对象信念,从中进行任务特定的读取,执行固定词汇投影或自由形式检索。在五个ScanNet200和八个Replica场景中,完全信念投影的mIoU得分分别为0.2742和0.2912,而匹配的早期承诺读取为0.2393和0.2701。在78个HM3D-YCB导航试验中,共识和早期承诺检索各自成功60/78次,而信念加权检索和DualMap分别为58/78和55/78。20次Unitree G1运行中,允许最多两个验证候选尝试的纠正策略将目标确认成功率从6/10提高到8/10。
🔬 方法详解
问题定义:本文旨在解决开放词汇语言引导导航中对象记忆的不足,现有方法往往通过单一特征或标签来映射对象,导致任务相关假设的丢失。
核心思路:OpenBelief-Nav的核心思想是保留观察级别的短语和可靠性线索,构建一个证据保留的对象记忆,从而支持更灵活的任务特定读取和检索。
技术框架:该方法的整体架构包括对象记忆模块、语义短语整合模块和任务特定读取模块,分别负责存储、整合和检索信息。
关键创新:最重要的创新在于引入了与词汇无关的对象信念整合机制,使得语义相关短语能够被有效利用,而不是依赖于固定的标签。
关键设计:在设计中,采用了多层次的特征提取网络,并设置了适应性损失函数,以优化对象记忆的准确性和检索效率。具体的参数设置和网络结构细节将在后续部分详细讨论。
🖼️ 关键图片
📊 实验亮点
实验结果表明,OpenBelief-Nav在ScanNet200和Replica场景中的mIoU得分分别达到了0.2742和0.2912,相较于传统方法有显著提升。此外,在78个HM3D-YCB导航试验中,成功率达到了60/78,展示了其在实际应用中的有效性。
🎯 应用场景
OpenBelief-Nav的研究成果在智能机器人、自动驾驶和虚拟现实等领域具有广泛的应用潜力。通过提升语言引导导航的灵活性和准确性,该方法能够改善人机交互体验,并推动智能系统在复杂环境中的自主决策能力。
📄 摘要(原文)
Open-vocabulary 3D scene graphs provide compact semantic memory for language-guided navigation, but mapped objects are often exposed through a single fused feature or committed semantic label. Such commitment can remove minority yet task-relevant hypotheses from the task-time interface. We present OpenBelief-Nav, an evidence-preserving object memory that retains observation-level phrases, reliability cues, and frame-mask provenance while maintaining separate aggregate geometric and visual representations. Semantically related phrases are consolidated into a vocabulary-independent object belief from which task-specific readouts perform fixed-vocabulary projection or free-form retrieval. On five ScanNet200 and eight Replica scenes, full-belief projection achieves mIoU scores of 0.2742 and 0.2912, compared with 0.2393 and 0.2701 for a matched early-commit readout. Across 78 HM3D-YCB navigation trials, consensus and early-commit retrieval each achieve 60/78 successes, compared with 58/78 for belief-weighted retrieval and 55/78 for DualMap. Across 20 Unitree G1 runs organized as 10 matched evaluation cases, a correction policy permitting at most two verified candidate attempts improves target-confirmation success from 6/10 to 8/10 relative to top-1-only execution. Code will be released upon acceptance at https://openbelief-nav.github.io/.