AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation
作者: Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu
分类: cs.RO
发布日期: 2026-08-11
💡 一句话要点
提出AECNav以解决零-shot开放词汇物体导航问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 零-shot导航 开放词汇 机器人感知 证据驱动 主动探索 物体定位 深度学习 智能机器人
📋 核心要点
- 现有的零-shot物体目标导航方法面临高延迟和准确性不足的问题,主要由于冗余的感知流程和证据不足。
- 本文提出的AECNav通过将ZSON视为证据驱动的感知到决策问题,设计了证据门控感知、证据整合和主动证据获取三个核心组件。
- AECNav在HM3D-v2、HM3D-OVON和MP3D等基准测试中分别取得84.7%、57.3%和51.3%的成功率,并在物理四足机器人上实现95%的成功率。
📝 摘要(中文)
零-shot物体目标导航(ZSON)在开放词汇场景中面临挑战,因为它要求机器人在未见环境中定位任意指定的物体,而无需特定任务的训练。目前,该任务由于冗余的感知管道和不足的证据确认而导致高延迟和有限的准确性。本文将ZSON重新定义为一个基于证据的感知到决策问题,并提出AECNav,一个无训练的管道,包含三个核心组件:证据门控感知、证据整合和主动证据获取。AECNav在多个基准测试中显著超越了现有方法,并在物理四足机器人上实现了95%的成功率。
🔬 方法详解
问题定义:本文旨在解决零-shot物体目标导航中机器人在未见环境中定位物体的挑战,现有方法由于冗余的感知管道和不足的证据确认,导致高延迟和低准确性。
核心思路:论文将ZSON重新定义为一个基于证据的感知到决策问题,通过设计证据门控感知、证据整合和主动证据获取三个组件,旨在提高导航效率和准确性。
技术框架:AECNav的整体架构包括三个主要模块:证据门控感知模块负责消除冗余计算,证据整合模块聚合检测结果并区分真实目标与干扰物,主动证据获取模块则在弱语义线索下选择最大信息增益的探索前沿。
关键创新:AECNav的核心创新在于将证据驱动的思维引入导航任务,通过有效整合和利用感知证据,显著提高了导航的成功率和效率。
关键设计:在设计中,采用共享编码机制以建立统一的语义基础,证据整合通过聚合检测结果形成集群级别的对数信念,同时在选择探索前沿时最大化信息增益,确保低成本的有效探索。
🖼️ 关键图片
📊 实验亮点
AECNav在多个基准测试中表现优异,分别在HM3D-v2、HM3D-OVON和MP3D上取得84.7%、57.3%和51.3%的成功率,且在物理四足机器人上实现95%的成功率,显示出显著的性能提升和较低的推理开销。
🎯 应用场景
AECNav的研究成果在机器人导航、智能家居、无人驾驶等领域具有广泛的应用潜力。通过提高机器人在复杂环境中的自主导航能力,该技术能够促进智能设备的普及与应用,提升人机交互的智能化水平。
📄 摘要(原文)
Zero-shot object-goal navigation (ZSON) in open-vocabulary scenarios is challenging, as it requires a robot to locate an arbitrarily specified object in an unseen environment without task-specific training. Currently, the task still suffers from high latency and limited accuracy due to redundant perception pipelines and insufficient evidence for reliable target confirmation. In this letter, we reframe ZSON as an evidence-driven perception-to-decision problem and present AECNav, a training-free pipeline built on three components: i) Evidence-gated perception, which utilizes a shared encoding across all reasoning stages to establish a unified semantic basis and eliminate redundant computations; ii) Evidence consolidation, which aggregates detections into cluster-level log-odds beliefs. This explicitly separates genuine target support from the false confidence of visually similar distractors, while treating the absence of expected detections as negative evidence; and iii) Active evidence acquisition, which sustains productive exploration under weak semantic cues by selecting frontiers that maximize information gain at minimal traversal cost. As a result, AECNav significantly outperforms previous methods and achieves state-of-the-art success rates of 84.7%, 57.3%, and 51.3% on HM3D-v2, HM3D-OVON, and MP3D, respectively, with substantially lower inference overhead, and attains 95% success across 40 trials on a physical quadruped robot at roughly 5Hz. Code will be made publicly available upon acceptance.