OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

📄 arXiv: 2608.14160v1 📥 PDF

作者: Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

分类: cs.RO

发布日期: 2026-08-14

备注: Technical report. 11 pages, 6 figures, and 2 tables


💡 一句话要点

提出OccPlanner以解决像素目标导航中的3D目标定位问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)

关键词: 像素目标导航 3D目标定位 占用条件规划 扩散规划器 自主机器人

📋 核心要点

  1. 现有的像素目标导航方法在3D目标定位和无碰撞规划方面面临挑战,缺乏有效的深度和可通行性信息。
  2. OccPlanner通过结合时间视觉上下文和局部3D占用特征,实现了对像素目标的有效定位和规划。
  3. 在5-8米的设置中,OccPlanner的平均成功率从20.81%提升至71.55%,在复杂场景中表现尤为突出。

📝 摘要(中文)

像素目标导航直接在智能体的摄像头视野中指定目标,但目标像素并不提供度量深度或可通行性,这使得3D目标定位和无碰撞的连续规划变得具有挑战性。本文提出了OccPlanner,这是一种目标感知的占用条件扩散规划器,能够在自我中心的度量空间中定位像素目标,并根据时间视觉上下文和学习的局部3D占用特征顺序地调整目标表示。为大规模提供占用监督,本文引入L3ROcc,通过几何重建和基于光线的可见性推理,将单目RGB导航视频转换为机器人中心的局部3D占用注释。我们在InternData-N1上训练OccPlanner,并在闭环仿真中评估其在四个未见场景类别和两个目标距离范围内的表现。

🔬 方法详解

问题定义:本文旨在解决像素目标导航中缺乏度量深度和可通行性信息的问题,现有方法在3D目标定位和无碰撞规划方面存在显著不足。

核心思路:OccPlanner通过在自我中心的度量空间中定位像素目标,并结合时间视觉上下文和局部3D占用特征,提供了一种新的规划思路。

技术框架:整体架构包括目标感知模块、占用条件扩散模块和基于L3ROcc的监督模块,形成一个闭环的规划系统。

关键创新:L3ROcc的引入是本文的核心创新,它通过几何重建和光线可见性推理,将单目RGB视频转换为局部3D占用注释,显著提升了占用监督的有效性。

关键设计:在网络结构上,采用了多层卷积网络以提取视觉特征,并设计了特定的损失函数以优化目标定位和路径规划的精度。通过这些设计,OccPlanner能够在复杂环境中实现高效的导航。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在5-8米的目标距离设置中,OccPlanner的平均成功率从20.81%提升至71.55%,在复杂场景中成功率达到86.20%和84.92%。这些结果表明,OccPlanner在像素目标导航任务中显著优于现有方法NavDP,展示了其强大的实用性和有效性。

🎯 应用场景

该研究的潜在应用领域包括自主机器人导航、智能家居系统和无人驾驶汽车等。通过提高像素目标导航的精度和效率,OccPlanner能够在复杂环境中实现更安全、更智能的自动化操作,具有重要的实际价值和广泛的未来影响。

📄 摘要(原文)

Pixel-goal navigation specifies targets directly in the agent's camera view, but a target pixel provides neither metric depth nor traversability, making 3D goal grounding and collision-free continuous planning challenging. We present OccPlanner, a goal-aware occupancy-conditioned diffusion planner that grounds pixel goals in egocentric metric space and sequentially conditions the goal representation on temporal visual context and learned local 3D occupancy features. To provide occupancy supervision at scale, we introduce L3ROcc, which converts monocular RGB navigation videos into robot-centric local 3D occupancy annotations through geometric reconstruction and ray-based visibility reasoning. We train OccPlanner on InternData-N1 and evaluate it in closed-loop simulation across four unseen scene categories from InternScenes and two goal-distance ranges. In the 5-8 m setting, OccPlanner increases the average success rate (SR) over NavDP from 20.81% to 71.55% across the four categories, reaching 86.20% and 84.92% in cluttered-easy and cluttered-hard scenes, respectively. Real-world open-loop experiments on a Unitree Go2 further provide initial evidence of sim-to-real transfer and adaptation with L3ROcc-generated supervision.