CanonNav: Disentangling Navigation Behavior from Camera Geometry in Cross-Platform Visual Navigation
作者: Dong-Wook Kim, Ji-Hoon Hwang, E-In Son, Mintaek Oh, Seung-Woo Seo
分类: cs.RO
发布日期: 2026-08-31
💡 一句话要点
提出CanonNav以解决跨平台视觉导航中的行为与几何纠缠问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视觉导航 模仿学习 相机几何 跨平台 安全性监督 局部进展 机器人导航
📋 核心要点
- 现有方法在从图像-轨迹对学习时,导航行为与相机几何纠缠,导致学习不一致。
- 提出CanonNav,通过相机几何标准化解耦导航行为,并引入安全性和局部进展监督。
- 实验结果显示,CanonNav在多种环境中表现优异,超越了传统的RGB和RGB-D方法。
📝 摘要(中文)
尽管通过跨平台示范的模仿学习推动了视觉导航的发展,但充分利用这些数据仍然面临挑战。现有方法直接从图像-轨迹对学习,将导航行为与平台依赖的相机几何纠缠在一起,导致策略必须隐式推断相机几何,这一过程本质上是一个不适定的问题。此外,从示范轨迹中进行模仿学习捕捉了专家选择的运动,但其背后的中间决策却是隐式的。为了解决这些问题,本文提出了CanonNav,一个视觉导航框架,旨在将导航行为与相机几何解耦,并在跨平台示范学习中引入互补的规划监督。CanonNav引入了相机几何标准化,将视觉观察和轨迹转换为相机一致的表示空间,并基于此表示推导出安全性和局部进展监督。实验结果表明,尽管在推理时仅使用RGB,CanonNav在各种相机配置和环境中始终优于基于RGB的基线,甚至在挑战性场景中超越了基于RGB-D的方法。
🔬 方法详解
问题定义:本文旨在解决跨平台视觉导航中导航行为与相机几何的纠缠问题。现有方法迫使策略隐式推断相机几何,导致学习过程不稳定且不一致。
核心思路:CanonNav通过相机几何标准化将视觉观察和轨迹转换为一致的表示空间,从而解耦导航行为与相机几何。此外,论文引入了安全性和局部进展监督,以增强学习过程的稳定性和有效性。
技术框架:CanonNav的整体架构包括三个主要模块:相机几何标准化模块、轨迹生成模块和监督学习模块。相机几何标准化模块负责将输入的视觉数据转换为一致的表示,轨迹生成模块则基于该表示生成安全和有效的导航轨迹,监督学习模块则利用伪标签进行训练。
关键创新:最重要的创新点在于相机几何标准化的引入,使得视觉观察与导航行为的学习过程不再受限于特定平台的相机几何,从而提高了模型的泛化能力。
关键设计:在设计中,采用了特定的损失函数来平衡安全性和局部进展的监督,同时使用了离线可通行性估计器生成伪标签,以指导模型的学习过程。
🖼️ 关键图片
📊 实验亮点
实验结果表明,CanonNav在多种相机配置和环境中表现优异,尽管仅使用RGB数据进行推理,仍然超越了基于RGB的基线,并在挑战性场景中超过了RGB-D方法,显示出显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括自主机器人导航、无人驾驶汽车以及增强现实等场景。通过解耦导航行为与相机几何,CanonNav能够在多种环境中实现更高效的导航,提升机器人在复杂场景中的适应能力和安全性,未来可能对智能交通和智能家居等领域产生深远影响。
📄 摘要(原文)
While visual navigation has advanced through imitation learning from cross-platform demonstrations, fully leveraging such data remains challenging. First, directly learning from image-trajectory pairs entangles navigation behavior with platform-dependent camera geometry. This hinders consistent learning by forcing the policy to implicitly infer camera geometry from visual observations, an inherently ill-posed problem. Second, imitation learning from demonstrated trajectories captures the expert's chosen motion but leaves the intermediate decisions underlying that motion implicit. To address these issues, we propose CanonNav, a visual navigation framework that disentangles navigation behavior from camera geometry and incorporates complementary planning supervision into learning from cross-platform demonstrations. CanonNav introduces camera geometry canonicalization, which transforms visual observations and trajectories into a camera-consistent representation space. Building on this representation, we derive safety and local-progress supervision using pseudo-labels from an offline traversability estimator. Safety supervision penalizes unsafe trajectories, while local-progress supervision guides where the robot should advance. Experiments across diverse camera configurations and environments show that, despite using only RGB at inference, CanonNav consistently outperforms RGB-based baselines and even surpasses RGB-D-based methods in challenging scenarios.