DevGRU: Depth-guided Visual Navigation using a Collision-aware Recurrent Model

📄 arXiv: 2608.18470v1 📥 PDF

作者: Kyung Min Han, Eunsom Kim, Young J. Kim

分类: cs.RO

发布日期: 2026-08-19

备注: Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026


💡 一句话要点

提出DevGRU以解决复杂室内环境中的导航碰撞问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉导航 深度学习 机器人技术 碰撞检测 动作预测 室内环境 自主导航

📋 核心要点

  1. 现有视觉导航模型在复杂室内环境中容易发生碰撞,尤其是在狭窄通道和结构化布局中。
  2. 本文提出的DevGRU系统通过深度图像和目标点条件,结合动作预测器和碰撞预测器,有效避免障碍物。
  3. 实验结果显示,DevGRU在九个场景中显著超越了ViNT和NoMaD,且推理速度比NavDP快17倍。

📝 摘要(中文)

现有的视觉导航模型通常旨在开发能够在多种平台上进行机器人导航的基础模型。然而,这些模型在复杂的室内环境中,尤其是在结构化布局和狭窄通道中,容易发生碰撞。为了解决这一问题,本文提出了一种基于深度图像和目标点条件的导航系统DevGRU。该系统采用了一个动作预测器(AP),生成考虑碰撞的未来轨迹,从而有效避免即时障碍物。此外,AP还通过与碰撞预测器结合,补偿目标姿态估计中累积的误差,主动减轻未来的偏差。实验结果表明,DevGRU在九个不同场景中显著优于ViNT和NoMaD,并且在模型大小和推理时间上也表现出色。

🔬 方法详解

问题定义:现有的视觉导航模型在复杂室内环境中容易发生碰撞,尤其是在狭窄通道和结构化布局中,导致导航失败。

核心思路:本文提出的DevGRU系统通过结合深度图像和目标点条件,利用动作预测器(AP)生成考虑碰撞的未来轨迹,从而有效避免障碍物。

技术框架:DevGRU的整体架构包括深度图像输入、目标点条件、动作预测器和碰撞预测器。动作预测器生成未来轨迹,而碰撞预测器则帮助补偿目标姿态估计中的误差。

关键创新:DevGRU的主要创新在于其动作预测器能够生成碰撞-aware的轨迹,并通过与碰撞预测器的结合,主动减轻未来偏差,这在现有方法中尚属首次。

关键设计:在模型设计中,DevGRU采用了较少的可训练参数,确保了快速的推理时间,并在模型大小和推理速度上显著优于现有的基线模型。具体的损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DevGRU在九个不同场景中的导航性能显著优于ViNT和NoMaD,尤其是在模型大小上比NavDP小7倍,推理时间快17倍。这些数据表明DevGRU在实际应用中的高效性和可靠性。

🎯 应用场景

DevGRU的研究成果在复杂室内环境中的机器人导航具有广泛的应用潜力,尤其是在服务机器人、自动驾驶和智能家居等领域。其高效的碰撞避免能力和快速推理时间将提升机器人在动态环境中的自主导航能力,推动相关技术的实际应用和发展。

📄 摘要(原文)

Existing visual navigation models often aim to develop foundation models that can generalize robot navigation across diverse platforms. However, many of these models are prone to collisions when deployed in complex indoor environments, particularly in structured layouts and narrow passages. To address this problem, we propose a depth image- and point-goal-conditioned navigation system, DevGRU. The proposed system employs an action predictor (AP) that generates collision-aware future trajectories, enabling effective avoidance of immediate obstacles. In conjunction with a collision predictor, the AP further compensates for errors accumulated in the goal pose estimation and proactively mitigates future deviations. To evaluate our method, we conducted experiments across nine different scenes and three state-of-the-art approaches - ViNT, NoMaD, and NavDP - as well as four additional variants of ViNT and NoMaD. In terms of navigation performance, DevGRU significantly outperforms ViNT and NoMaD by a large margin. In addition, the proposed model has a relatively small number of trainable parameters, resulting in the fastest inference time among the baselines, particularly outperforming NavDP by 7x in model size and 17x in inference time.