Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
作者: Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang
分类: cs.RO
发布日期: 2026-08-18
💡 一句话要点
提出TAMP-Nav以解决现有视觉语言模型导航效率低下问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 具身导航 视觉语言模型 选择性推理 记忆机制 双层对齐 空间-时间指示符 智能体规划
📋 核心要点
- 现有的具身导航方法常常将视觉语言模型置于不自然的动作空间,导致效率低下和推理调度僵化。
- 论文提出了TAMP-Nav框架,通过像素到三维动作的公式化和选择性推理机制,提升了导航效率。
- 实验结果显示,TAMP-Nav在多个基准测试中表现优异,成功率达到66.2%,且训练效率显著提高。
📝 摘要(中文)
尽管大型视觉语言模型(VLMs)在具身导航方面取得了显著进展,但其直接应用仍面临挑战,现有方法常常将VLMs置于与其二维预训练先验不一致的非自然动作空间中,同时还存在推理调度僵化和内存管理效率低下的问题。为此,我们提出了TAMP-Nav,一个统一的高效具身导航框架。首先,我们引入了像素到三维动作的公式化(Point),将导航重新定义为二维视觉提示。其次,我们提出了集成的选择性推理和锚轨迹记忆机制(Think和Memorize),动态触发思维链并在关键节点保留高保真记忆。最后,我们设计了通过群体相对策略优化(GRPO)的高效双层对齐范式(Align),将全局结果奖励与细粒度过程奖励叠加,从而紧密对齐智能体的认知规划与物理环境反馈。实验表明,TAMP-Nav在R2R-CE上实现了66.2%的成功率,且训练效率高,仅需90k训练轨迹。
🔬 方法详解
问题定义:本论文旨在解决现有具身导航方法在视觉语言模型(VLMs)应用中的效率低下问题,尤其是由于动作空间不自然和内存管理不当导致的性能瓶颈。
核心思路:提出TAMP-Nav框架,通过将导航任务转化为二维视觉提示,利用VLM的二维能力进行高效导航,同时引入选择性推理和记忆机制以优化信息处理。
技术框架:TAMP-Nav框架包括三个主要模块:像素到三维动作的公式化(Point)、选择性推理与锚轨迹记忆机制(Think和Memorize)、以及双层对齐范式(Align)。这些模块协同工作,提升了导航的效率和准确性。
关键创新:最重要的创新在于将导航任务重新定义为二维视觉提示,使得VLM的执行与其预训练能力自然对齐,同时通过动态记忆管理提升了信息的使用效率。
关键设计:在设计中,采用了轻量级的空间-时间指示符来压缩冗余轨迹,并通过群体相对策略优化(GRPO)实现全局与局部奖励的结合,确保智能体的认知规划与环境反馈紧密对齐。
🖼️ 关键图片
📊 实验亮点
TAMP-Nav在R2R-CE基准测试中取得了66.2%的成功率,显著优于现有方法,且训练过程中仅需90k的训练轨迹,展现出高效的运行和样本利用率。
🎯 应用场景
该研究的潜在应用领域包括智能机器人导航、自动驾驶、虚拟现实等场景,能够显著提升智能体在复杂环境中的导航能力和效率。未来,该框架还可能扩展到其他需要高效信息处理的任务,如人机交互和智能助手等。
📄 摘要(原文)
Although Large Vision-Language Models (VLMs) have significantly advanced embodied navigation, their direct deployment remains challenging, as existing methods often force VLMs into unnatural action spaces that misalign with their 2D pre-training priors, compounded by rigid reasoning schedules and inefficient memory management. To overcome these limitations, we propose TAMP-Nav, a unified framework for efficient embodied navigation. First, we introduce a Pixel-to-3D Action Formulation (Point) that reformulates navigation into 2D visual prompting. Specifically, the VLM merely selects 2D pixels, which are then projected into 3D coordinates for a low-level SLAM controller. This design naturally aligns embodied execution with the VLM's inherent 2D visual capabilities. Second, we propose an integrated Selective Reasoning and Anchor-Trajectory Memory mechanism (Think and Memorize), which dynamically triggers Chain-of-Thought and retains high-fidelity memory only at critical nodes, compressing redundant trajectories into lightweight Space-Time Indicators, thereby preserving critical historical information and enhancing spatio-temporal perception. Finally, we design an efficient Two-Level Alignment Paradigm (Align) via Group Relative Policy Optimization (GRPO). By superimposing global outcome rewards with fine-grained process rewards, this dense supervision tightly aligns the agent's cognitive planning with physical environmental feedback, endowing the model with adaptive reasoning capabilities. Experiments demonstrate that TAMP-Nav achieves state-of-the-art performance (e.g., 66.2% SR on R2R-CE) with high runtime and sample efficiency (requiring only 90k training trajectories).