Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment

📄 arXiv: 2609.03906v1 📥 PDF

作者: Shuhao Ye, Sitong Mao, Yuxiang Cui, Yufei Wei, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

分类: cs.RO

发布日期: 2026-09-03


💡 一句话要点

提出基于拓扑图的宏观动作闭环强化学习以解决视觉语言导航问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 闭环强化学习 分层马尔可夫决策过程 拓扑图 样本效率 动态前沿动作 图基PPO 智能体决策

📋 核心要点

  1. 现有的模仿学习方法在闭环视觉语言导航中面临分布偏移和专家动作模糊的问题,导致性能下降。
  2. 本文提出将视觉语言导航重构为分层马尔可夫决策过程,通过拓扑图抽象环境,实现高层规划与低层控制的解耦。
  3. 实验结果显示,所提方法在R2R-CE和RxR-CE基准上达到了最先进的性能,验证了其有效性。

📝 摘要(中文)

视觉语言导航在连续环境中要求智能体根据自然语言指令在未知环境中行动。现有的模仿学习方法在闭环设置中面临挑战:行为克隆受到分布偏移的影响,而DAgger的专家动作在轨迹偏离时变得模糊。虽然强化学习提供了一种自然的解决方案,但直接应用于微观动作空间时,由于奖励稀疏性,样本效率较低。为了解决这一瓶颈,本文将视觉语言导航重新构建为分层马尔可夫决策过程,明确将高层规划与低层控制解耦。通过将环境抽象为拓扑图,我们的高层策略在前沿节点的宏观动作空间上操作,训练无关的低层控制器作为状态转移,从而显著压缩决策视野,使闭环强化学习变得可行。我们还提出了一种动作感知值头,以有效评估动态前沿动作空间下的状态值,推动基于图的PPO。大量实验表明我们架构的有效性,并在R2R-CE和RxR-CE基准上实现了最先进的性能。

🔬 方法详解

问题定义:本文旨在解决在连续环境中进行视觉语言导航时,现有模仿学习方法在闭环设置下的性能不足,尤其是行为克隆和DAgger方法的局限性。

核心思路:通过将视觉语言导航问题重构为分层马尔可夫决策过程,明确高层规划与低层控制的解耦,利用拓扑图来简化决策过程,从而提高样本效率。

技术框架:整体架构包括高层策略和低层控制器。高层策略在宏观动作空间(前沿节点)上进行决策,而低层控制器则负责状态转移,形成闭环控制。

关键创新:最重要的创新在于将环境抽象为拓扑图,并引入训练无关的低层控制器,使得闭环强化学习在宏观决策空间中变得可行,显著提高了样本效率。

关键设计:设计了动作感知值头以评估动态前沿动作空间下的状态值,并采用基于图的PPO算法进行优化,确保了在复杂环境中的有效学习。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,所提出的方法在R2R-CE和RxR-CE基准上实现了最先进的性能,相较于现有方法,性能提升显著,验证了该架构在复杂环境中的有效性和可行性。

🎯 应用场景

该研究的潜在应用领域包括智能机器人导航、自动驾驶系统以及人机交互等场景。通过提高视觉语言导航的效率和准确性,能够在复杂环境中实现更智能的决策,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision-Language Navigation in Continuous Environments (VLN-CE) requires an agent to follow natural language instructions through unseen environments. Existing imitation learning (IL) pipelines struggle in this closed-loop setting: behavior cloning suffers from distribution shift, and DAgger's expert actions become ambiguous upon trajectory deviation. While Reinforcement Learning (RL) offers a natural paradigm to address this, directly applying RL to micro action spaces is sample-inefficient due to reward sparsity. To overcome this bottleneck, we reformulate VLN-CE as a Hierarchical Markov Decision Process (MDP), explicitly decoupling high-level planning from low-level control. By abstracting the environment into a topological graph, our high-level policy operates on a macro action space of frontier nodes, with a training-free low-level controller acting as its state transition, which significantly compresses the decision horizon and makes closed-loop RL tractable. To support RL optimization on the macro MDP, we propose an action-aware value head to effectively evaluate state values under the dynamic frontier action space, powering a graph-based PPO. Extensive experiments demonstrate the effectiveness of our architecture. Finally, our model achieves state-of-the-art performance on the R2R-CE and RxR-CE benchmarks.