LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

📄 arXiv: 2609.02350v1 📥 PDF

作者: Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

分类: cs.CV, cs.RO

发布日期: 2026-09-02

备注: 19 Pages, 7 Figures. Accepted in EMNLP 2026 Main

🔗 代码/项目: GITHUB


💡 一句话要点

提出LookStep以解决视觉语言导航中的资源效率问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 多模态大语言模型 事件驱动记忆 未来状态建模 资源效率

📋 核心要点

  1. 现有视觉语言导航方法仅依赖专家动作进行下一步预测,导致对大量训练数据的需求和高计算开销。
  2. LookStep框架结合了语言中心的未来状态建模和事件驱动的滚动记忆,提升了资源使用效率。
  3. 在VLN-CE任务中,LookStep在相同训练条件下成功率达到49.7%,显著优于现有方法。

📝 摘要(中文)

视觉语言导航(VLN)要求智能体在未知环境中根据自然语言指令进行导航。现有方法主要依赖于多模态大语言模型(MLLMs),但存在仅依赖专家动作进行下一步预测的问题,导致对大量数据的需求。此外,现有方法依赖于认知地图、历史帧或外部3D工具来维护状态,造成高计算和内存开销。为了解决这些问题,本文提出了LookStep,一个统一的端到端框架,结合了以语言为中心的未来状态建模和事件驱动的滚动记忆,能够生成粗粒度的导航进度和未来状态,同时自主决定是否将观察写入有语义角色的有限滚动记忆。实验证明,LookStep在VLN-CE任务上表现优异,在相同训练设置下,R2R-CE Val-Unseen的成功率达到49.7%,且内存效率更高,数据使用更少。

🔬 方法详解

问题定义:本文旨在解决视觉语言导航中对大量数据和高计算资源的依赖问题。现有方法通过专家动作预测下一步行动,导致训练效率低下和内存开销大。

核心思路:LookStep通过结合语言中心的未来状态建模和事件驱动的滚动记忆,利用语言标签生成导航进度和未来状态,从而减少对数据的需求和计算资源的消耗。

技术框架:LookStep的整体架构包括两个主要模块:语言中心的未来状态建模模块和事件驱动的滚动记忆模块。前者负责生成每个候选动作的粗粒度导航进度,后者则根据语义角色决定是否将观察写入滚动记忆。

关键创新:LookStep的创新在于其事件驱动的滚动记忆机制,能够根据当前状态和语言指令动态调整记忆的写入,显著提高了内存使用效率,与传统方法相比,减少了对外部工具的依赖。

关键设计:在设计中,LookStep采用了特定的损失函数来优化未来状态的预测精度,同时在网络结构上实现了模块化设计,以便于不同任务的适应性调整。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,LookStep在VLN-CE任务上表现优异,R2R-CE Val-Unseen的成功率达到49.7%。与现有方法相比,LookStep在内存效率和数据使用上均有显著提升,展示了其在资源受限环境中的优势。

🎯 应用场景

LookStep的研究成果在智能导航、机器人控制和人机交互等领域具有广泛的应用潜力。通过提高视觉语言导航的资源效率,该方法能够在实际环境中更好地支持智能体的自主决策,推动智能系统的普及与发展。

📄 摘要(原文)

Vision-Language Navigation (VLN) requires an embodied agent to follow natural-language instructions in unseen environments. Recent progress has been largely driven by Multimodal Large Language Models (MLLMs). Existing methods follow a next-step action prediction paradigm, supervising only the expert action, which requires a high quantity of data for training. They also rely on cognitive maps, accumulated historical frames, or external 3D tools to maintain states, leading to high computational and memory overhead. To realize resource efficiency VLN, we propose LookStep, a unified end-to-end framework that combines Language Centric Future State Modeling and Event Driven Rolling Memory that uses language labels to generate coarse-grained navigation progress and future states for each candidate action, while autonomously deciding whether to write each observation into a bounded rolling memory with a semantic role. We validate LookStep empirically. On VLN-CE tasks, LookStep outperforms existing methods under the same training settings, achieving a 49.7\% success rate on R2R-CE Val-Unseen with better memory efficiency and less data usage. Code and model is available at https://github.com/kunyang-YU/LookStep.