VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

📄 arXiv: 2609.00920v1 📥 PDF

作者: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

分类: cs.RO, cs.CV

发布日期: 2026-09-01

备注: 9 pages, 7 figures, 5 tables


💡 一句话要点

提出VerNav框架以解决低延迟视觉语言导航问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 低延迟 验证器优先 自适应生成 多步导航 强化学习 模型对齐

📋 核心要点

  1. 现有视觉语言导航方法在多步导航中由于自回归生成导致较大的决策延迟,影响了导航效率。
  2. 本文提出的VerNav框架通过验证器优先策略,采用批量动作验证来降低决策延迟,并在不确定情况下使用自适应生成器。
  3. 在Room-to-Room基准测试中,VerNav的验证器决策路径在导航性能上与其他代表性方法竞争,同时显著降低了每步的决策延迟。

📝 摘要(中文)

视觉语言导航(VLN)要求智能体根据自然语言指令在未见的3D环境中导航。现有方法在每一步的自回归生成中积累了较大的决策阶段延迟。为此,本文提出了VerNav,一个基于验证器的低延迟VLN框架。该框架通过批量动作验证替代逐步自回归生成,从而减少决策阶段延迟。同时,只有在不确定决策时才调用基于熵的自适应生成器以产生紧凑的状态证据。实验结果表明,VerNav的验证器仅决策路径在Room-to-Room基准测试中表现出色,且每步的平均决策阶段延迟减少了超过10倍。

🔬 方法详解

问题定义:本文旨在解决视觉语言导航中的决策延迟问题,现有自回归生成方法在多步导航中导致了显著的延迟,影响了导航的实时性和效率。

核心思路:VerNav框架的核心思路是通过引入验证器优先策略,替代逐步自回归生成,采用批量动作验证来减少决策延迟,同时在不确定情况下使用自适应生成器以提高决策的准确性。

技术框架:VerNav的整体架构包括两个主要模块:验证器和生成器。验证器负责批量验证动作,而生成器在不确定情况下提供额外的状态证据。框架还包括两阶段的对齐方案:静态验证器训练和动态任务执行中的强化微调。

关键创新:VerNav的主要创新在于通过验证器替代自回归生成,显著降低了决策阶段的延迟,并引入了两阶段对齐机制,提升了导航性能。与传统方法相比,VerNav在决策效率和准确性上具有本质区别。

关键设计:在设计中,采用了基于熵的自适应生成器,仅在不确定决策时调用,确保了生成的紧凑性。同时,静态训练和动态微调的结合使得模型在不同阶段都能有效学习和适应环境。具体的损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Room-to-Room基准测试中,VerNav的验证器决策路径在导航性能上与其他主流方法相当,同时每步的平均决策阶段延迟减少了超过10倍,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用场景包括智能家居、机器人导航和增强现实等领域。通过提高视觉语言导航的效率和准确性,VerNav能够在复杂环境中实现更智能的交互和操作,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Vision-and-Language Navigation (VLN) requires an agent to navigate through unseen 3D environments according to natural-language instructions. Explicit reasoning can improve instruction understanding and semantic grounding, but autoregressive generation at every step accumulates large decision-stage latency over multi-step navigation. We propose VerNav, a verifier-first framework for low-latency LLM-based VLN. The verifier reduces decision-stage latency by replacing per-step autoregressive generation with batched action verification, while an entropy-based adaptive generator is invoked only for uncertain decisions to produce compact state evidence. To further improve navigation performance with the verifier, we introduce a two-stage alignment scheme: (i) VPO improves local action-preference alignment in static verifier training, and (ii) step-level reinforcement fine-tuning provides dense progress rewards over multi-step navigation rollouts during dynamic task execution. Experiments on the Room-to-Room (R2R) benchmark show that the verifier-only decision path of VerNav achieves competitive navigation performance among representative LLM-based VLN agents while reducing average decision-stage LLM latency per step by more than $10\times$ compared with autoregressive methods.