WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

📄 arXiv: 2608.07267v1 📥 PDF

作者: Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

分类: cs.AI, cs.CV, cs.RO

发布日期: 2026-08-07


💡 一句话要点

提出WNM-3D以解决闭环视觉语言导航中的场景建模问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 生成模型 3D场景建模 闭环控制 几何感知 动作生成 深度学习

📋 核心要点

  1. 现有的视觉语言导航方法在建模代理的视觉观察演变方面存在不足,未能有效利用几何信息。
  2. WNM-3D通过引入3D场景条件,利用几何感知表示来增强未来观察和动作生成的准确性。
  3. 实验结果显示,WNM-3D在GN-Bench上优于其他基线方法,表现出更高的流动作一致性和更低的视觉运动误差。

📝 摘要(中文)

近年来,视觉语言导航(VLN)系统逐渐将预训练的视觉语言模型(VLM)适配为视觉语言动作(VLA)策略,直接将自我中心观察和语言指令映射到导航动作。尽管这种以动作为中心的训练在语义上具有能力,但并未明确建模代理的视觉观察如何在其预测的运动下演变。本文提出了WNM-3D,一种具有3D场景条件的生成世界导航模型,用于连续VLN。通过冻结的前馈几何编码器提取单目自我中心RGB历史中的几何感知表示,并通过可训练的3D场景到标记适配器将其转换为世界动作扩散变换器的固定长度前缀,从而为未来视图和动作生成提供共享的几何上下文。实验表明,WNM-3D在闭环导航中优于强大的基于VLM的导航策略及其2D条件对应物。

🔬 方法详解

问题定义:本文旨在解决现有视觉语言导航方法在预测代理视觉观察演变时的不足,尤其是缺乏几何信息的建模能力。

核心思路:WNM-3D通过引入3D场景条件,利用几何感知表示来增强导航过程中的观察和动作生成,确保生成的动作与环境几何信息相一致。

技术框架:WNM-3D的整体架构包括一个冻结的几何编码器和一个可训练的3D场景到标记适配器,前者提取几何信息,后者将其转换为固定长度的前缀,供后续的动作生成使用。

关键创新:WNM-3D的主要创新在于其通过几何感知表示来条件化未来视图和动作生成,这一设计与传统的基于动作的训练方法有本质区别。

关键设计:在模型设计中,使用了冻结的前馈几何编码器来提取几何信息,并通过块因果注意力机制将几何前缀与未来视频动作块相结合,确保生成的动作与环境几何信息相一致。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在GN-Bench的实验中,WNM-3D在闭环导航任务中表现出色,超越了多个强基线方法,具体表现为更高的流动作一致性和更低的视觉运动误差,显示出其在实际应用中的有效性和优势。

🎯 应用场景

WNM-3D的研究成果在智能机器人导航、自动驾驶、虚拟现实等领域具有广泛的应用潜力。通过提高导航系统对环境的理解能力,能够显著提升机器人在复杂场景中的自主导航能力,推动相关技术的实际应用与发展。

📄 摘要(原文)

Recent vision-language navigation (VLN) systems increasingly adapt pretrained vision-language models (VLMs) into vision-language-action (VLA) policies that map egocentric observations and language instructions directly to navigation actions. Although semantically capable, such action-centric training does not explicitly model how the agent's visual observations should evolve under its predicted motion. Generative world-action models (WAMs) jointly predict future observations and actions, yet existing WAMs for continuous VLN do not condition joint future-view and action generation on geometry-aware representations inferred from the observed history. We present WNM-3D, a generative World Navigation Model with 3D scene conditioning for continuous VLN. To consolidate past observations into persistent scene context, a frozen feed-forward geometry encoder extracts geometry-aware representations from the monocular egocentric RGB history, and a trainable 3D Scene-to-Token Adapter converts them into a fixed-length prefix in the token space of the world-action Diffusion Transformer. Through block-causal attention, this prefix conditions every future video-action block, providing a shared geometric context for both future-view and action generation. We train WNM-3D through supervised world-action fine-tuning on A*-generated demonstrations, DAgger-style adaptation on policy-visited states, and DanceGRPO-based closed-loop policy optimization. Experiments on GN-Bench show that WNM-3D outperforms strong VLM-based navigation policies and its 2D-conditioned counterpart in closed-loop navigation. On a fixed near-goal evaluation set, WNM-3D also achieves higher flow-action consistency and lower visual-motion error.