Latent World Models with Monotone Planning Costs for Image-Goal Navigation
作者: Amirhosein Chahe, Siwei Cai, Lifeng Zhou
分类: cs.RO
发布日期: 2026-08-10
💡 一句话要点
提出基于单调规划成本的潜在世界模型以解决图像目标导航问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 潜在世界模型 图像目标导航 规划成本 DINO编码器 自回归模型 单调成本排名 机器人导航 路径规划
📋 核心要点
- 现有的图像目标导航方法在未来状态预测和动作序列成本排名上存在不足,导致规划性能下降。
- 本文提出了一种基于DINO编码器的潜在世界模型,通过自回归展开损失和单调成本排名损失来优化规划成本。
- 在GNM导航数据集上,所提方法在图像目标导航性能上超越了多种基线,并显著降低了方向误差。
📝 摘要(中文)
图像目标导航中的潜在世界模型不仅需要准确的未来预测,还需可靠地对候选动作序列进行成本排名。本文将成本定义为预测未来嵌入与目标嵌入之间的余弦距离,并指出不良的成本排序会误导基于采样的规划器,如交叉熵方法(CEM)。为此,本文提出了一种基于冻结DINO家族编码器的潜在世界模型,并通过两种互补目标进行训练。自回归展开损失缩小了训练与多步规划展开之间的差距,而单调成本排名(MCR)损失则直接鼓励越来越扰动的动作序列获得更高的规划成本。实验表明,该方法在GNM导航数据集上超越了现有的导航世界模型(NWM)、DINO-WM、OmniVLA和NoMaD,达到最先进的图像目标导航性能,同时在相同编码器DINO WM基线的基础上将方向误差降低了2.7倍。该模型还在物理机器人上零-shot部署,能够在未见过的室内和室外环境中跟随目标导向路径。
🔬 方法详解
问题定义:本文旨在解决图像目标导航中潜在世界模型的规划成本排序不准确的问题。现有方法在成本排名上表现不佳,导致基于采样的规划器(如CEM)无法有效工作。
核心思路:论文提出了一种新的潜在世界模型,利用DINO编码器进行特征提取,并通过两种损失函数来优化未来状态预测和动作序列的成本排名。自回归展开损失用于缩小训练与多步规划之间的差距,而单调成本排名损失则确保扰动的动作序列获得更高的成本。
技术框架:整体架构包括一个冻结的DINO编码器用于特征提取,后续通过自回归模型进行未来状态预测,并结合MCR损失进行规划成本的优化。模型训练分为两个阶段:首先进行特征提取,然后通过损失函数优化规划性能。
关键创新:最重要的创新在于引入了单调成本排名损失(MCR),该损失直接影响动作序列的成本评估,确保了更好的规划性能。这一方法与传统的成本评估方式有本质区别。
关键设计:在模型设计中,使用了DINO编码器的冻结版本,损失函数包括自回归展开损失和MCR损失,确保了模型在训练和推理阶段的一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在GNM导航数据集上超越了现有的多种基线模型,包括NWM、DINO-WM、OmniVLA和NoMaD,达到了最先进的图像目标导航性能。同时,相较于相同编码器的DINO WM基线,方向误差降低了2.7倍,展示了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括自主机器人导航、智能家居系统和无人驾驶汽车等。通过提高图像目标导航的准确性和效率,能够在复杂环境中实现更智能的路径规划和决策,具有重要的实际价值和未来影响。
📄 摘要(原文)
Image-goal navigation with latent world models requires not only accurate future prediction, but also a planning cost that reliably ranks candidate action sequences. We define the cost as the cosine distance between the predicted future embedding and the goal embedding, and show that poor cost ordering can mislead sampling-based planners such as Cross-Entropy Method (CEM). To address this, we propose a latent world model built on a frozen DINO-family encoder and train it with two complementary objectives. An autoregressive rollout loss reduces the gap between training and multi-step planning rollouts, while a Monotone Cost Ranking (MCR) loss directly encourages increasingly perturbed action sequences to receive higher planning costs. We also study InfoNCE-based action-contrastive training and find that temporal permutation negatives distort the latent geometry and degrade planning performance. On the GNM navigation dataset, our method outperforms Navigation World Models (NWM), DINO-WM, OmniVLA, and NoMaD, achieving state-of-the-art image-goal navigation performance while reducing orientation error by $2.7\times$ over the same-encoder DINO WM baseline. We also deploy the model zero-shot on a physical robot, where it follows goal-directed paths in unseen indoor and outdoor environments.