UniNav: A Unified World-Action Diffusion Model for Visual Navigation
作者: Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen
分类: cs.AI
发布日期: 2026-08-04
💡 一句话要点
提出UniNav以解决视觉导航中的未来预测与动作生成问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视觉导航 未来预测 动作生成 扩散模型 几何感知 智能体 多模态学习
📋 核心要点
- 现有的导航策略缺乏视觉前瞻性,无法有效预测未来的环境变化。
- UniNav通过单一扩散过程生成未来视觉观察和连续路径轨迹,结合了未来预测与动作生成。
- 实验结果显示,UniNav在导航基准测试中超越了最强基线,UniNav-Fast在推理时延迟仅为0.1秒。
📝 摘要(中文)
图像目标视觉导航是具身智能体的一项基本能力。现有导航策略虽然能有效预测路径轨迹,但缺乏视觉前瞻性,而导航世界模型能够预测未来观察,但通常需要昂贵的规划回滚。本文提出UniNav,一个统一的世界-动作模型,通过单一扩散过程生成未来视觉观察和连续路径轨迹。UniNav在一个变换器中联合去噪视觉和路径标记,统一了未来预测和动作生成。为提高空间定位,我们引入了几何感知相机标记。模型在轨迹标记的导航数据和仅视频数据上进行训练,从而利用多样化视频而无需路径注释。基于这一统一框架,我们引入了两个变体:UniNav-Full联合预测可解释的未来观察及其对应轨迹,而UniNav-Fast在推理时去除未来图像标记以实现高效轨迹预测。实验结果表明,UniNav在所有数据集上均超越了最强基线,在单步推理下,UniNav-Fast实现了0.1秒的延迟且准确性未显著下降。
🔬 方法详解
问题定义:本文旨在解决现有视觉导航方法在未来观察预测和动作生成方面的不足,现有方法往往需要复杂的规划回滚,导致效率低下。
核心思路:UniNav通过一个统一的世界-动作模型,利用单一的扩散过程同时生成未来的视觉观察和路径轨迹,从而简化了导航过程。
技术框架:UniNav的整体架构包括历史帧输入和目标图像,通过一个变换器联合去噪视觉和路径标记,形成一个共享的预测与生成框架。
关键创新:UniNav的主要创新在于将未来预测与动作生成统一在一个模型中,显著提高了效率和准确性,尤其是在处理多样化视频数据时。
关键设计:模型设计中引入了几何感知相机标记,以增强空间定位能力,并在训练过程中结合了轨迹标记和视频数据,优化了损失函数以适应不同数据源。
🖼️ 关键图片
📊 实验亮点
实验结果表明,UniNav在所有数据集上均超越了最强基线,尤其在ATE指标上表现优异。UniNav-Fast在单步推理时实现了0.1秒的延迟,且准确性未显著下降,展示了其高效性。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动驾驶和虚拟现实等场景,能够提升智能体在复杂环境中的自主导航能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Image-goal visual navigation is a fundamental capability for embodied agents. Existing navigation policies efficiently predict waypoint trajectories but lack visual foresight, while navigation world models can anticipate future observations but often require costly planning rollouts. We present UniNav, a unified world-action model that generates future visual observations and continuous waypoint trajectories through a single diffusion process. Given history frames and a goal image, UniNav jointly denoises visual and waypoint tokens within a single transformer, unifying future prediction and action generation in a shared framework. To improve spatial grounding, we incorporate geometry-aware camera tokens. We also train on both trajectory-labeled navigation data and video-only data, enabling the model to benefit from diverse videos without waypoint annotations. Based on this unified framework, we introduce two variants: UniNav-Full jointly predicts interpretable future observations and their corresponding trajectories, while UniNav-Fast removes future-image tokens at inference for efficient trajectory prediction. Experiments on navigation benchmarks show that UniNav outperforms the strongest baseline in ATE across all datasets. With one-step inference, UniNav-Fast achieves a latency of 0.1s without a substantial accuracy drop. Code will be released.