AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN
作者: Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu
分类: cs.RO
发布日期: 2026-08-13
备注: Accepted by ACM Multimedia 2026
💡 一句话要点
提出AirForesight框架以解决无人机视觉语言导航中的空间推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 无人机导航 视觉语言 空间推理 未来轨迹预测 多视角学习
📋 核心要点
- 现有的无人机视觉语言导航方法在空间推理和未来运动意图的表达上存在不足,导致导航效果受限。
- 本文提出的AirForesight框架通过学习结构化的当前地图表示,结合未来轨迹预测,增强了空间推理能力。
- 在OpenUAV和AerialVLN-S数据集上的实验结果显示,AirForesight在导航任务中显著提升了性能,验证了其有效性。
📝 摘要(中文)
无人机视觉语言导航(UAV-VLN)要求智能体根据语言指令推断空间结构,并在复杂的户外环境中执行可行的三维运动。尽管大型语言模型取得了一定进展,现有方法仍然直接将视觉-语言输入映射到动作,缺乏明确的场景基础和未来空间推理能力。为此,本文提出了AirForesight,一个当前到未来的空间地图想象框架。该框架首先从多视角观测中学习结构化的当前地图表示,并通过当前地图重建和未来轨迹预测进行联合监督,从而编码当前场景结构和未来运动意图。在结构化因果注意力下,当前空间知识被传播到未来地图推理,最终聚合当前和未来表示以预测下一个三维航点。为使空间想象与导航更相关,本文引入了交叉空间规划一致性损失,鼓励预测的地图空间轨迹与基于真实航点位移的专家动作方向之间的方向一致性。实验结果表明,该框架在OpenUAV和AerialVLN-S上表现优异,验证了其有效性和稳定性。
🔬 方法详解
问题定义:本文旨在解决无人机视觉语言导航中的空间推理不足和未来运动意图表达不清的问题。现有方法往往直接将视觉-语言输入映射到动作,缺乏对场景的深度理解和未来规划的能力。
核心思路:AirForesight框架通过学习当前地图的结构化表示,并结合未来轨迹预测,促进了当前空间知识向未来推理的传播,从而增强了导航的准确性和有效性。
技术框架:该框架主要包括三个模块:当前地图表示学习、未来轨迹预测和交叉空间规划一致性损失。首先,从多视角观测中提取当前地图表示;然后,利用结构化因果注意力将当前知识传播到未来推理;最后,通过一致性损失优化预测轨迹。
关键创新:最重要的创新在于引入了交叉空间规划一致性损失,这一设计使得预测的地图空间轨迹与真实航点位移之间的方向一致性得以强化,显著提升了导航的可靠性。
关键设计:在损失函数设计上,结合了当前地图重建损失和未来轨迹预测损失,以确保模型能够同时关注当前和未来的空间信息。此外,采用结构化因果注意力机制以增强模型对空间关系的理解。
🖼️ 关键图片
📊 实验亮点
在OpenUAV和AerialVLN-S数据集上的实验结果表明,AirForesight框架在导航任务中表现出色,相较于基线方法,性能提升幅度达到XX%,验证了其有效性和稳定性。
🎯 应用场景
该研究具有广泛的应用潜力,特别是在无人机自主导航、智能交通系统和机器人探索等领域。通过提升无人机在复杂环境中的导航能力,AirForesight能够为未来的智能交通和无人机配送等应用提供更为可靠的技术支持。
📄 摘要(原文)
Unmanned Aerial Vehicle Vision-Language Navigation (UAV-VLN) requires agents to follow language instructions, infer spatial structure from sparse multi-view observations, and execute feasible 3D motion in complex outdoor environments. Despite recent progress with large language models, most existing methods still map vision-language inputs directly to actions, providing limited explicit scene grounding and future-aware spatial reasoning. We propose AirForesight, a current-to-future spatial map imagination framework for UAV-VLN. AirForesight first learns a structured current-map representation from multi-view observations. This representation is jointly supervised by current-map reconstruction and future-trajectory prediction, encouraging it to encode both present scene structure and future motion intent. Under structured causal attention, the current spatial knowledge is propagated to future-map reasoning, and the resulting current and future representations are aggregated to predict the next 3D waypoint. To make spatial imagination more relevant to navigation, we introduce a cross-space planning consistency loss that encourages directional agreement between the predicted map-space trajectory and the expert action direction derived from the ground-truth waypoint displacement. Experiments on OpenUAV and AerialVLN-S, together with extensive ablations, demonstrate strong performance and support the effectiveness and stability of the proposed framework.