RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation
作者: Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian
分类: cs.CV, cs.AI
发布日期: 2026-08-10
💡 一句话要点
提出RecoverFly框架以解决无人机视觉语言导航中的失败问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 无人机导航 视觉语言处理 强化学习 长尾学习 样本利用 场景适应性 自回归模型
📋 核心要点
- 现有的无人机视觉语言导航方法在交互闭环执行中提供的纠正监督有限,导致样本利用效率低下和场景适应性差。
- 本文提出RecoverFly框架,通过适应性强化学习和长尾场景课程设计,增强无人机动作的稳定性和纠正能力。
- 在TravelUAV基准测试中,RecoverFly在不同场景分割上均表现优异,成功率显著提升,验证了其有效性和泛化能力。
📝 摘要(中文)
无人机视觉语言导航(UAV-VLN)要求智能体将视觉观察和语言指令转化为可靠的飞行动作。然而,现有的端到端UAV视觉-语言-动作(UAV-VLA)策略在交互闭环执行中提供的纠正监督有限。为此,本文提出了RecoverFly,一个针对UAV-VLA策略的失败感知强化学习后训练框架。RecoverFly通过适应基于令牌的强化学习来稳定优化语法约束的自回归UAV动作,重新审视未解决的失败案例以增强纠正学习和样本利用,并结合两阶段长尾场景课程与参考策略正则化来改善场景适应性。实验结果表明,RecoverFly在TravelUAV基准测试中表现最佳,成功率较AerialVLA初始化提高了3.12至8.37个百分点,验证了其有效性和鲁棒性。
🔬 方法详解
问题定义:本文旨在解决无人机视觉语言导航中现有方法在样本利用和场景适应性方面的不足,尤其是在交互闭环执行中的纠正监督不足问题。
核心思路:RecoverFly框架通过引入基于令牌的强化学习和长尾场景课程设计,旨在增强无人机动作的稳定性和纠正能力,从而提高整体导航性能。
技术框架:RecoverFly的整体架构包括两个主要模块:首先是基于令牌的强化学习模块,用于优化UAV动作;其次是长尾场景课程模块,结合参考策略正则化以改善场景适应性。
关键创新:RecoverFly的核心创新在于其失败感知机制,通过重新审视未解决的失败案例来增强学习效果,与传统方法相比,显著提高了样本利用效率和场景适应能力。
关键设计:在参数设置上,RecoverFly采用了语法约束的自回归模型,并设计了特定的损失函数以平衡探索与利用,确保在优化过程中保持稳定性。
🖼️ 关键图片
📊 实验亮点
在TravelUAV基准测试中,RecoverFly在已知场景、未知地图和未知物体分割上均表现出色,相较于AerialVLA初始化,成功率提升了3.12至8.37个百分点,验证了其在复杂环境中的有效性和鲁棒性。
🎯 应用场景
RecoverFly框架具有广泛的应用潜力,特别是在复杂环境中的无人机导航任务中。其增强的样本利用和场景适应能力可以应用于搜索与救援、环境监测和物流配送等领域,提升无人机的自主决策能力和任务执行效率。
📄 摘要(原文)
Unmanned aerial vehicle vision-language navigation (UAV-VLN) requires agents to translate visual observations and language instructions into reliable flight actions in complex environments. Although recent end-to-end UAV vision-language-action (UAV-VLA) policies reduce reliance on separately designed perception, planning, and control modules, their behavior-cloning objectives provide limited corrective supervision for interactive closed-loop execution. Reinforcement learning (RL) offers a promising solution, while its effectiveness is constrained by inefficient use of samples, long-tailed scene distributions, and policy distribution shift during optimization. To this end, we propose RecoverFly, a failure-aware RL post-training framework for end-to-end UAV-VLA policies. Specifically, RecoverFly adapts token-level RL for stable optimization of grammar-constrained autoregressive UAV actions, revisits unresolved failure cases to strengthen corrective learning and sample utilization, and combines a two-stage long-tail scene curriculum with reference-policy regularization to improve scene adaptation while preserving acquired capabilities. Experiments on the TravelUAV benchmark demonstrate that RecoverFly achieves the best performance on the seen, unseen-map, and unseen-object splits. Moreover, compared to the AerialVLA initialization, RecoverFly improves success rate by 3.12 to 8.37 percentage points under a total rollout budget of about 30\% of the training-set size, validating its effectiveness, robustness, and generalization capabilities.