Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

📄 arXiv: 2607.25754v1 📥 PDF

作者: Yu Su, Nabil Aouf

分类: cs.RO

发布日期: 2026-07-28

备注: 13 pages, 7 figures


💡 一句话要点

提出多智能体深度强化学习框架以解决多无人机协作导航问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多无人机 深度强化学习 协作导航 复杂环境 跨场景泛化 动态适应性 智能体学习

📋 核心要点

  1. 多无人机协作导航面临局部最优、稀疏奖励和学习不平衡等挑战,影响任务成功率。
  2. 提出的框架通过协调探索和示范利用等机制,增强智能体在复杂环境中的学习能力。
  3. 实验结果显示,该方法在协作成功率、导航鲁棒性和跨场景泛化等方面显著提升。

📝 摘要(中文)

多智能体无人机在复杂环境中的协作导航面临局部最优陷阱、稀疏奖励、智能体间学习不平衡及跨场景泛化不足等挑战。本文提出了一种多智能体深度强化学习框架,通过协调探索、示范利用、安全课程调度和结构感知泛化来应对这些问题。首先,结合访问状态的记忆、方向新颖性估计和惩罚反向传播的感知机制,使智能体主动检测并逃离局部最优。其次,分层协作示范缓冲区通过团队协作程度管理轨迹,并对演员网络应用差异化监督,提高稀疏协作信号下的示范利用。最后,安全意识的双条件课程调度机制通过回测和经验预填充来审查已掌握的场景,抑制灾难性遗忘,同时确保任务性能和飞行安全。该框架在混合静态-动态障碍设置下经过验证,显示出对动态干扰的强大适应性。

🔬 方法详解

问题定义:本文旨在解决多无人机在复杂环境中协作导航时遇到的局部最优、稀疏奖励和学习不平衡等问题。现有方法在这些方面表现不佳,导致任务成功率低下。

核心思路:论文提出的框架通过协调探索、示范利用和安全课程调度等策略,增强智能体的学习能力和适应性,从而有效应对复杂环境中的挑战。

技术框架:整体架构包括感知机制、分层协作示范缓冲区和安全课程调度机制。感知机制帮助智能体检测局部最优,示范缓冲区管理协作轨迹,而课程调度机制确保学习过程的安全性和有效性。

关键创新:最重要的创新在于结合了记忆、方向新颖性和惩罚反向传播的感知机制,以及分层协作示范缓冲区的差异化监督,这些设计使得智能体能够更好地利用稀疏的协作信号。

关键设计:在技术细节上,采用了特定的损失函数和网络结构,以支持示范利用和安全课程调度,同时引入了局部几何特征作为领域参数,以增强跨场景泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,该框架在协作成功率和导航鲁棒性方面表现优异,成功率达到90%以上,并在动态环境适应性测试中表现出色,显示出强大的跨场景泛化能力。与基线方法相比,零-shot跨场景泛化能力显著提升,验证了方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括无人机编队、灾害监测、环境监测和物流配送等。通过提高多无人机在复杂环境中的协作能力,能够显著提升任务执行的效率和安全性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Cooperative navigation of multi-agent UAVs in complex environments faces key challenges including local optima traps, sparse rewards, learning imbalance among agents, and insufficient cross-scenario generalisation. This paper proposes a multi-agent deep reinforcement learning framework that addresses these issues through coordinated exploration, demonstration exploitation, safe curriculum scheduling, and structure-aware generalisation. First, a perception mechanism combining memory of visited states, directional novelty estimates, and penalty backpropagation enables agents to proactively detect and escape local optima. Second, a hierarchical collaborative demonstration buffer with tiered behaviour cloning manages trajectories by degree of team collaboration and applies differential supervision to the actor network, improving demonstration utilisation under sparse collaborative signals. Third, a safety-aware dual-condition curriculum scheduling mechanism reviews mastered scenarios through back-testing and experience pre-filling during training, suppressing catastrophic forgetting while ensuring both task performance and flight safety. For generalisation, local geometric features computed from sensor readings are abstracted into a domain parameter, through which a structure-aware gating network and mixture-of-experts mechanism condition the policy on local structural patterns rather than scenario-specific coordinates, enabling cross-scenario transfer without exposure to the target environment. The framework is further validated under mixed static-dynamic obstacle settings, showing robust adaptability to dynamic disturbances. Simulation results confirm strong performance in collaboration success rate, navigation robustness, zero-shot cross-scenario generalisation, and dynamic environment adaptability.