AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning

📄 arXiv: 2608.14135v1 📥 PDF

作者: Wenhao Tang, Tianyang Chen, Zhejun Cui, Boyuan An, Jiayu Chen, Ruize Zhang, Huidong Liu, Tianyue Wu, Qingmin Liao, Fei Gao, Yu Wang, Chao Yu

分类: cs.RO, cs.LG

发布日期: 2026-08-14

备注: 8 pages, 7 figures. Under review


💡 一句话要点

提出AgilePE以解决无人机自主追逐-逃避问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 无人机 自主控制 强化学习 自我对弈 追逐-逃避 仿真到现实 策略优化

📋 核心要点

  1. 现有方法在高维空中交互和灵活机动方面表现不佳,难以应对复杂的追逐-逃避场景。
  2. AgilePE通过自我对弈强化学习,集成低级控制和策略优化,实现无人机的自主追逐-逃避。
  3. 实验结果表明,AgilePE能够在真实环境中有效执行追逐-逃避战术,且无需额外调优。

📝 摘要(中文)

自主追逐-逃避是无人机(UAV)面临的基本挑战,需要在高度耦合的动态环境中快速决策。传统的基于规则或微分博弈的方法在高维空中交互和灵活机动方面常常表现不佳。本文提出AgilePE,一个通过自我对弈强化学习实现无人机自主追逐-逃避的完整系统。AgilePE将灵活的低级控制、竞争性策略优化和仿真到现实的部署整合在一个统一框架中。该策略直接将机载状态观测映射到集体推力和机体速率命令,实现端到端的灵活机动。通过优先虚构自我对弈(PFSP)和多样化对手池进行训练,代理能够在历史策略中提升,同时稳定优化并减少策略振荡。最终,学习到的策略能够零次转移到真实四旋翼上,且无需特定任务调优。

🔬 方法详解

问题定义:本文旨在解决无人机在复杂动态环境中自主追逐-逃避的挑战。现有方法如基于规则或微分博弈的策略在高维交互中表现不佳,难以适应快速变化的对手行为。

核心思路:AgilePE的核心思路是通过自我对弈强化学习来训练无人机,使其能够在复杂环境中自主决策。通过优先虚构自我对弈(PFSP)和多样化对手池,代理能够在历史策略中不断提升,稳定优化过程。

技术框架:AgilePE的整体架构包括三个主要模块:灵活的低级控制模块、竞争性策略优化模块和仿真到现实的部署模块。低级控制模块直接将状态观测映射为控制命令,避免了中间轨迹规划的复杂性。

关键创新:AgilePE的关键创新在于其自我对弈训练机制和零次转移能力。与传统方法相比,AgilePE能够在没有任务特定调优的情况下,将学习到的策略直接应用于真实四旋翼。

关键设计:在训练过程中,采用了优先虚构自我对弈(PFSP)策略,确保代理在多样化对手的挑战下不断进步。设计中还考虑了硬件对齐的仿真管道,以模拟执行器响应动态、通信延迟和领域随机化等因素。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,AgilePE在真实环境中成功复现了仿真中观察到的追逐-逃避战术,包括快速躲避和侧翼攻击。与基线方法相比,AgilePE在策略稳定性和执行效率上有显著提升,验证了其零次转移能力的有效性。

🎯 应用场景

AgilePE的研究成果在无人机自主控制、军事战术模拟、搜索与救援等领域具有广泛的应用潜力。其高效的追逐-逃避策略能够提升无人机在复杂环境中的生存能力和任务执行效率,未来可能推动无人机技术的进一步发展与应用。

📄 摘要(原文)

Autonomous pursuit-evasion is a fundamental challenge for Unmanned Aerial Vehicles (UAVs), requiring rapid decision-making under tightly coupled dynamics and continuously changing opponent behaviors. Traditional rule-based or differential-game approaches often struggle with high-dimensional aerial interactions and agile maneuvering. We present AgilePE, a complete system for autonomous UAV pursuit-evasion via self-play reinforcement learning. AgilePE integrates agile low-level control, competitive policy optimization, and sim-to-real deployment in a unified framework. The policy directly maps onboard state observations to Collective Thrust and Body Rates (CTBR) commands, enabling end-to-end agile maneuvering without intermediate trajectory planners or waypoint controllers. For training, we use competitive self-play with Prioritized Fictitious Self-Play (PFSP) and a diversified opponent pool, enabling agents to improve against historical policies while stabilizing optimization and reducing policy oscillation. This process leads to the emergence of sophisticated pursuit and evasion strategies. For real-world deployment, we develop a hardware-aligned simulation pipeline that models actuator-response dynamics, communication latency, and domain randomization. The learned policies transfer zero-shot to real quadrotors without task-specific tuning. Real-world experiments reproduce pursuit-evasion tactics observed in simulation, including rapid dodging and flanking, and demonstrate interactive two-agent zero-shot deployment.