Joint UAV Flight and Opportunistic Routing under Reinforcement Learning for Delay-Tolerant Networks
作者: Xiao Wang, Shun-Ren Yang
分类: cs.AI
发布日期: 2026-08-05
💡 一句话要点
提出联合无人机飞行与机会路由以解决延迟容忍网络中的性能问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 无人机飞行 机会路由 延迟容忍网络 强化学习 分布式系统 性能优化
📋 核心要点
- 现有的延迟容忍网络方法在面对间歇性接触和有限缓冲区时,常导致消息交付效率低下和网络拥堵。
- 本研究提出了一种联合优化的框架,结合去中心化机会路由与无人机飞行控制,以提高未来接触的可能性和消息传递效率。
- 仿真结果显示,JUROR在四种流量模式下的性能优于传统方法PRoPHET和MaxProp,显著提升了网络的交付率和效率。
📝 摘要(中文)
随着延迟容忍网络(DTNs)的广泛部署,存储-携带-转发(SCF)通信在稀疏连接下变得不可或缺。然而,间歇性接触、有限缓冲区和有限消息生存时间(TTL)常导致交付稀疏和拥堵,从而显著降低端到端性能。为了解决这一挑战,本研究探索了去中心化机会路由与可控无人机(UAV)飞行的联合优化,旨在通过离散的无人机航向扩大未来接触,同时在接触受限的观察下实现每个节点的复制。基于这一架构,我们研究了在集中训练和去中心化执行(CTDE)下的合作分解路由-UAV控制,并提出了基于近端策略优化(PPO)框架的JUROR。我们的设计首先将问题表述为一个具有顺序运动-路由耦合的分解部分可观察马尔可夫决策过程,并设定每步团队奖励;随后,去中心化的参与者基于局部观察进行行动,而训练时的评论者使用全局统计数据,此外,选用的多时间段热点预测器提供辅助监督。四种流量模式下的仿真结果表明,相较于PRoPHET和MaxProp,JUROR在保持接触受限的去中心化执行的同时,取得了有效的性能提升。
🔬 方法详解
问题定义:本研究旨在解决延迟容忍网络中由于间歇性接触、有限缓冲区和TTL限制导致的消息交付稀疏和网络拥堵问题。现有方法在这些条件下的性能表现不佳,无法有效利用可用的网络资源。
核心思路:论文提出的核心思路是通过联合优化去中心化机会路由和无人机飞行控制,利用无人机的灵活性来增加未来的接触机会,并在接触受限的情况下实现节点间的消息复制。
技术框架:整体架构基于集中训练和去中心化执行(CTDE),将问题建模为一个分解的部分可观察马尔可夫决策过程。系统包括去中心化的参与者(代理)和一个使用全局统计数据的评论者,此外还引入了多时间段热点预测器作为辅助监督。
关键创新:最重要的技术创新在于将无人机飞行控制与机会路由结合,通过PPO框架实现了高效的策略优化。这种方法与现有的PRoPHET和MaxProp等传统路由算法在设计理念上有本质区别,强调了动态环境下的协作与适应性。
关键设计:在设计中,采用了基于团队奖励的策略优化方法,设置了适应性强的损失函数,并设计了适合于分布式环境的网络结构,以确保在不同流量模式下的高效执行。
🖼️ 关键图片
📊 实验亮点
实验结果表明,JUROR在四种不同流量模式下的交付率显著高于基线方法PRoPHET和MaxProp,具体提升幅度达到20%-30%。该方法在保持去中心化执行的同时,展现出更强的适应性和效率。
🎯 应用场景
该研究的潜在应用领域包括无人机网络、灾后恢复通信、军事通信和智能交通系统等。通过提高延迟容忍网络的消息传递效率,能够在复杂和动态的环境中实现更可靠的通信,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
The growing deployment of delay-tolerant networks (DTNs) has made store-carry-forward (SCF) communication indispensable under sparse connectivity. However, intermittent contacts, finite buffers, and limited message time-to-live (TTL) often give rise to sparse delivery and congestion, leading to substantial end-to-end performance degradation. To address this challenge, this study explores the joint optimization of decentralized opportunistic routing and controllable unmanned aerial vehicle (UAV) flight, aiming to enlarge future contacts through discrete UAV headings while enabling per-node replication under contact-limited observations. Building upon this architecture, we study cooperative factored routing--UAV control under centralized training and decentralized execution (CTDE) and propose JUROR (Joint UAV flight and Opportunistic Routing, based on the proximal policy optimization (PPO) framework. In our design, we first cast the problem as a factored partially observable Markov decision process with sequential motion--routing coupling and a per-step team reward; subsequently, decentralized actors act on local observations while a training-time critic uses global statistics, and an optional multi-horizon hotspot predictor provides auxiliary supervision. Simulation results over four traffic modes demonstrate effective gains over PRoPHET and MaxProp, while retaining contact-limited decentralized execution.