OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

📄 arXiv: 2608.12995v1 📥 PDF

作者: Mao Jiayang, Wang Lanfeng, Peng Zhao-Han

分类: cs.AI, cs.MA

发布日期: 2026-08-13

备注: 6 pages,5 figures, accepted by ICUS 2026


💡 一句话要点

提出OGR-MARL框架以解决异构USV在港口水域的协同追捕问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多智能体强化学习 无人水面艇 协同追捕 港口水域 选项引导 残差学习 规则遵循 适应性惩罚

📋 核心要点

  1. 现有方法在异构USV协同追捕中面临导航、交通和角色约束的挑战,导致效率低下。
  2. 提出的OGR-MARL框架通过选项引导和残差学习,允许不同MARL算法在规则引导下进行有效学习。
  3. 实验结果显示,OGR-MASAC在下支门港水域场景中实现75.0%的捕获率,展现出优越的协调能力和规则遵循性。

📝 摘要(中文)

异构无人水面艇(USV)在受限港口水域的协同追捕需要在导航、交通和角色约束下进行逃避者拦截。本文提出了OGR-MARL,一个选项引导的残差多智能体强化学习框架,该框架与特定的多智能体强化学习(MARL)算法解耦。OGR-MARL整合了共享的逃避者信念、角色条件的选项目标、自适应规则惩罚和残差策略学习,使不同的MARL算法能够在规则引导的行为基础上学习纠正动作,而不是从头探索受限的港口环境。通过在代表性的连续控制MARL骨干上实例化OGR-MARL,得到了OGR-MADDPG、OGR-MATD3、OGR-MAPPO和OGR-MASAC。实验结果表明,OGR-MASAC实例在抽象的下支门港水域场景中实现了75.0%的捕获率,展现了有效的任务规则遵循和最佳的异构协调能力。无需重新训练,零-shot转移到QGIS/AIS信息的下支门地图也取得了良好的结果,展示了OGR-MARL在更复杂港口场景中的泛化潜力。

🔬 方法详解

问题定义:本文旨在解决异构无人水面艇(USV)在受限港口水域进行协同追捕时的效率和协调性问题。现有方法往往无法有效应对复杂的导航和角色约束,导致追捕效果不佳。

核心思路:OGR-MARL框架通过引入选项引导和残差学习机制,使得不同的MARL算法能够在已有规则的基础上进行学习,而不是从零开始探索环境。这种设计旨在提高学习效率和策略的适应性。

技术框架:OGR-MARL的整体架构包括共享逃避者信念模块、角色条件选项目标模块、自适应规则惩罚模块和残差策略学习模块。每个模块协同工作,以实现高效的多智能体协作。

关键创新:OGR-MARL的主要创新在于其解耦设计,使得不同的MARL算法(如MADDPG、MATD3等)可以在同一框架下进行优化。这种灵活性使得算法能够针对特定任务进行调整,提升了整体性能。

关键设计:在实现过程中,采用了角色条件的选项目标来引导学习过程,并设计了自适应的规则惩罚机制,以确保智能体遵循任务规则。此外,残差策略学习的引入使得智能体能够在已有策略的基础上进行改进,进一步提升了学习效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,OGR-MASAC在下支门港水域场景中实现了75.0%的捕获率,显著优于其他对比基线,展现出最佳的异构协调能力和任务规则遵循性。此外,零-shot转移到QGIS/AIS信息的下支门地图也取得了良好的效果,证明了模型的泛化能力。

🎯 应用场景

该研究的潜在应用领域包括港口管理、无人水面艇的协同作战以及复杂环境下的多智能体系统。通过提高USV在受限水域的协同追捕能力,能够有效提升港口安全和交通管理的效率,具有重要的实际价值和应用前景。

📄 摘要(原文)

Heterogeneous USV cooperative pursuit in constrained port waterways requires evader interception under navigation, traffic, and role constraints. This paper proposes OGR-MARL, an option-guided residual multi-agent reinforcement learning framework that is decoupled from a specific MARL algorithm. OGR-MARL integrates shared evader belief, role-conditioned option targets, adaptive rule penalties, and residual policy learning, allowing different MARL algorithms to learn corrective actions on top of rule-guided behaviors rather than exploring constrained port environments from scratch. We instantiate OGR-MARL with representative continuous-control MARL backbones, including MADDPG, MATD3, MAPPO, and MASAC, yielding OGR-MADDPG, OGR-MATD3, OGR-MAPPO, and OGR-MASAC. Experiments in an abstract Xiazhimen port-waterway scenario show that the OGR-MASAC instantiation achieves a 75.0% capture rate, promising mission-effective rule compliance, and the best heterogeneous coordination among the tested methods. Without retraining, zero-shot transfer to a QGIS/AIS-informed Xiazhimen map achieves promising results, demonstrating the generalization potential of OGR-MARL in more complex port scenarios.