Online Reinforcement Learning in the Met Office Unified Model through Distributed Model-Agent Coupling

📄 arXiv: 2609.02566v1 📥 PDF

作者: Pritthijit Nath, Sebastian Schemm, Peter Haynes, Emily Shuckburgh, Mark Webb

分类: cs.LG

发布日期: 2026-09-02

备注: 18 pages, 13 figures


💡 一句话要点

通过分布式模型-智能体耦合提出在线强化学习以改进天气预报

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 天气预报 强化学习 数值模型 机器学习 气象分析 动态修正 分布式系统

📋 核心要点

  1. 现有的数值天气预报方法在动态一致性和数值稳定性方面存在挑战,难以有效整合机器学习修正。
  2. 本文提出将英国气象局统一模型与分布式强化学习智能体耦合,通过局部张量实现动态修正。
  3. 实验结果表明,学习策略在多个纬度带中显著降低了天气预报误差,展示了在线学习的可行性和潜力。

📝 摘要(中文)

机器学习修正可以补充数值天气预报,但需适应不断变化的模型状态,同时保持动力学一致性和数值稳定性。本文将英国气象局统一模型与分布式强化学习智能体耦合,通过局部张量实现。采用DDPG算法,智能体在每个气柱的70个垂直模型层之间共享权重,并对模型趋势施加有界的潜在温度修正。在十次训练预报中,向英国气象局的操作分析进行调整,提供了即时的反事实目标。经过训练的策略在非调整预报中进行评估,结果显示该耦合工作流成功完成训练,并在评估案例中保持数值稳定。相较于匹配的本地UM预报,学习策略在六个纬度带中的四个带减少了Z$_{500}$ MAE,北部和南部热带的减少幅度分别为45.8%和40.8%。

🔬 方法详解

问题定义:本文旨在解决现有数值天气预报方法在动态一致性和数值稳定性方面的不足,尤其是在整合机器学习修正时的挑战。

核心思路:通过将英国气象局统一模型与分布式强化学习智能体耦合,利用局部张量实现模型状态的动态调整,以保持数值稳定性和一致性。

技术框架:整体架构包括模型与智能体的耦合,使用DDPG算法进行训练,智能体在每个气柱的70个垂直层之间共享权重,并施加潜在温度修正。训练过程通过调整向操作分析提供的目标进行优化。

关键创新:最重要的技术创新在于通过分布式强化学习实现了对数值天气预报模型的动态修正,克服了传统方法的局限性,提供了更为灵活的修正机制。

关键设计:在设计中,智能体的权重共享机制、潜在温度修正的有界性以及训练过程中的调整策略都是关键参数,确保了模型的数值稳定性和训练效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,学习策略在六个纬度带中的四个带减少了Z$_{500}$ MAE,北部和南部热带的减少幅度分别为45.8%和40.8%。此外,MSLP误差在三个纬度带中也有所降低,最大减少幅度为27.3%(0-30°N),展示了该方法的有效性和潜力。

🎯 应用场景

该研究的潜在应用领域包括气象预报、气候模型优化和环境监测等。通过引入强化学习,能够在实际操作系统中实现更为精准的天气预报,提升气象服务的可靠性和效率,具有重要的社会和经济价值。未来,随着技术的进一步发展,可能会在更广泛的领域中应用,如灾害预警和农业气象服务等。

📄 摘要(原文)

Machine-learnt corrections can complement numerical weather prediction only if they adapt to the evolving model state while preserving dynamical consistency and numerical stability. To test this within a global forecasting model, we couple the Met Office (UKMO) Unified Model (UM) with distributed RL agents through rank-local tensors. A DDPG actor shares weights across the 70 vertical model levels of each atmospheric column and applies bounded potential-temperature corrections to the model tendencies. Across ten nudged training forecasts, nudging calculations towards the UKMO operational analysis provides an immediate counterfactual target. The frozen policy is then evaluated in a non-nudged forecast for inference. The coupled workflow successfully completes training and remains numerically stable in the evaluated case. Relative to a matched native UM forecast at +6 h, the learnt policy reduces Z$_{500}$ MAE in four of six latitude bands, including reductions of 45.8% and 40.8% in the northern and southern tropics. MSLP error too decreases in three bands, with a maximum reduction of 27.3% at 0-30°N. This single-case experiment demonstrates significant promise and feasibility of distributed online learning followed by non-nudged inference, laying the groundwork for RL-based bias correction and parametrisations within operational systems.