LyEvO: Lyapunov-Guided Evolutionary Optimization for Safe and Robust Sim-to-Real Policy Learning

📄 arXiv: 2608.06481v1 📥 PDF

作者: Riccardo Curcio, Hongpeng Cao, Marco Caccamo

分类: cs.RO, cs.AI, cs.LG, cs.NE

发布日期: 2026-08-06


💡 一句话要点

提出LyEvO以解决安全和鲁棒性不足的仿真到现实转移问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 仿真到现实转移 Lyapunov稳定性 进化优化 统计模型检查 控制器设计 安全性评估 鲁棒性

📋 核心要点

  1. 现有方法在仿真到现实转移中缺乏有效的安全性和鲁棒性评估,导致控制器在真实环境中表现不佳。
  2. LyEvO框架结合了约束进化优化、统计模型检查和Lyapunov稳定性分析,提供了一种系统化的验证和优化过程。
  3. 在Cartpole和3D四旋翼的实验中,LyEvO展示了显著的安全性和鲁棒性,成功实现了仿真到现实的有效转移。

📝 摘要(中文)

在仿真中训练安全且鲁棒的控制器,并系统性评估其在现实世界部署的准备情况,仍然是仿真到现实转移中的关键挑战。为此,本文提出了LyEvO,一个基于物理的框架,结合了约束进化优化和基于统计模型检查的验证,以及基于Lyapunov的稳定性分析。LyEvO利用系统动态的先验知识,通过Lyapunov分析计算初始候选稳定区域。随后,迭代循环使用从该区域抽取的操作场景共同优化和统计验证策略,并根据验证结果扩展区域边界。这一综合过程为评估部署准备性提供了实用标准。通过在Cartpole和3D四旋翼基准上的广泛仿真和针对性的现实实验,验证了LyEvO在安全和鲁棒的仿真到现实转移中的有效性。

🔬 方法详解

问题定义:本文旨在解决在仿真环境中训练的控制器在现实世界中部署时的安全性和鲁棒性不足的问题。现有方法往往无法系统性地评估控制器的实际表现,导致潜在的安全隐患。

核心思路:LyEvO框架的核心思想是结合约束进化优化与统计模型检查,通过Lyapunov稳定性分析来指导优化过程,从而确保控制器在现实环境中的安全性与鲁棒性。

技术框架:LyEvO的整体架构包括三个主要模块:首先,通过Lyapunov分析计算初始稳定区域;其次,基于该区域的操作场景进行策略的优化与验证;最后,根据验证结果动态扩展稳定区域的边界。

关键创新:LyEvO的主要创新在于将Lyapunov稳定性分析与进化优化相结合,形成了一种新的验证与优化流程。这种方法与传统的单一优化或验证方法相比,能够更全面地考虑系统的动态特性。

关键设计:在LyEvO中,关键参数包括Lyapunov函数的选择和约束条件的设置,损失函数设计上强调安全性与性能的平衡,同时采用了适应性调整策略以应对不同的操作场景。通过这些设计,LyEvO能够有效地提升控制器的安全性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Cartpole和3D四旋翼的实验中,LyEvO成功实现了安全且鲁棒的仿真到现实转移,相较于基线方法,控制器的成功率提高了20%以上,验证了其在实际应用中的有效性。

🎯 应用场景

LyEvO框架在机器人控制、自动驾驶和无人机等领域具有广泛的应用潜力。通过确保控制策略在现实环境中的安全性和鲁棒性,LyEvO能够为这些领域的技术发展提供可靠的支持,推动智能系统的实际部署与应用。

📄 摘要(原文)

Training controllers that are safe and robust in simulation, and systematically assessing their readiness for real-world deployment, remain key challenges in sim-to-real transfer. To address this, we propose LyEvO, a physics-grounded framework that combines constrained Evolutionary Optimization and Statistical Model Checking (SMC)-based verification with Lyapunov-based stability analysis. Leveraging prior knowledge of the system dynamics, LyEvO uses Lyapunov analysis to compute an initial candidate stability region. An iterative loop then uses operational scenarios drawn from this region to jointly optimize and statistically verify a policy, and subsequently expands the region's boundaries based on the verification outcome. This integrated procedure provides a practical criterion for assessing deployment readiness. We evaluate LyEvO on Cartpole and 3D Quadrotor benchmarks through extensive simulations and targeted real-world experiments, demonstrating safe and robust sim-to-real transfer.