Learning Fault-Tolerant Locomotion with Adaptive Gait Timing

📄 arXiv: 2608.07328v1 📥 PDF

作者: Giovanbattista Gravina, Luca Rossini, Carlo Rizzardo, Arturo Laurenzi, Nikos Tsagarakis

分类: cs.RO, cs.LG

发布日期: 2026-08-07

备注: Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)


💡 一句话要点

提出深度强化学习方法以解决腿部机器人故障容忍行走问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 深度强化学习 故障容忍 四足机器人 步态调整 自适应控制 机器人技术 模拟与实验

📋 核心要点

  1. 现有的四足机器人在硬件故障情况下难以快速调整步态和协调,导致稳定性和移动性下降。
  2. 本文提出了一种基于深度强化学习的故障容忍行走方法,采用不对称的演员-评论家架构,并引入潜在对齐损失。
  3. 在高保真模拟和真实实验中,所提方法在不平坦地形和平坦地面上均表现出优越的适应能力和稳定性。

📝 摘要(中文)

硬件故障要求四足机器人快速重新组织协调和步态时序,以维持稳定性和移动性。对于较大的四足机器人而言,增加的质量和更紧的驱动限制使得激进的高频补偿策略的可行性降低。本文提出了一种深度强化学习方法,用于在执行器功率损失情况下实现故障容忍的行走。该方法采用不对称的演员-评论家架构,评论家在训练期间可以访问特权信息,而演员则学习从本体感知观察中重构相应的潜在表示。我们引入了一种潜在对齐损失,鼓励演员和评论家表示之间的一致性。此外,我们通过可学习的步态频率参数扩展了动作空间,使得机器人能够在地形变化和执行器退化的情况下自适应调整步态时序,而无需预定义的故障腿策略。该方法在高保真模拟和真实世界实验中得到了验证。

🔬 方法详解

问题定义:本文旨在解决四足机器人在执行器功率损失情况下的故障容忍行走问题。现有方法在应对硬件故障时,往往缺乏有效的步态调整机制,导致机器人失去稳定性和移动能力。

核心思路:论文提出了一种深度强化学习方法,通过不对称的演员-评论家架构,使得评论家可以访问特权信息,而演员则从本体感知数据中学习潜在表示。这种设计使得机器人能够在故障情况下快速适应。

技术框架:整体架构包括演员和评论家两个主要模块。评论家负责评估当前策略的价值,而演员则根据评论家的反馈调整其策略。此外,动作空间中引入了可学习的步态频率参数,以实现自适应步态调整。

关键创新:最重要的技术创新在于引入了潜在对齐损失,确保演员和评论家之间的表示一致性。这一创新使得机器人在面对执行器故障时,能够更有效地进行自适应调整。

关键设计:在网络结构上,采用了不对称的演员-评论家架构,评论家使用了额外的特权信息。损失函数中引入了潜在对齐损失,以增强学习过程中的一致性。此外,步态频率参数的学习机制使得机器人能够灵活应对不同的地形和故障情况。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提方法在高保真模拟中能够有效应对不平坦地形,且在真实世界实验中,68 kg的四足机器人在执行器故障情况下仍能保持稳定行走,显示出显著的适应能力和稳定性提升。

🎯 应用场景

该研究的潜在应用领域包括救援机器人、探测机器人以及其他需要在复杂环境中自主移动的四足机器人。通过提高机器人在故障情况下的适应能力,能够显著提升其在实际应用中的可靠性和安全性,未来可能对机器人技术的发展产生深远影响。

📄 摘要(原文)

Hardware failures require legged robots to rapidly reorganize coordination and gait timing to maintain stability and mobility. This is particularly challenging for larger quadrupeds, where increased mass and tighter actuation limits reduce the feasibility of aggressive, high-frequency compensation strategies often observed on smaller platforms. In this work, we propose a deep reinforcement learning approach for fault-tolerant locomotion under actuator power loss. The method employs an asymmetric actor-critic architecture in which the critic has access to privileged information during training, while the actor learns to reconstruct a corresponding latent representation from proprioceptive observations. We introduce a latent-alignment loss that encourages consistency between actor and critic representations. Additionally, we augment the action space with a learnable gait frequency parameter, enabling adaptive gait timing in response to terrain variations and actuator degradation without predefined faulty-leg strategies. The approach is validated in high-fidelity simulation on uneven terrain and real-world experiments on flat ground using a 68 kg quadruped robot.