Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals

📄 arXiv: 2608.26571v1 📥 PDF

作者: Guopeng Li, Yiyang Duan, Yiru Jiao, Chengcheng Xu

分类: cs.LG, cs.RO

发布日期: 2026-08-27

备注: 21 pages, 14 figures, 5 tables, Code: https://github.com/RomainLITUD/safe-crl

🔗 代码/项目: GITHUB


💡 一句话要点

提出安全对比强化学习以解决失败终止下的目标导向策略学习问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 对比强化学习 安全学习 机器人导航 马尔可夫决策过程 策略优化 失败信号 生存率提升

📋 核心要点

  1. 现有的对比强化学习方法在失败终止的情况下,未能有效处理因失败导致的样本偏差,造成目标价值的高估。
  2. 本文提出的安全对比强化学习(Safe-CRL)通过质量加权的InfoNCE和对数生存质量评分,修正了现有方法的不足,增强了策略学习的安全性。
  3. 在多个机器人导航和运动任务中,Safe-CRL显著提升了生存率,并在目标达成性能上超越了基线方法Scaling-CRL。

📝 摘要(中文)

对比强化学习(CRL)在目标导向任务中通过自监督对比目标有效扩展。然而,在失败终止的马尔可夫决策过程中,现有CRL在构建正样本时仅考虑失败前的未来目标,忽略了因失败终止而移除的概率质量。理论分析表明,这种遗漏导致目标价值的系统性高估,近失败轨迹对成功的监督过于强烈,可能强化不安全的行为。为解决这一问题,本文提出了两个有效的修正:质量加权的InfoNCE和对数生存质量评分,形成了安全对比强化学习(Safe-CRL),仅需一个由失败终止提供的一位信号即可扩展安全的目标导向策略学习。实验表明,Safe-CRL在十二个易失败的机器人导航和运动任务中显著提高了生存率和目标达成性能。

🔬 方法详解

问题定义:本文旨在解决在失败终止的马尔可夫决策过程中,现有对比强化学习方法因忽略失败后果而导致的目标价值高估问题。现有方法未能有效利用失败信号,导致不安全行为的强化。

核心思路:论文提出通过质量加权的InfoNCE和对数生存质量评分来修正现有CRL方法的偏差,从而在仅依赖失败信号的情况下实现安全的目标导向策略学习。

技术框架:Safe-CRL的整体架构包括两个主要模块:一是质量加权的InfoNCE用于修正价值学习中的短期生存未来的过度加权,二是对数生存质量评分用于恢复策略优化中的缺失生存质量。

关键创新:最重要的创新在于引入了质量加权的InfoNCE和对数生存质量评分,这两者有效地解决了现有方法在失败终止情况下的样本偏差问题,使得策略学习更加安全和有效。

关键设计:在实现过程中,采用了特定的损失函数来平衡正负样本的权重,并设计了适应性网络结构以处理复杂的失败模式,确保策略能够有效学习到安全的行为。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Safe-CRL在十二个失败易发的机器人任务中,生存率显著提高,并且在目标达成性能上超越了Scaling-CRL基线,提升幅度达到XX%(具体数据待补充)。深度Safe-CRL策略展现出复杂的避免失败行为,进一步验证了其有效性。

🎯 应用场景

该研究的潜在应用场景包括机器人导航、自动驾驶以及其他需要在不确定环境中进行决策的领域。通过提升策略的安全性,Safe-CRL能够在实际应用中减少失败风险,提高系统的可靠性和效率。未来,该框架可能推动更广泛的安全强化学习研究和应用。

📄 摘要(原文)

Contrastive reinforcement learning (CRL) scales effectively in goal-conditioned tasks by casting policy learning into a self-supervised contrastive objective. However, in a failure-terminated Markov decision process, established CRL considers pre-failure future goals only when constructing positive samples, without accounting for the probability mass removed by failure termination. Our theoretical analysis shows that this omission induces a systematic overestimation bias in goal-reaching values. Consequently, near-failure trajectories provide disproportionately strong supervision of success despite retaining little future occupancy. Unsafe actions can thereby be reinforced through catastrophic failure bootstrapping, leading to failed policy learning and unsustainable goal-reaching behaviours. To address this problem, we introduce two minimal yet strong corrections: mass-weighted InfoNCE corrects the overweighting of short surviving futures in critic learning, and a log-survival-mass score restores the missing survival mass in policy optimization. The resulting method, Safe Contrastive Reinforcement Learning (Safe-CRL), requires only the one-bit signal provided by failure termination to scale safe goal-conditioned policy learning. Across twelve failure-prone robot navigation and locomotion tasks, Safe-CRL consistently improves survival and substantially outperforms the Scaling-CRL baseline in goal-reaching performance. Additionally, deep Safe-CRL policies exhibit complex failure-avoidance behaviours. This study completes the CRL theory under failure termination and provides a scalable safe RL framework. The code is available via https://github.com/RomainLITUD/safe-crl.