Latent Energy Action Planning with World Models
作者: Phu Pham, Aniket Bera
分类: cs.LG
发布日期: 2026-09-03
备注: 9 pages, 5 figures, 8 tables
💡 一句话要点
提出LEAP以解决高维观察下的动作规划问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 潜在世界模型 动作规划 模型预测控制 高维观察 优化算法
📋 核心要点
- 现有方法在高维观察下的动作规划中,优化单一潜在目标可能导致目标描述符不匹配,影响控制效果。
- 论文提出LEAP,通过将完整动作时间范围视为可微分变量,优化终端潜在目标与状态能量的匹配。
- 实验结果表明,LEAP系统在四个控制领域的成功率从77.5%提升至94.8%,显示出17.3个百分点的显著提升。
📝 摘要(中文)
潜在世界模型支持从高维观察中进行高效的模型预测控制,但优化单一学习的潜在目标可能导致动作序列的解码器预测终端描述符与目标描述符不匹配。本文提出了潜在能量动作规划(LEAP),将完整的动作时间范围视为可微分变量,并通过冻结的LeWM进行优化。LEAP将终端潜在目标匹配与终端窗口状态能量相结合,低能量要求预测的终端潜在与目标潜在一致,解码器预测的终端描述符与目标描述符一致。通过四个控制领域的实验,LEAP系统将成功率从77.5%提升至94.8%,显示出显著的性能提升。
🔬 方法详解
问题定义:本文旨在解决在高维观察下,优化潜在目标导致的动作序列与目标描述符不匹配的问题。现有方法如LeWM+CEM在这一点上表现不佳,成功率较低。
核心思路:LEAP通过将完整的动作时间范围视为可微分变量,结合终端潜在目标匹配与状态能量,优化动作序列的生成。该设计旨在确保预测的终端潜在与目标潜在一致,从而提高控制精度。
技术框架:LEAP的整体架构包括三个主要模块:首先,使用冻结的目标条件提案初始化搜索;其次,采用拟牛顿求解器通过自回归展开精炼动作;最后,后优化投影确保动作范围的可接受性。
关键创新:LEAP的主要创新在于将完整的动作时间范围视为可微分变量,并引入状态能量的概念,以实现终端潜在目标的匹配。这一方法与传统的单一目标优化方法本质上不同,能够更好地处理高维观察。
关键设计:在关键设计上,LEAP采用了冻结的LeWM表示和预测器,使用了特定的损失函数来衡量终端潜在与目标潜在的一致性,同时确保解码器预测的描述符与目标描述符的一致性。
🖼️ 关键图片
📊 实验亮点
在四个控制领域的实验中,LEAP系统的成功率从77.5%显著提升至94.8%,相较于基线方法(LeWM+CEM)提高了17.3个百分点,展示了其在动作规划中的有效性和优势。
🎯 应用场景
LEAP的研究成果在机器人控制、自动驾驶、智能制造等领域具有广泛的应用潜力。通过提高高维观察下的动作规划精度,LEAP能够有效提升自动化系统的决策能力和执行效率,推动相关技术的进步与应用。
📄 摘要(原文)
Latent world models support efficient model predictive control from high-dimensional observations, yet optimizing a single learned latent objective can favor action sequences whose decoder-predicted terminal descriptor does not match the goal descriptor. We introduce Latent Energy Action Planning (LEAP), which treats the complete action horizon as a differentiable variable and optimizes it through a frozen LeWorldModel (LeWM). LEAP couples terminal latent goal matching with a terminal-window state energy. Low energy requires the predicted terminal latent to agree with the goal latent and the decoder-predicted terminal descriptor to agree with the goal descriptor. A frozen goal-conditioned proposal initializes the search, a quasi-Newton solver refines actions through the autoregressive rollout, and post-optimization projection enforces the admissible action range. Across four control domains using the officially released LeWM checkpoints, the complete LEAP planning system raises mean success from 77.5% for LeWM planned with the cross-entropy method (LeWM+CEM) to 94.8% under a matched protocol, a 17.3-percentage-point improvement, while retaining the frozen LeWM representation and predictor.