Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

📄 arXiv: 2608.23204v1 📥 PDF

作者: Hossein Abdi, Satya Prakash Dash, Mingfei Sun

分类: cs.RO

发布日期: 2026-08-24


💡 一句话要点

提出GuRO框架以解决高维非线性系统决策问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 模型预测控制 强化学习 曲率感知优化 决策变换器 高维控制

📋 核心要点

  1. 高维非线性系统的决策面临模型预测控制和强化学习的性能瓶颈,尤其在动态模型不准确时。
  2. 提出的GuRO框架结合了MPC与RL,利用曲率感知优化来高效处理非凸损失,提升决策效率。
  3. 在高维四足控制任务中,GuRO框架相较于传统基线表现出显著的性能提升,回报更高且收敛更快。

📝 摘要(中文)

在高维非线性系统的决策中,模型预测控制(MPC)方法虽然具备样本效率和可解释性,但在动态模型不准确或需要长时间预测时表现不佳。相反,模型无关的强化学习(RL)直接从交互中学习策略,但面临样本复杂度高和优化不稳定的问题。本文提出了一种新颖的框架,将MPC与RL结合在序列决策框架中,并利用曲率感知优化有效应对非凸损失景观。MPC提供局部最优轨迹的预测,指导决策变换器,消除了大量离线预训练的需求。通过在黎曼参数空间中训练策略,采用高效的黎曼方法,实现了更快且更稳健的优化。我们在高维四足控制任务上评估了该框架,展示了相较于TRPO、SAC和在线决策变换器等强基线的一致性提升,获得了更高的回报和更快的收敛速度。

🔬 方法详解

问题定义:本文旨在解决高维非线性系统中的决策问题,现有的模型预测控制(MPC)在动态模型不准确或长时间预测时性能下降,而模型无关的强化学习(RL)则面临高样本复杂度和优化不稳定的挑战。

核心思路:论文提出的GuRO框架通过将MPC与RL结合,利用MPC提供的局部最优轨迹预测来指导决策变换器,从而减少对大量离线预训练的需求,并通过在黎曼参数空间中进行训练来提高优化的速度和稳定性。

技术框架:该框架的整体架构包括MPC模块用于轨迹预测,决策变换器模块用于策略学习,以及黎曼优化模块用于高效优化。通过这种结构,GuRO能够在复杂的决策任务中实现更优的性能。

关键创新:GuRO的主要创新在于引入了曲率感知优化方法,使得在非凸损失景观中能够更快收敛,并且通过结合MPC与RL,克服了传统方法的局限性。

关键设计:在设计中,采用了特定的损失函数以适应黎曼优化,网络结构则结合了变换器的优势,以处理序列决策问题。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,GuRO框架在高维四足控制任务上表现出显著优势,相较于TRPO、SAC和在线决策变换器,获得了更高的回报和更快的收敛速度,展示了其在复杂决策场景中的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能制造等高维非线性系统的决策任务。通过提升决策效率和优化稳定性,GuRO框架能够为实际应用提供更可靠的解决方案,推动相关技术的发展与应用。

📄 摘要(原文)

Decision-making in high-dimensional, nonlinear systems remains a central challenge in robotics. While model-based methods like Model Predictive Control (MPC) offer sample efficiency and interpretability, their performance degrades when the dynamics model is inaccurate or long-horizon predictions are required. Conversely, model-free reinforcement learning (RL) learns policies directly from interaction but suffers from high sample complexity and unstable optimization. Recent advances in sequence modeling have inspired transformer-based decision-making frameworks that can unify MPC and RL, but their training typically faces significant optimization challenges due to highly non-convex loss landscapes. In this work, we propose a novel framework that integrates MPC with RL in a sequence decision-making framework and leverages a curvature-aware optimization to efficiently tackle non-convex loss landscapes. MPC provides predictions of locally optimal trajectories that guide the decision transformer, removing the need for extensive offline pretraining. To address the slow and unstable convergence of traditional optimizers, we train the policy in a Riemannian parameter space using an efficient Riemannian (curvature-aware) method, leading to faster and more robust optimization. We evaluate our framework on high-dimensional quadruped control tasks and demonstrate consistent improvements over strong baselines, including TRPO, SAC, and Online Decision Transformer, achieving higher returns and faster convergence.