RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

📄 arXiv: 2608.20208v1 📥 PDF

作者: Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

分类: cs.CV

发布日期: 2026-08-20

🔗 代码/项目: GITHUB


💡 一句话要点

提出RoMAN-Flow以解决离线强化学习中的采样瓶颈问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 自回归正则化流 机器人操作 策略优化 低延迟推理

📋 核心要点

  1. 现有的离线强化学习方法在策略优化中面临高采样开销,限制了其在机器人操作中的应用。
  2. RoMAN-Flow通过无采样的优势加权似然目标优化策略,并将其转化为低延迟的一步动作生成器。
  3. 实验表明,RoMAN-Flow在多个基准测试中表现出色,显著提高了策略性能并减少了推理延迟。

📝 摘要(中文)

离线强化学习通过利用先前收集的数据来改善机器人策略,而无需进一步与环境交互。然而,现有的扩散和流匹配机器人策略缺乏可处理的似然性,限制了它们在基于似然的离线强化学习后训练中的应用。自回归正则化流(AR-NFs)提供了表达性强的动作建模和精确的似然评估,但其顺序采样在策略优化和部署过程中带来了显著的采样开销。本文提出了RoMAN-Flow(自回归正则化流的机器人操作),通过在两个阶段解决采样瓶颈,使AR-NF策略在机器人操作中变得实用。在策略优化过程中,RoMAN-Flow采用无采样的优势加权似然目标,为离线数据集中高优势动作分配更高的似然性。在高效部署方面,它将优化后的自回归策略提炼为一步动作生成器,实现低延迟的动作预测。实验结果表明,RoMAN-Flow在多个模拟操作基准和真实机器人平台上实现了竞争性的策略性能,同时显著降低了推理延迟。

🔬 方法详解

问题定义:本文旨在解决离线强化学习中自回归正则化流(AR-NFs)策略的采样瓶颈问题。现有方法在策略优化和部署过程中存在显著的采样开销,限制了其在机器人操作中的有效性。

核心思路:RoMAN-Flow通过引入无采样的优势加权似然目标来优化策略,避免了从自回归策略中进行采样的需要,从而降低了计算复杂度。同时,它将优化后的策略提炼为一步动作生成器,以实现快速的动作预测。

技术框架:RoMAN-Flow的整体架构包括两个主要阶段:策略优化和策略部署。在策略优化阶段,采用优势加权似然目标进行训练;在策略部署阶段,通过提炼生成器实现低延迟的动作输出。

关键创新:RoMAN-Flow的核心创新在于其无采样的优化方法和高效的动作生成器设计。这与传统的基于采样的策略优化方法形成鲜明对比,显著提高了效率。

关键设计:在损失函数设计上,RoMAN-Flow使用优势加权似然目标,确保高优势动作获得更高的似然性。此外,网络结构经过优化,以支持快速的动作生成和低延迟推理。该方法在多个基准测试中表现出色,验证了其有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,RoMAN-Flow在多个模拟操作基准上达到了与最先进方法相当的策略性能,同时推理延迟减少了50%以上。这一显著的性能提升表明,RoMAN-Flow在实际应用中具有很高的实用性和效率。

🎯 应用场景

RoMAN-Flow在机器人操作领域具有广泛的应用潜力,特别是在需要高效决策和快速响应的场景中,如工业自动化、服务机器人和智能制造等。其低延迟的动作生成能力将推动机器人在复杂环境中的自主操作能力,提升实际应用的价值。

📄 摘要(原文)

Offline reinforcement learning improves robotic policies using previously collected data without further environment interaction. Yet prevalent diffusion- and flow-matching robot policies lack tractable likelihoods, limiting their use in likelihood-based offline RL post-training. AR-NFs offer both expressive action modeling and exact likelihood evaluation, but their sequential sampling incurs substantial sampling overhead during policy optimization and deployment. We present RoMAN-Flow (Robotic Manipulation with Autoregressive Normalizing Flows), an offline reinforcement learning framework that makes AR-NF policies practical for robotic manipulation by addressing this sampling bottleneck in both stages. During policy optimization, RoMAN-Flow employs a sampling-free, advantage-weighted likelihood objective that assigns higher likelihood to high-advantage actions from the offline dataset without sampling from the autoregressive policy. For efficient deployment, it distills the optimized autoregressive policy into a one-step action generator, enabling low-latency action prediction. Experiments across multiple simulated manipulation benchmarks and real-world robotic platforms demonstrate that RoMAN-Flow achieves competitive policy performance while substantially reducing inference latency. Code is available at https://github.com/konnyaku28/RoMAN-Flow.