RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

📄 arXiv: 2607.27782v1 📥 PDF

作者: Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

分类: cs.RO, cs.AI

发布日期: 2026-07-30


💡 一句话要点

提出RedFlow以解决流匹配VLA策略中的错误累积问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 流匹配 视觉-语言-动作 离线强化学习 机器人操作 错误恢复 上下文感知 自适应重定向 密集监督

📋 核心要点

  1. 现有流匹配VLA策略在实际应用中面临错误累积的问题,尤其是在分布转移的情况下,导致学习效率低下。
  2. RedFlow通过将失败经验重定向为动作级纠正监督,提出了一种新的离线强化学习框架,旨在提高策略的恢复能力。
  3. 实验结果表明,RedFlow在多个任务中超越了现有的离线RL基线,成功率显著提升,同时训练样本需求减少了一个数量级。

📝 摘要(中文)

流匹配视觉-语言-动作(VLA)策略在机器人操作中展现出强大的潜力,但在部署过程中常因分布转移而导致错误累积。虽然离线强化学习(RL)为利用回放数据改进已部署策略提供了实用方法,但现有方法要么忽视失败数据,要么仅在轨迹层面利用,导致学习效率低下和持续错误。我们提出了RedFlow,一个细粒度的离线RL框架,将失败经验重定向为动作级纠正监督。RedFlow包括两个关键组件:上下文感知纠正匹配机制和自适应重定向目标。通过将成功和失败经验转化为密集监督,RedFlow实现了从混合质量数据中进行稳健的恢复学习。实验结果显示,RedFlow在LIBERO基准和三个真实世界操作任务中,成功率从56.7%提升至74.7%。

🔬 方法详解

问题定义:论文要解决的问题是流匹配VLA策略在部署过程中因分布转移导致的错误累积。现有方法往往忽视失败数据或仅在轨迹层面利用,导致学习效率低下和持续错误。

核心思路:RedFlow的核心思路是将失败经验重定向为动作级纠正监督,通过上下文感知机制识别失败动作并提供成功替代方案,从而提高策略的恢复能力。

技术框架:RedFlow的整体架构包括两个主要模块:上下文感知纠正匹配机制和自适应重定向目标。前者负责识别失败动作并检索成功的替代动作,后者则通过强化成功动作和抑制不良动作来实现纠正。

关键创新:RedFlow的关键创新在于将失败经验转化为密集监督,允许从混合质量数据中进行稳健学习。这一方法与现有的轨迹级学习方法本质上不同,能够更有效地利用失败数据。

关键设计:在设计上,RedFlow采用了上下文感知的匹配机制来识别失败动作,并设置了自适应重定向目标以平衡成功与失败的学习。此外,损失函数的设计也考虑了对成功和失败经验的不同权重,以优化学习效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,RedFlow在LIBERO基准和三个真实世界操作任务中,成功率从56.7%提升至74.7%,显著超越了现有的离线RL基线。同时,RedFlow在样本需求上也表现出色,减少了约一个数量级的训练样本需求,展现出更高的学习效率。

🎯 应用场景

RedFlow的研究成果在机器人操作、自动化制造和智能家居等领域具有广泛的应用潜力。通过提高机器人在复杂环境中的操作成功率,RedFlow能够显著提升机器人系统的实用性和可靠性,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Flow-matching Vision-Language-Action (VLA) policies have shown strong potential for robotic manipulation but often suffer from compounding errors caused by distribution shifts during deployment. While offline reinforcement learning (RL) provides a practical way to improve deployed policies using rollout data, existing methods either ignore failure data or exploit it only at the trajectory level, resulting in low learning efficiency and persistent errors. We propose RedFlow, a fine-grained offline RL framework that redirects failure experiences into action-level corrective supervision for flow-matching VLA policies. RedFlow consists of two key components: (1) a Context-Aware Corrective Matching mechanism that identifies failure-inducing actions and retrieves successful alternatives from similar contexts as corrective targets, and (2) an Adaptive Redirection Objective that jointly reinforces successful actions, suppresses undesirable ones, and redirects recoverable failures toward corrective targets. By converting both successful and failed experiences into dense supervision, RedFlow enables robust recovery learning from mixed-quality data. Experiments on the LIBERO benchmark and three real-world manipulation tasks show that RedFlow consistently outperforms state-of-the-art offline RL baselines, improving the real-world success rate from 56.7% to 74.7%. It also matches strong on-policy methods (PPO, GRPO, and DDPO) while requiring roughly an order of magnitude fewer training samples.