FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

📄 arXiv: 2608.27384v1 📥 PDF

作者: Zekai Li, Jiaming Tang, Zhijian Liu

分类: cs.RO

发布日期: 2026-08-27

备注: 17 pages, 8 figures


💡 一句话要点

提出FlashVLA以解决VLA模型推理延迟和异步执行问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 流式解码 异步执行 机器人操作 高效推理

📋 核心要点

  1. 现有的VLA模型在推理延迟和异步执行方面存在显著挑战,影响了其在实际应用中的表现。
  2. FlashVLA通过流式动作解码框架,结合块级因果注意力,解决了低延迟推理与异步执行一致性的问题。
  3. 实验结果表明,FlashVLA在单个GPU上实现了≥30Hz的控制频率,显著提升了推理速度和任务性能。

📝 摘要(中文)

视觉-语言-动作(VLA)模型在机器人操作中展现出良好的前景,但其实际部署受到高推理延迟和不稳定的异步执行的制约。尤其是在基于流匹配的VLA模型中,动作解码需要多个迭代步骤,依赖于视觉语言模型(VLM)上下文。现有方法虽然在提高控制频率和减少执行空闲时间方面有所改进,但往往无法同时实现低延迟推理和准确、时间一致的异步执行。为此,本文提出了FlashVLA,一个流式动作解码框架,统一解决这两大挑战。FlashVLA维护一个具有不同噪声水平的流式动作缓冲区,并通过块级因果注意力进行解码,从而在每个推理步骤中生成一个可执行的动作块。此外,其块级自回归结构隐式保持动作连续性,实现平滑的异步执行。通过大量的模拟和真实世界实验,FlashVLA显著提高了推理速度,同时保持了强大的任务性能。

🔬 方法详解

问题定义:本文旨在解决视觉-语言-动作(VLA)模型在实际应用中面临的高推理延迟和不稳定的异步执行问题。现有方法在提高控制频率和减少执行空闲时间方面存在不足,无法同时实现低延迟和准确的异步执行。

核心思路:FlashVLA的核心思路是通过流式动作解码框架,维护一个具有不同噪声水平的动作缓冲区,利用块级因果注意力进行解码,从而在每个推理步骤中生成一个可执行的动作块。这种设计允许在不需要额外未来状态条件的情况下,保持动作的连续性。

技术框架:FlashVLA的整体架构包括流式动作缓冲区和块级因果注意力机制。流式动作缓冲区存储多个不同噪声水平的动作块,而块级因果注意力则用于解码这些动作块,确保每个推理步骤都能生成可执行的动作。

关键创新:FlashVLA的主要创新在于其块级自回归解码方法,能够在保持动作连续性的同时,实现流式推理。这与现有方法的迭代解码方式形成了本质区别,后者往往需要多次迭代才能生成动作。

关键设计:在设计上,FlashVLA采用了块级因果注意力机制,确保每个动作块的生成是基于前一个块的上下文。此外,参数设置和损失函数的选择也经过精心设计,以优化推理速度和任务性能。具体的网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在大量模拟和真实世界实验中,FlashVLA显著提高了推理速度,达到了≥30Hz的控制频率,且在实际部署中实现了平滑的异步推理。这一性能提升相较于现有基线方法具有显著优势,展示了其在高效VLA推理中的应用潜力。

🎯 应用场景

FlashVLA的研究成果在机器人操作、自动化控制和人机交互等领域具有广泛的应用潜力。其高效的推理能力和流畅的异步执行将推动智能机器人在复杂环境中的实际部署,提升其操作效率和可靠性。未来,FlashVLA可能会在更多实时应用场景中发挥重要作用。

📄 摘要(原文)

Vision-Language-Action (VLA) models are increasingly promising for robotic manipulation, yet their real-world deployment remains bottlenecked by high inference latency and unstable asynchronous execution. This challenge is particularly pronounced in flow-matching-based VLA models, where action decoding requires multiple iterative steps conditioned on the VLM context. While efficient inference methods improve control frequency and asynchronous methods reduce execution idle time, existing approaches often fail to jointly achieve low-latency inference and accurate, temporally consistent asynchronous execution. We introduce \textbf{FlashVLA}, a streaming action decoding framework that addresses both challenges in a unified formulation. FlashVLA maintains a streaming action buffer with multiple chunks at different noise levels and decodes them using chunk-wise causal attention. This design allows FlashVLA to produce one executable action chunk per inference step. Moreover, its chunk-wise autoregressive formulation implicitly preserves action continuity, enabling smooth asynchronous execution without extra future-state conditioning. Across extensive simulated and real-world experiments, FlashVLA substantially improves inference speed while maintaining strong task performance. It can achieve $\geq$30\,Hz control frequency on a single GPU with smooth asynchronous inference in real-world deployment.