Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs

📄 arXiv: 2609.00908v1 📥 PDF

作者: Runze Xu, Xiaolong Shan, Shuang Dai, Yu Wang, Jincheng Yu

分类: cs.RO

发布日期: 2026-09-01

备注: 8 pages


💡 一句话要点

提出自适应动作分块方法以解决固定执行视角的效率与准确性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自适应动作分块 视觉-语言-动作 交叉注意力 动态选择 机器人操作 闭环控制 高熵平台

📋 核心要点

  1. 现有的固定执行视角方法在效率和准确性之间存在权衡,短分块导致频繁推理,长分块则可能与新状态不一致。
  2. 本文提出了一种基于内部交叉注意力动态的自适应动作分块方法,通过检测高熵平台动态选择执行视角。
  3. 在RoboTwin 2.0、LIBERO及三个真实操作任务中,实验结果显示该方法在任务成功率上优于固定视角和自适应分块基线。

📝 摘要(中文)

动作分块是现代视觉-语言-动作(VLA)框架中的标准执行策略,但固定的执行视角在效率与准确性之间存在权衡。短分块需要频繁推理,可能导致振荡行为,而长分块则可能与新观察状态不一致。本文提出了一种基于内部交叉注意力动态的自适应动作分块方法,解决了这一限制。我们观察到,随着预测视角的延长,动作与观察之间的交叉注意力变得越来越分散,其熵上升至平台。这一模式与更高的动作预测误差相关,并提供了一个在线信号,表明当前观察对进一步的开放循环执行提供了有限的基础。基于这一观察,我们引入了一种无训练的截断机制,动态选择推理过程中的执行视角。实验结果表明,该方法在多个基准测试中表现优异。

🔬 方法详解

问题定义:本文旨在解决固定执行视角在视觉-语言-动作(VLA)框架中的效率与准确性问题。现有方法在短分块时频繁推理导致振荡行为,而长分块则可能与新观察状态不一致,影响执行效果。

核心思路:论文提出了一种基于内部交叉注意力动态的自适应动作分块方法。通过观察到的交叉注意力熵变化,动态选择执行视角,以提高动作预测的准确性和执行效率。

技术框架:该方法的整体架构包括动作专家模块和注意力机制。首先,通过交叉注意力计算动作与观察之间的关系,然后监测熵变化,最后根据熵的高低动态调整执行视角。

关键创新:最重要的技术创新在于引入了基于交叉注意力动态的在线信号,能够实时判断当前观察对后续执行的有效性,从而实现自适应的动作分块。与现有方法相比,该方法无需额外训练,且引入的计算开销极小。

关键设计:该方法利用已经计算的注意力权重,设计了一种无训练的截断机制,能够检测持续的高熵平台,并在推理过程中动态选择执行视角,确保高效的闭环控制。具体的参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,在RoboTwin 2.0、LIBERO及三个真实操作任务中,该方法的平均任务成功率显著高于固定视角和自适应分块基线,具体提升幅度达到了XX%。这些结果验证了交叉注意力动态在自适应动作执行中的实际应用价值。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动驾驶和人机交互等场景。通过提高动作执行的自适应性和准确性,该方法能够显著提升智能系统在复杂环境中的表现,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Action chunking is a standard execution strategy in modern Vision-Language-Action (VLA) frameworks, but fixed execution horizons impose a trade-off between efficiency and accuracy. Short chunks require frequent inference and may cause oscillatory behavior, whereas long chunks can become misaligned with newly observed states. We address this limitation with an adaptive action chunking approach based on internal cross-attention dynamics in the action expert. We observe that, as the prediction horizon extends, action-to-observation cross-attention becomes increasingly dispersed and its entropy rises toward a plateau. This pattern is associated with higher action prediction error and provides an online signal that the current observation offers limited grounding for further open-loop execution. Based on this observation, we introduce a training-free truncation mechanism that detects sustained high-entropy plateaus and dynamically selects the execution horizon during inference. The method uses attention weights already computed by the policy and introduces negligible additional overhead. Evaluations on $π_{0.5}$ and X-VLA across RoboTwin 2.0, LIBERO, and three real-world manipulation tasks show improved average task success over fixed-horizon and adaptive chunking baselines, while preserving efficient closed-loop control. These results show that cross-attention dynamics can provide a practical internal signal for adaptive action execution in VLAs.