Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

📄 arXiv: 2608.10824v1 📥 PDF

作者: Zhijie Wu, Kento Kawaharazuka, Kei Okada

分类: cs.RO, cs.CV

发布日期: 2026-08-11

备注: 6 pages, 5 figures, Accepted in IROS 2026. Project Page: https://zjw4321.github.io/neural-introspection-gating-page/


💡 一句话要点

提出Gated VLA-Cache以解决视觉语言行动模型中的KV缓存重用问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言行动 KV缓存 神经内省 实时控制 多模态模型

📋 核心要点

  1. 现有方法在实时控制中需要频繁重新计算视觉标记的KV表示,导致计算资源浪费。
  2. 本文提出Gated VLA-Cache,通过监测预测动作标记的logit边际来动态管理KV缓存的有效性。
  3. 实验结果表明,Gated VLA-Cache在多个基准测试中显著提高了模型的准确性和计算效率。

📝 摘要(中文)

视觉语言行动(VLA)模型通过单一自回归变换器将相机图像和语言指令直接映射到运动指令。在实时控制中,这些模型仍然需要大量计算来重新计算视觉标记的键值(KV)表示,尤其是在相邻帧之间几乎没有变化的情况下。最近的研究如VLA-Cache通过重用视觉静态区域的KV状态来降低这一成本,但其策略仅依赖于观察空间的启发式方法,未考虑模型自身的不确定性。本文提出了Gated VLA-Cache,这是一种轻量级的、无需训练的扩展方法,通过神经内省增强视觉相似性缓存。该方法监测前两个预测动作标记之间的logit边际,当边际低于阈值时,缓存失效并触发完整的重新计算。在四个LIBERO基准测试套件上评估,Gated VLA-Cache在盲目缓存造成损失时提高了可靠性。在LIBERO-Goal和LIBERO-Long上,它恢复了超过100%的丢失准确率,同时保留了80%的计算节省。

🔬 方法详解

问题定义:本文旨在解决视觉语言行动模型在实时控制中频繁重新计算KV表示的问题。现有的VLA-Cache方法虽然可以重用KV状态,但未考虑模型的不确定性,可能导致性能下降。

核心思路:Gated VLA-Cache通过引入神经内省机制,监测预测动作标记的logit边际,动态判断缓存的有效性,从而在需要时触发完整的重新计算。

技术框架:该方法的整体架构包括两个主要模块:视觉相似性缓存模块和神经内省监测模块。视觉相似性缓存模块负责存储和重用KV状态,而神经内省监测模块实时监测logit边际。

关键创新:Gated VLA-Cache的创新在于结合了视觉相似性缓存与神经内省,能够根据模型的自信度动态管理缓存,有效提升了模型的可靠性。

关键设计:在设计中,logit边际的阈值设置是关键参数,影响缓存的失效判断。此外,方法无需额外训练,降低了实现复杂度。整体流程简单高效,适合实时应用。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Gated VLA-Cache在LIBERO-Goal和LIBERO-Long基准测试中恢复了超过100%的丢失准确率,同时保持了80%的计算节省,相较于基线方法表现出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能家居等需要实时决策的场景。通过提高模型在动态环境中的可靠性,Gated VLA-Cache能够显著提升多模态系统的智能水平,推动相关技术的发展与应用。

📄 摘要(原文)

Vision-Language-Action(VLA) models map camera images and language instructions directly to motor commands through a single autoregressive transformer. In real-time control, they still spend substantial compute recomputing key-value(KV) representations for visual tokens that barely change across neighboring frames. Recent work such as VLA-Cache reduces that cost by reusing KV states for visually static patches, but its policy relies only on observation-space heuristics and does not account for the model's own uncertainty. We propose Gated VLA-Cache, a lightweight, training-free extension that augments visual-similarity caching with neural introspection. The method monitors the logit margin between the top two predicted action tokens, a zero-cost confidence signal available during decoding. When the margin drops below a threshold, the cache is invalidated and a full recompute is triggered. Evaluated on four LIBERO benchmark suites with both OpenVLA and OpenVLA-OFT, Gated VLA-Cache improves reliability when blind caching hurts. On LIBERO-Goal and LIBERO-Long, it recovers over 100% of the lost accuracy while retaining 80% of the compute savings.