FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

📄 arXiv: 2608.16697v1 📥 PDF

作者: Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma

分类: cs.AI

发布日期: 2026-08-17


💡 一句话要点

提出MAE框架以解决VLA自我评估可靠性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作模型 自我评估 马尔可夫链 多模态融合 可靠性评分

📋 核心要点

  1. 现有的视觉-语言-动作模型在自我评估动作生成的可靠性时,通常依赖外部监督或专家注释,存在局限性。
  2. 本文提出了一种新的自我评估框架MAE,通过内部视觉模态熵来评估动作生成的可靠性,避免了对外部标注的依赖。
  3. 实验结果显示,MAE在AUPR、AUROC和FPR@95等指标上均超越了现有的最先进基线,证明了其有效性。

📝 摘要(中文)

视觉-语言-动作模型(VLA)将视觉感知、语言指令和动作生成整合为端到端策略,但在没有外部监督的情况下自我评估动作生成的可靠性仍然是一个重大挑战。现有方法依赖专家注释或仅从输出统计中估计不确定性,忽视了内部信号。本文观察到内部视觉模态熵在成功和失败任务之间存在一致性差异,提出了条件生成马尔可夫链的框架,进而提出了MAE(马尔可夫注意熵)自我评估框架,将内部注意信号直接转换为架构感知的可靠性评分,并引入了LIBERO-Reflect基准。实验表明,MAE在多个VLA架构和场景中均优于现有基线。

🔬 方法详解

问题定义:本文旨在解决视觉-语言-动作模型(VLA)在没有外部监督的情况下自我评估动作生成可靠性的问题。现有方法往往依赖专家注释或仅从输出统计中估计不确定性,忽视了模型内部信号的作用。

核心思路:我们观察到内部视觉模态熵在成功和失败任务之间存在显著差异,提出了一种条件生成马尔可夫链的框架,利用这一特性来设计MAE(马尔可夫注意熵)自我评估框架,从而将内部注意信号转化为可靠性评分。

技术框架:整体架构包括三个主要模块:视觉感知模块、语言指令模块和状态输入模块。通过条件生成马尔可夫链,模型能够在不同架构下共享潜在的动作生成抽象。

关键创新:最重要的创新在于提出了MAE框架,该框架能够直接利用内部注意信号生成架构感知的可靠性评分,与传统方法相比,避免了对外部标注的依赖,提升了自我评估的准确性。

关键设计:在设计上,MAE框架通过引入LIBERO-Reflect基准进行评估,包含2000个标准和2000个挑战性任务,确保了评估的全面性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,MAE在多个VLA架构和场景中均优于现有的最先进基线,具体表现为在AUPR、AUROC和FPR@95等指标上均有显著提升,证明了MAE的有效性和可靠性。通过MAE引导的多次采样,PI-family在LIBERO-Plus上的鲁棒性得到了显著改善,且观察到的运行时开销较小。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能助手等多模态交互系统。通过提高VLA模型的自我评估能力,可以增强系统的可靠性和安全性,推动智能系统在复杂环境中的应用。未来,MAE框架有望在更多实际场景中得到应用,提升智能系统的自主决策能力。

📄 摘要(原文)

Vision-Language-Action models (VLAs) integrate visual perception, language instruction, and action generation into end-to-end policies across heterogeneous architectures. However, enabling VLAs to self-evaluate their action generation reliability without external supervision remains a major challenge. Existing methods either rely on expert annotations or estimate uncertainty only from output statistics, largely ignoring internal signals. In this work, we observe that internal visual modality entropy exhibits consistent distinctions between successful and failed tasks across heterogeneous VLAs. Although VLAs' architectures differ in their action generation, we show that they share a common latent action generation abstraction evolving under visual perception, language instruction, and state input, which we formulate as a Conditional Generative Markov Chain. Based on this formulation, we propose MAE (Markov Attention Entropy), a self-evaluation framework that directly converts internal attention signals into architecture-aware reliability scores, and introduce LIBERO-Reflect, a 4,000-episode benchmark combining 2,000 standard episodes and 2,000 challenging episodes across four subsets. Extensive experiments across heterogeneous VLA architectures and diverse scenarios show that MAE consistently outperforms state-of-the-art baselines on AUPR, AUROC, and FPR@95. We further instantiate FabriMAE for verifier-free test-time action selection, showing that MAE-guided multiple sampling improves PI-family robustness on LIBERO-Plus with small observed runtime overhead.