LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models

📄 arXiv: 2608.17600v1 📥 PDF

作者: Zhengyan Qian, Rui Yan, Alex Jinpeng Wang, Jinhui Tang

分类: cs.RO

发布日期: 2026-08-18


💡 一句话要点

提出LIBERO-VIFO以评估视觉线索跟随的能力与安全性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉线索 机器人学习 安全性评估 多模态模型 视觉-语言-动作

📋 核心要点

  1. 现有方法仅关注最终任务成功,未能系统评估视觉线索跟随的能力与安全性,存在安全隐患。
  2. 提出LIBERO-VIFO基准,通过定义多种视觉线索类型和测试协议,全面评估VLA模型的线索跟随能力与安全性。
  3. 实验表明,当前VLA模型能够在没有语言指令的情况下执行任务,揭示了未授权线索跟随的风险,需引起重视。

📝 摘要(中文)

视觉线索在机器人学习中越来越被采用,但现有的视觉-语言-动作(VLA)模型是否能够可靠地跟随授权线索而忽略未授权线索仍不明确。现有研究仅覆盖有限的线索形式,且主要关注最终任务成功,未能对线索跟随能力进行细致评估。为此,本文提出LIBERO-VIFO基准,系统评估VLA模型在视觉线索跟随中的能力与安全性。LIBERO-VIFO定义了八种视觉线索类型,并设定了四个测试协议,分为两部分,分别测试线索理解与授权跟随,以及在语言-线索冲突和空语言条件下的未授权线索跟随。实验结果显示,尽管视觉线索理解并不总能转化为执行,但当前VLA模型能够在没有语言指令的情况下执行线索指示的任务,暴露出未授权视觉线索跟随的潜在风险。

🔬 方法详解

问题定义:本文旨在解决VLA模型在视觉线索跟随中的能力与安全性评估问题。现有方法仅关注线索的最终任务成功,未能深入探讨线索的授权与未授权跟随,导致潜在的安全风险。

核心思路:LIBERO-VIFO基准通过定义八种视觉线索类型,建立系统的评估框架,旨在同时考量线索理解与执行的能力,以及未授权线索跟随的风险。

技术框架:整体架构分为两部分:第一部分测试线索理解与授权跟随,第二部分评估在语言-线索冲突和空语言条件下的未授权线索跟随。四个测试协议确保全面覆盖不同的线索形式与条件。

关键创新:LIBERO-VIFO的最大创新在于将视觉线索的安全性引入VLA模型的评估中,填补了现有研究的空白,强调了视觉中心安全性的新视角。

关键设计:在实验中,采用了多种线索形式和测试协议,确保评估的全面性与准确性。关键参数设置与损失函数设计旨在优化线索理解与执行的效果。实验还扩展至真实机器人部署,以验证模型在实际应用中的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,尽管视觉线索理解并不总能有效转化为执行,但当前的VLA模型在没有语言指令的情况下,仍能成功执行线索指示的任务,暴露出未授权视觉线索跟随的风险。此发现强调了在设计VLA模型时,需更加关注安全性问题。

🎯 应用场景

该研究的潜在应用场景包括智能机器人、自动驾驶系统和人机交互等领域。通过系统评估视觉线索的能力与安全性,能够为未来的机器人学习与决策提供更安全的指导,降低未授权行为的风险,推动智能系统的安全性与可靠性提升。

📄 摘要(原文)

Visual cues are increasingly adopted to guide robot learning, but whether Vision-Language-Action (VLA) models can reliably follow authorized cues while disregarding unauthorized ones remains unclear. Existing work covers only a narrow range of cue forms and focuses on final task success, providing only a coarse assessment of cue-following capability. Treating all visual cues as authorized also leaves safety risks of unauthorized following unexplored. To address these gaps, we introduce LIBERO-VIFO, a benchmark to evaluate both the capability and safety of visual cue following in VLA models. LIBERO-VIFO defines eight visual cue families spanning diverse forms. A total of four protocols in two parts are defined: Part I tests cue understanding and authorized following, while Part II evaluates unauthorized visual cue following under language-cue conflict and empty language conditions. Evaluating seven VLA models reveals that although visual cue understanding does not reliably translate into execution, current VLAs are able to execute cue-indicated tasks without language instruction, exposing an emerging risk of unauthorized visual cue following. Extended experiments on scene-instantiated cues, safety-critical settings, and real-robot deployment corroborate these findings. LIBERO-VIFO brings both the capability and safety of visual cue following into systematic evaluation, establishing visual-centric safety as a new perspective for the VLA community.