DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
作者: Hoseong Tae, Jong-Seok Lee
分类: cs.CV, cs.LG
发布日期: 2026-08-04
💡 一句话要点
提出DRIFT以解决流匹配VLA模型的对抗攻击问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗攻击 流匹配模型 去噪速度场 机器人控制 视觉-语言-动作 多步去噪 输入空间优化
📋 核心要点
- 现有流匹配VLA模型在面对对抗攻击时的鲁棒性被认为是虚幻的,主要由于忽视了多步去噪过程的复杂性。
- 论文提出DRIFT,通过在机器人抓手上放置对抗补丁,专注于攻击去噪速度场的第一个步骤,从而实现更有效的攻击。
- 实验结果显示,DRIFT在多个LIBERO测试套件上成功打破了原本可解决的任务,表现出显著优于传统攻击方法的效果。
📝 摘要(中文)
流匹配视觉-语言-动作(VLA)模型如pi0通过整合学习的去噪速度场生成机器人动作,已被报道能抵抗容易欺骗自回归VLA的对抗扰动。我们表明这种鲁棒性在很大程度上是虚幻的,源于之前的攻击忽视了多步去噪常微分方程(ODE)。我们引入DRIFT(通过输入扰动重定向去噪流匹配轨迹),这是一种在机器人抓手上放置的测试时通用对抗补丁,攻击现成策略的去噪速度场。我们的核心发现是反直觉的:仅攻击第一个去噪步骤比攻击更广泛的步骤窗口更强且成本更低,这一现象通过输入空间优化中的梯度冲突解释,恰好与训练时的后门机制相反。在pi0和pi0.5的四个LIBERO套件上,DRIFT以一个小补丁打破了几乎所有原本可解决的任务,远超动作和嵌入空间攻击基线。
🔬 方法详解
问题定义:本论文旨在解决流匹配VLA模型在面对对抗攻击时的虚假鲁棒性问题。现有方法未能充分考虑多步去噪常微分方程(ODE),导致攻击效果不佳。
核心思路:论文提出的DRIFT方法通过在机器人抓手上放置一个对抗补丁,专注于攻击去噪过程的第一个步骤。这种设计利用了输入空间优化中的梯度冲突,能够以更低的成本实现更强的攻击效果。
技术框架:DRIFT的整体架构包括对抗补丁的生成与应用、去噪速度场的攻击策略以及评估模型在不同任务上的表现。主要模块包括补丁设计、攻击实施和效果评估。
关键创新:DRIFT的核心创新在于其攻击策略的独特性,仅针对第一个去噪步骤进行攻击,这一策略与传统方法的多步骤攻击形成鲜明对比,展现出更高的攻击效率。
关键设计:在DRIFT中,补丁的设计考虑了对去噪速度场的最大影响,损失函数的选择旨在优化攻击效果,网络结构则采用了现成的策略模型以确保兼容性与有效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,DRIFT在四个LIBERO测试套件上成功打破了几乎所有原本可解决的任务,使用单个小补丁的攻击效果显著优于传统的动作和嵌入空间攻击基线,展现出更高的攻击效率和更低的成本。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动化系统的安全性评估以及对抗性机器学习的研究。通过提高对抗攻击的有效性,DRIFT可以帮助开发更鲁棒的智能系统,提升其在复杂环境中的适应能力和安全性。
📄 摘要(原文)
Flow-matching vision-language-action (VLA) models such as pi0 generate robot actions by integrating a learned denoising velocity field, and have been reported to resist adversarial perturbations that readily fool autoregressive VLAs. We show that this robustness is largely illusory: it stems from prior attacks ignoring the multi-step denoising ODE. We introduce DRIFT (Denoising Redirection via Input perturbation of the Flow-matching Trajectory), a test-time universal adversarial patch placed on the robot's gripper that attacks the denoising velocity field of an off-the-shelf policy. Our central finding is counterintuitive: attacking only the first denoising step is both stronger and cheaper than attacking a wider window of steps, which we explain through a gradient conflict unique to input-space optimization and which is exactly opposite to the training-time backdoor regime. On pi0 and pi0.5 across four LIBERO suites, DRIFT breaks essentially all originally-solvable tasks with a small single patch, far exceeding action- and embedding-space attack baselines.