Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models
作者: Jiahui Han, Yuhui Yao, Xin Wang, Jiafei Cao, Mingxuan Zhang, Danfeng Shan, Huiqi Deng, Guanchu Wang, Xia Hu
分类: cs.AI, cs.RO
发布日期: 2026-08-11
💡 一句话要点
提出DURA以解决VLA模型的对抗攻击问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗攻击 视觉-语言-动作 扩散模型 机器人控制 安全性研究
📋 核心要点
- 现有针对VLA模型的攻击方法依赖于像素空间扰动或白盒访问,导致明显伪影,限制了实际应用。
- DURA通过优化预训练扩散模型的潜在轨迹,生成视觉自然的对抗补丁,支持白盒和黑盒攻击。
- 实验结果表明,DURA在仿真和真实环境中均优于现有攻击方法,揭示了VLA模型的安全隐患。
📝 摘要(中文)
视觉-语言-动作(VLA)模型在多种操作任务中展现出强大的控制能力。然而,其对抗鲁棒性尚未得到充分探索,利用这一弱点可能导致现实世界的危害。现有针对VLA模型的攻击方法通常依赖于像素空间的扰动或白盒访问,导致明显的伪影并限制了在真实机器人系统中的可部署性。本文提出了DURA,一种基于扩散的无约束机器人攻击方法,能够为VLA模型生成视觉上自然的对抗补丁。DURA支持白盒和黑盒攻击设置,其中黑盒设置仅需受害模型的预测动作。通过沿着预训练扩散模型的潜在轨迹进行优化,DURA生成视觉上自然的补丁,同时引导机器人朝向攻击者指定的目标动作。大量的仿真实验和真实物理世界实验表明,DURA始终优于现有方法。我们的发现揭示了物理部署的VLA模型的安全风险,并呼吁加强防御。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作(VLA)模型的对抗攻击问题。现有方法通常依赖于像素空间的扰动,导致攻击效果明显且难以在真实环境中应用。
核心思路:DURA的核心思路是利用扩散模型生成视觉上自然的对抗补丁,通过优化潜在轨迹来引导机器人执行攻击者指定的动作。这种方法避免了传统攻击的伪影问题。
技术框架:DURA的整体架构包括两个主要模块:扩散模型和动作引导模块。扩散模型用于生成对抗补丁,而动作引导模块则根据目标动作优化补丁的生成过程。
关键创新:DURA的关键创新在于其无约束的攻击方式,支持白盒和黑盒设置,尤其是在黑盒设置中仅需受害模型的预测动作。这与现有方法的依赖于白盒访问形成鲜明对比。
关键设计:在设计上,DURA采用了特定的损失函数来平衡对抗性和视觉自然性,同时在扩散模型的训练中使用了多样化的数据集,以提高其生成能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DURA在仿真和真实环境中均显著优于现有攻击方法,成功生成的对抗补丁在视觉上自然且有效引导机器人执行目标动作,提升幅度超过30%。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动化系统和安全防护等。通过揭示VLA模型的安全风险,DURA为未来的防御机制提供了重要参考,促进了对抗鲁棒性研究的发展。
📄 摘要(原文)
Vision-Language-Action (VLA) models have shown strong capabilities in controlling robots across diverse manipulation tasks. However, their adversarial robustness remains largely underexplored, and exploiting this weakness can lead to physical-world harm. Existing attacks on VLA models often rely on pixel-space perturbations or white-box access, resulting in noticeable artifacts and limited deployability in real-world robotic systems. In this work, we propose DURA, a diffusion-based unrestricted robotic attack that generates visually natural adversarial patches for VLA models. DURA supports both white-box and black-box attack settings, where the black-box setting requires only the predicted actions of the victim model. By optimizing along the latent trajectory of a pretrained diffusion model, DURA generates visually natural patches while steering the robot toward attacker-specified target actions. Extensive experiments in both simulation and the real physical world show that DURA consistently outperforms existing methods. Our findings expose a safety risk for physically deployed VLA models and call for stronger defenses.