Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
作者: Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan
分类: cs.CV
发布日期: 2026-08-21
备注: ECCV 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出MVAP-G以解决VGGT模型的安全漏洞问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗攻击 3D重建 视觉几何 深度学习 安全性评估 多视角图像 模型脆弱性
📋 核心要点
- 现有方法在对抗攻击中存在高昂的优化成本和效果不佳的问题,尤其是在3D重建模型VGGT上。
- 本文提出MVAP-G,通过设计跨视角对抗对齐机制,在单次前馈中生成一致的多视角对抗扰动。
- 实验结果显示,MVAP-G显著降低了VGGT的性能,展示了其在无需迭代优化情况下的有效性。
📝 摘要(中文)
视觉几何基础变换器(VGGT)实现了从多视角图像进行统一的前馈3D重建。然而,部署这种高性能模型可能会暴露出严重的安全漏洞。传统的对抗扰动需要针对每个场景进行昂贵的优化,而通用对抗扰动(UAP)依赖于单一静态模式,无法有效攻击VGGT。为了解决这些局限性,本文提出了MVAP-G,一种多视角对抗扰动生成器,能够在单次前馈过程中生成在多个视角间一致且不可察觉的扰动。实验表明,MVAP-G在推理过程中显著降低了VGGT的性能,且无需迭代优化。这项工作开创了针对3D基础模型的多视角对抗攻击,揭示了严重的安全漏洞,并强调了对稳健3D视觉系统的迫切需求。
🔬 方法详解
问题定义:本文旨在解决VGGT模型在面对对抗攻击时的安全漏洞。现有的对抗攻击方法如UAP无法有效针对VGGT,且传统方法需要针对每个场景进行昂贵的优化,效率低下。
核心思路:MVAP-G的核心思路是设计一种多视角对抗扰动生成器,能够在单次前馈过程中生成一致且不可察觉的扰动,从而有效攻击VGGT模型。通过跨视角对抗对齐机制,确保在不同场景下的扰动一致性。
技术框架:MVAP-G的整体架构包括输入多视角图像、通过对抗对齐机制生成扰动、以及将扰动应用于VGGT模型的输出。主要模块包括扰动生成模块和对抗对齐模块。
关键创新:MVAP-G的最大创新在于其能够在单次前馈中生成一致的多视角扰动,这与传统方法的逐场景优化形成鲜明对比,显著提高了攻击效率。
关键设计:在设计中,MVAP-G采用了特定的损失函数来优化扰动的一致性,并通过网络结构的调整确保了扰动的不可察觉性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,MVAP-G在攻击VGGT模型时,性能显著下降,攻击成功率高达XX%(具体数据待补充),且无需进行迭代优化。这一结果展示了MVAP-G在多视角对抗攻击中的有效性,揭示了VGGT模型的严重安全隐患。
🎯 应用场景
该研究的潜在应用领域包括3D视觉系统的安全性评估、对抗样本生成以及增强现实等。通过揭示VGGT模型的安全漏洞,研究者可以更好地设计稳健的3D视觉系统,提升其在实际应用中的安全性和可靠性。
📄 摘要(原文)
The Visual Geometry Grounded Transformer (VGGT) enables unified feed-forward 3D reconstruction from multi-view images. However, deploying such a high-performance model may expose critical security vulnerabilities. Traditional adversarial perturbations require costly per-scene optimization, while Universal Adversarial Perturbations (UAPs) rely on a single static pattern and fail to effectively attack VGGT. To address these limitations, we propose \textbf{MVAP-G}, a multi-view adversarial perturbation generator that produces imperceptible consistent perturbations across multiple views in a single feed-forward pass. To ensure perturbation consistency across diverse scenes, we design a cross-view adversarial alignment mechanism to process multi-view images. Experiments demonstrate that MVAP-G significantly degrades VGGT performance without iterative optimization during inference. This work pioneers multi-view adversarial attacks on 3D foundation models, uncovering severe vulnerabilities and underscoring the urgent need for robust 3D vision systems. The code is available at https://github.com/qsong2001/mvap-g.