Universal Concept Disruption for SAM3 Image Segmentation

📄 arXiv: 2608.05983v1 📥 PDF

作者: Hao Wang, Yuxuan Zhang, Wei Yang

分类: cs.CV

发布日期: 2026-08-06


💡 一句话要点

提出通用概念干扰以增强SAM3图像分割的对抗鲁棒性

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 对抗攻击 图像分割 概念干扰 深度学习 计算机视觉 鲁棒性 SAM3 开放词汇

📋 核心要点

  1. 现有的SAM3图像分割方法在对抗攻击下的鲁棒性尚未得到充分研究,存在安全隐患。
  2. 本文提出通用概念干扰(UCD),通过学习图像与名词短语对的扰动,针对SAM3的概念基础系统进行攻击。
  3. 实验结果显示,UCD在多个数据集上显著提升了对抗攻击效果,平均掩码AP和cgF1均大幅下降,验证了方法的有效性。

📝 摘要(中文)

SAM3将可提示分割从几何驱动的掩码预测扩展到开放词汇概念分割,利用文本条件的基础模型判断概念是否存在并分割所有匹配实例。尽管这种存在门控设计提高了概念级预测,但其对抗鲁棒性尚未被探索。本文引入通用概念干扰(UCD),这是首个针对SAM3图像分割的通用跨概念对抗攻击。UCD从(图像,名词短语)对中学习单一的有界图像扰动,并作为一个集成的概念基础系统攻击SAM3。它共同干扰文本条件输入路径,最大化提示共享视觉特征的差异,抑制最终的存在门控概念分数,并通过区域崩溃和干净掩码Dice干扰破坏保留掩码的空间有效性。在SACo-Gold、LVIS、RefCOCO、PhraseCut和OpenImages数据集上,UCD在匹配评估协议下始终优于所有基线,将平均掩码AP从59.43降至18.73,平均cgF1从50.32降至20.49。学习到的扰动也能转移到SAM3.1和SAM3视频推理中,无需重新优化,而提示集成、轻量头微调和时间过滤提供的恢复有限。

🔬 方法详解

问题定义:本文旨在解决SAM3图像分割在对抗攻击下的鲁棒性不足问题。现有方法未能有效应对对抗扰动,导致模型在实际应用中存在安全隐患。

核心思路:论文提出的通用概念干扰(UCD)通过学习单一的有界图像扰动,针对SAM3的概念基础系统进行攻击,干扰文本条件输入路径并最大化视觉特征的差异。

技术框架:UCD的整体架构包括扰动生成模块、文本条件输入干扰模块和概念评分抑制模块。通过这些模块的协同作用,UCD能够有效地破坏模型的决策过程。

关键创新:UCD是首个针对SAM3的通用跨概念对抗攻击,能够同时干扰多个概念的输入,显著提高了对抗攻击的有效性,与现有方法相比具有本质的区别。

关键设计:UCD采用了特定的损失函数来优化扰动生成,并设计了区域崩溃和干净掩码Dice干扰等技术细节,以确保对抗效果的最大化。具体参数设置和网络结构在实验中经过精心调优。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,UCD在多个数据集上均优于所有基线方法,平均掩码AP从59.43降至18.73,平均cgF1从50.32降至20.49,显示出显著的性能提升。学习到的扰动能够无缝转移到SAM3.1和SAM3视频推理中,验证了其广泛适用性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、医疗影像分析和安全监控等场景,能够提高图像分割模型在对抗环境下的鲁棒性,确保其在实际应用中的安全性和可靠性。未来,UCD方法可能会推动对抗机器学习领域的进一步研究,促进更安全的AI系统的开发。

📄 摘要(原文)

SAM3 extends promptable segmentation from geometry-driven mask prediction to open-vocabulary concept segmentation, where a text-conditioned grounding model decides whether a concept is present and segments all matching instances. While this presence-gated design improves concept-level prediction, its adversarial robustness remains unexplored. In this paper, we introduce Universal Concept Disruption (UCD), the first universal cross-concept adversarial attack tailored to SAM3 image segmentation. UCD learns a single bounded image perturbation from (image, noun-phrase) pairs and attacks SAM3 as an integrated concept-grounding system. It jointly disrupts the text-conditioned input path, maximizes divergence in prompt-shared visual features, suppresses the final presence-gated concept scores, and corrupts the spatial validity of retained masks through area collapse and clean-mask Dice disruption. Across SACo-Gold, LVIS, RefCOCO, PhraseCut, and OpenImages datasets, UCD consistently outperforms all baselines under a matched evaluation protocol, reducing average mask AP from 59.43 to 18.73 and average cgF1 from 50.32 to 20.49. The learned perturbation also transfers to SAM3.1 and to SAM3 video inference without re-optimization, while prompt ensembling, lightweight head fine-tuning, and temporal filtering provide limited recovery.