GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

📄 arXiv: 2608.20929v1 📥 PDF

作者: Haozhen Yan, Siyuan Shan, Zijian Yu, Youqi Wang, Yan Hong, Jun Lan, Jianfu Zhang

分类: cs.CV

发布日期: 2026-08-21


💡 一句话要点

提出GAP-SAM以解决AI生成图像编辑定位的OOD性能问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 图像编辑定位 AI生成图像 OOD性能 全局伪影标记 深度学习

📋 核心要点

  1. 现有的AI生成图像编辑定位方法在OOD性能上表现不佳,主要由于像素监督与数据集特定的掩码几何和语义边界的纠缠。
  2. 本文提出GAP-SAM,通过全局伪影标记调节密集解码,旨在改善图像编辑定位的准确性,尤其是在OOD场景下。
  3. 实验结果显示,GAP-SAM在六个数据集上平均达到79.8的Pixel-F1,超越了最强基线方法12.6个百分点,并在各种图像处理条件下表现最佳。

📝 摘要(中文)

AI生成图像编辑定位旨在识别编辑像素,但其在OOD(域外)性能上落后于图像级检测,部分原因在于像素监督将取证证据与数据集特定的掩码几何形状和语义边界纠缠在一起。为了解决这一问题,本文构建了COCO-ControlNet,通过源图像的Canny边缘和深度图对语义和几何进行对齐,从而改善多个定位器的OOD性能。尽管更紧密的Mask-VAE重建对齐(Mask-VAE)表现不佳,但我们发现了“边界粘附”现象,导致细调的分割模型将预测结果固定在语义对象轮廓上,而非真实的编辑边界。基于这些发现,本文提出了GAP-SAM,通过将图像及其冻结的VAE重建编码为全局伪影标记,并在像素解码前通过零门控FiLM注入到SAM3的特征金字塔中,来调节密集解码以保留定位,同时抑制语义边界的捷径。

🔬 方法详解

问题定义:本文旨在解决AI生成图像编辑定位中的OOD性能不足问题,现有方法在处理不同数据集时效果不佳,且存在边界粘附现象。

核心思路:GAP-SAM通过编码图像及其VAE重建为全局伪影标记,利用这一标记调节解码过程,旨在提高定位精度并抑制语义边界的影响。

技术框架:GAP-SAM的整体架构包括图像编码、VAE重建、全局伪影标记生成和特征金字塔注入等主要模块,形成一个高效的图像编辑定位系统。

关键创新:GAP-SAM的核心创新在于全局伪影标记的引入,这一设计使得模型在解码时能够更好地保留真实的编辑边界信息,区别于传统方法的局限性。

关键设计:在模型设计中,采用了零门控FiLM技术来实现特征的动态调节,确保在不同图像处理条件下仍能保持高效的定位性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

GAP-SAM在六个数据集上平均达到79.8的Pixel-F1,超越了最强基线方法12.6个百分点。此外,在JPEG压缩、高斯模糊和图像缩放等多种处理条件下,GAP-SAM均表现最佳,显示出其强大的鲁棒性和适应性。

🎯 应用场景

GAP-SAM的研究成果在图像取证、数字内容鉴别和图像编辑检测等领域具有广泛的应用潜力。随着AI生成技术的不断发展,准确识别和定位图像编辑将对维护数字内容的真实性和可信性产生重要影响。

📄 摘要(原文)

AI-generated image manipulation localization identifies edited pixels, but its OOD performance lags behind image-level detection partly because pixel supervision entangles forensic evidence with dataset-specific mask geometry and semantic boundaries. Extending image-level distribution alignment to localization, we construct COCO-ControlNet with source-image Canny edges and depth maps to align semantics and geometry, improving OOD performance across multiple localizers. Yet tighter Mask-VAE Reconstruction Alignment (Mask-VAE) underperforms COCO-ControlNet, showing that VAE reconstruction artifacts transfer poorly to local diffusion-inpainting artifacts. We also identify \emph{boundary adhesion}, where fine-tuned segmentation models snap predictions to semantic object contours rather than true manipulation boundaries. These findings motivate GAP-SAM, which encodes an image and its frozen VAE reconstruction into a global artifact token and injects it into SAM3's feature pyramid via zero-gated FiLM before pixel decoding. Without prescribing a spatial region, this token modulates dense decoding to preserve localization while suppressing semantic-boundary shortcuts. Across six datasets, GAP-SAM averages 79.8 Pixel-F1, outperforming the strongest prior method by 12.6 points. It also performs best at every tested severity of JPEG compression, Gaussian blur, and resizing.