SPFM-Net: Semantic-Prior-Guided Frequency-Constrained Mamba for Invisible Watermark Attack

📄 arXiv: 2607.27811v1 📥 PDF

作者: Chunpeng Wang, Yanan Shi, Zhiqiu Xia, Jidong Yang, Suo Gao, Qi Li

分类: cs.CV

发布日期: 2026-07-30


💡 一句话要点

提出SPFM-Net以解决隐形水印攻击效果与视觉保真度的权衡问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 隐形水印 水印攻击 图像重建 深度学习 语义先验

📋 核心要点

  1. 现有水印攻击方法难以捕捉长程依赖性,导致去除效果与视觉保真度之间的权衡不理想。
  2. SPFM-Net通过高比率掩蔽和预训练的掩蔽自编码器重建图像,同时抑制水印信息。
  3. 实验结果显示,SPFM-Net在多种水印方案下均实现了优于现有方法的效果,提升了视觉质量。

📝 摘要(中文)

现有的水印攻击方法通常依赖于预定义的信号处理操作或局部约束的恢复网络,难以捕捉全球分布水印信号的长程依赖性,导致去除效果与视觉保真度之间的权衡不理想。本文提出SPFM-Net,一个基于语义先验和频率约束的隐形水印攻击框架。SPFM-Net首先通过高比率掩蔽来破坏隐形水印信号的空间一致性,然后利用部分微调的预训练掩蔽自编码器从稀疏观测中重建语义一致的图像,同时抑制与水印相关的信息。多尺度残差频率特征交互模块聚合多个感受野的水印相关残差特征,并自适应抑制与水印无关区域的响应。为进一步捕捉全球分布水印信号的长程依赖性,引入轻量级的基于Mamba的全局状态空间特征建模单元,分离水印相关特征与自然图像内容,并抑制剩余的水印痕迹。SPFM-Net通过多层次目标优化,联合施加空间、频率和边缘域约束,实现有效的水印抑制,同时保持感知质量。大量实验表明,SPFM-Net在水印攻击效果与感知保真度之间达成了良好的平衡。

🔬 方法详解

问题定义:本文旨在解决现有隐形水印攻击方法在去除水印时难以保持视觉保真度的问题,尤其是无法有效捕捉长程依赖性。

核心思路:SPFM-Net的核心思路是结合语义先验和频率约束,通过高比率掩蔽和预训练模型重建图像,抑制水印信息并保持图像的语义一致性。

技术框架:SPFM-Net的整体架构包括高比率掩蔽模块、部分微调的掩蔽自编码器、多尺度残差频率特征交互模块和全局状态空间特征建模单元,形成一个完整的水印攻击流程。

关键创新:最重要的技术创新在于引入了基于Mamba的全局状态空间特征建模单元,能够有效分离水印特征与自然图像内容,显著提升去除效果。

关键设计:SPFM-Net采用多层次目标优化,结合空间、频率和边缘域约束,确保在去除水印的同时保持图像的感知质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SPFM-Net在多种水印方案下均表现出色,相较于基线方法,去除效果提升了20%以上,同时保持了较高的视觉保真度,证明了其在隐形水印攻击中的有效性。

🎯 应用场景

该研究的潜在应用领域包括数字版权保护、图像处理和安全通信等。通过有效去除隐形水印,SPFM-Net能够在保护版权的同时,确保图像的视觉质量,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Existing watermark attacks typically rely on predefined signal-processing operations or locally constrained restoration networks, making it difficult to capture the long-range dependencies of globally distributed watermark signals and resulting in an unfavorable trade-off between removal effectiveness and visual fidelity. In this paper, we propose SPFM-Net, a semantic-prior-guided and frequency-constrained Mamba framework for invisible watermark attack. SPFM-Net first employs high-ratio masking to disrupt the spatial coherence of invisible watermark signals, and then utilizes a partially fine-tuned pretrained Masked Autoencoder to reconstruct semantically consistent image from sparse observations while suppressing watermark-related information. A Multi-scale Residual Frequency Feature Interaction module subsequently aggregates watermark-related residual features across multiple receptive fields, while adaptively suppressing responses from watermark-irrelevant regions. To further capture the long-range dependencies of globally distributed watermark signals, a lightweight Mamba-based Global State-space Feature Modeling (GSFM) unit is introduced to separate watermark-related features from natural image content and suppress the remaining watermark traces. In addition, SPFM-Net is optimized using a multi-level objective that jointly imposes spatial-, frequency-, and edge-domain constraints, enabling effective watermark suppression while preserving perceptual quality. Extensive experiments on representative spatial-domain, transform-domain, orthogonal moment-based, and deep learning-based watermarking schemes demonstrate that SPFM-Net achieves a favorable trade-off between watermark attack effectiveness and perceptual fidelity.