LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
作者: Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen
分类: cs.CV
发布日期: 2026-07-28
备注: Accepted at ACM Multimedia 2026 (ACM MM 2026)
💡 一句话要点
提出LaP-Forensics以解决深度伪造检测中的视觉伪影问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 深度伪造检测 多模态推理 图像重建 取证证据 生成模型
📋 核心要点
- 现有的深度伪造检测方法往往依赖于表面视觉特征,难以应对生成模型带来的高质量伪造图像。
- LaP-Forensics通过结合RGB图像与重建基础的取证证据,提出了一种多模态推理框架,增强了伪造检测的鲁棒性。
- 实验结果显示,该方法在多个基准数据集上表现优异,特别是在伪影定位和跨生成器检测方面具有显著提升。
📝 摘要(中文)
近年来,生成模型能够生成几乎没有明显视觉伪影的图像,这削弱了仅依赖表面外观的检测器和解释能力。本文提出了LaP-Forensics,一个多模态框架,通过重建基础的取证证据增强RGB语义。该框架利用固定的Stable Diffusion DDIM反演重建模型提供重建参考,其残差图用于测量与该参考的局部兼容性。独立的投影器对RGB图像和残差图进行编码,随后通过结构化的Where-What-Why模型预测文本分析和伪影掩码。经过监督微调后,采用群体相对策略优化(GRPO),其奖励结合了掩码重叠、输出结构和证据参考项。实验表明,该方法在UniversalFakeDetect上实现了跨生成器检测,并在官方SynthScars基准上实现了竞争性的伪影定位。
🔬 方法详解
问题定义:本文旨在解决深度伪造检测中由于生成模型高质量输出而导致的检测效果下降问题。现有方法往往仅依赖表面特征,难以有效识别伪造内容。
核心思路:LaP-Forensics的核心思路是通过引入重建基础的取证证据,结合RGB图像的语义信息,增强模型对伪造图像的理解和检测能力。
技术框架:该框架包括多个主要模块:首先,使用固定的Stable Diffusion DDIM模型进行反演重建,生成重建参考;其次,计算残差图以评估局部兼容性;然后,独立投影器对RGB图像和残差图进行编码;最后,结构化的Where-What-Why模型进行文本分析和伪影掩码预测。
关键创新:最重要的创新在于引入了残差流作为额外的特征来源,增强了模型对伪造图像的检测能力,与传统方法相比,提供了更为全面的分析视角。
关键设计:在设计中,采用了监督微调和群体相对策略优化(GRPO)作为训练策略,奖励函数结合了掩码重叠、输出结构和证据参考项,以促进模型对一致性图的关注。
🖼️ 关键图片
📊 实验亮点
实验结果表明,LaP-Forensics在UniversalFakeDetect数据集上实现了跨生成器检测,表现优于现有方法;在SynthScars基准上,伪影定位的精度显著提高,验证了该方法的有效性和实用性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其是在社交媒体、新闻传播和法律取证等领域。通过提高深度伪造检测的准确性,能够有效防止虚假信息的传播,维护信息的真实性和可靠性。未来,该方法还可以扩展到其他类型的伪造内容检测中。
📄 摘要(原文)
Recent generative models can produce images with few obvious visual artifacts, weakening detectors and explanations that rely only on surface appearance. We present LaP-Forensics, a multimodal framework that augments RGB semantics with reconstruction-based forensic evidence. A frozen Stable Diffusion DDIM inversion-reconstruction model provides a fixed reconstruction reference, and its residual map measures local compatibility with that reference. Independent projectors encode the RGB image and residual map before a structured Where-What-Why model predicts a textual analysis and an artifact mask.Supervised fine-tuning is followed by Group Relative Policy Optimization (GRPO), whose reward combines mask overlap with output-structure and evidence-reference terms. These text-side terms encourage the model to refer to the consistency map but do not constitute a verifier of free-form textual truth. A separate image-level head fuses RGB and DDIM-residual class features. Experiments show cross-generator detection on UniversalFakeDetect and competitive artifact localization on the official SynthScars benchmark. Controlled cue-construction, inversion-horizon, component, reward-term, and counterfactual analyses support the utility of the residual stream under the evaluated settings, while free-form textual faithfulness and reliability under post-processing remain open limitations.