Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow
作者: Jiangling Zhang, Shuxuan Gao, Zeyu Chen, Yichao Liu, Yu Zhou
分类: cs.CV, cs.AI
发布日期: 2026-08-03
备注: Accepted to ACM MM 2026
💡 一句话要点
提出生成检测器以解决开放集视觉文本取证问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视觉文本取证 生成检测器 开放集攻击 稀疏约束修正流 自监督学习
📋 核心要点
- 现有的取证检测器在面对复杂的视觉文本操控时表现不佳,尤其是对未见的开放集攻击泛化能力不足。
- 本文提出了一种生成检测器,通过估计局部恢复成本来定位篡改,而非依赖于特定伪造模式的决策边界。
- 实验结果表明,所提方法在多个基准测试中表现优异,尤其在F1和IoU指标上显著超越现有方法。
📝 摘要(中文)
快速发展的生成式人工智能使得复杂的视觉文本操控越来越难以被现有取证检测器识别。现有的判别模型往往过拟合特定的伪造模式,限制了其对未见开放集攻击的泛化能力。为了解决这一挑战,本文提出了一种生成检测器,通过估计将查询图像与真实视觉文本统计数据对齐所需的局部恢复成本来定位篡改,而不是学习特定伪造的决策边界。具体而言,我们引入了稀疏约束修正流(SC-RF),这是针对空间稀疏异常定位的检测器导向的流匹配适应。通过自监督伪影注入,我们进一步缓解了数据稀缺问题,并使用像素空间的Forensic-DiT保留高频取证痕迹。大量实验表明,我们的方法在三个基准上实现了最先进的性能,F1和IoU分别超越了亚军3.2和4.8个百分点。尤其是,所提出的检测器在具有挑战性的未见文本编辑模式上展示了强大的零-shot性能。
🔬 方法详解
问题定义:本文旨在解决现有视觉文本取证检测器在面对复杂伪造时的泛化能力不足问题,尤其是对开放集攻击的识别能力。现有方法往往依赖于特定的伪造模式,导致其在新型攻击面前失效。
核心思路:论文提出了一种生成检测器,核心思想是通过估计将查询图像与真实视觉文本统计数据对齐所需的局部恢复成本来进行篡改定位。这种方法避免了对特定伪造模式的依赖,从而提高了对未知攻击的适应性。
技术框架:整体架构包括稀疏约束修正流(SC-RF)模块,该模块用于空间稀疏异常定位。此外,采用自监督伪影注入技术来缓解数据稀缺问题,并使用像素空间的Forensic-DiT来保留高频取证痕迹。
关键创新:最重要的技术创新在于引入了SC-RF,这一方法在处理稀疏异常时表现出色,与现有方法相比,能够更有效地进行开放集检测。
关键设计:在设计中,采用了特定的损失函数来优化局部恢复成本的估计,并在网络结构上进行了调整,以适应稀疏数据的处理需求。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在F1和IoU指标上分别超越了亚军3.2和4.8个百分点,展现了在多个基准测试中的最先进性能。尤其是在面对未见文本编辑模式时,检测器表现出强大的零-shot能力。
🎯 应用场景
该研究的潜在应用领域包括数字取证、社交媒体内容审核以及新闻真实性验证等。随着生成式人工智能技术的发展,能够有效识别和定位文本篡改将对维护信息的真实性和安全性产生重要影响。
📄 摘要(原文)
Rapidly evolving Generative AI enables sophisticated visual text manipulations that increasingly evade current forensic detectors. Existing discriminative models often overfit specific forgery patterns, limiting their generalization to unseen, open-set attacks. To address this challenge, we propose a generative detector that localizes tampering by estimating the local restoration cost required to align a query image with authentic visual-text statistics, rather than by learning forgery-specific decision boundaries. Specifically, we introduce Sparse-Constraint Rectified Flow (SC-RF), a detector-oriented adaptation of Flow Matching for spatially sparse anomaly localization. We further mitigate data scarcity via self-supervised Artifact Injection and preserve high-frequency forensic traces using a pixel-space Forensic-DiT. Extensive experiments on three benchmarks show that our method achieves state-of-the-art performance, surpassing the runner-up by 3.2 and 4.8 percentage points in F1 and IoU, respectively. In particular, the proposed detector demonstrates strong zero-shot performance on challenging unseen text editing patterns. We further provide an auxiliary stress-test analysis showing that local harmonization produced by our model can weaken the statistical cues relied upon by existing detectors, offering a complementary vulnerability-analysis perspective.