ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

📄 arXiv: 2608.01793v1 📥 PDF

作者: Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

分类: cs.LG

发布日期: 2026-08-03

备注: Accepted at the European Conference on Computer Vision (ECCV) 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出ReFP-AD以解决高维异常检测中的不稳定性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 异常检测 能量模型 几何重参数化 高维数据 马尔可夫链蒙特卡洛 深度学习 图像处理

📋 核心要点

  1. 现有方法在高维token空间中进行异常检测时,训练不稳定且难以进行有效的密度估计。
  2. 论文提出ReFP-AD,通过几何重参数化和修正流将高维嵌入映射到良好条件的潜在空间,从而提高了训练的稳定性。
  3. 在严格的统一协议下,ReFP-AD在多个数据集上显著提升了异常检测性能,尤其在图像AUROC上提高了10.8%。

📝 摘要(中文)

统一异常检测需要在没有异常样本的情况下对高度异质的正常数据进行建模。尽管像DINOv2这样的基础模型提供了丰富的token表示,但在显式密度估计中利用这些空间仍然具有挑战性。能量模型(EBMs)提供了一种原则性的方法,但在高维token空间中的训练不稳定,导致有限步长的马尔可夫链蒙特卡洛(MCMC)采样效果下降。本文提出ReFP-AD(Rectified Flow Preconditioning for Anomaly Detection),通过最优传输耦合的修正流学习几何重参数化,将高维嵌入映射到良好条件的潜在空间,从而实现稳定的对比发散。实验结果表明,ReFP-AD在MVTec-AD和VisA数据集上分别达到了98.6%/97.9%和97.3%/99.0%的图像/像素AUROC,超越了之前的统一EBM基线。

🔬 方法详解

问题定义:本文旨在解决在高维token空间中进行异常检测时的训练不稳定性和密度估计困难。现有的能量模型在处理这些问题时表现不佳,尤其是在有限步长的MCMC采样中。

核心思路:ReFP-AD的核心思想是通过几何重参数化,将高维嵌入映射到一个良好条件的潜在空间,以此来改善训练的稳定性和采样效率。通过最优传输耦合的修正流,模型能够有效地进行对比发散。

技术框架:该方法的整体架构包括几个主要模块:首先是高维嵌入的几何重参数化,其次是通过修正流实现的潜在空间映射,最后是基于学习的能量景观计算异常分数。

关键创新:ReFP-AD的主要创新在于引入了几何重参数化的概念,这一设计使得模型能够在高维空间中保持稳定性,显著提高了异常检测的准确性。与传统方法相比,ReFP-AD在处理高维数据时展现出更好的性能。

关键设计:在模型设计中,采用了预条件的随机梯度Langevin动力学(SGLD)作为训练策略,并通过梯度范数来计算异常分数。具体的参数设置和损失函数设计在实验中经过了细致的调优,以确保模型的最佳表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在MVTec-AD和VisA数据集上,ReFP-AD分别达到了98.6%/97.9%和97.3%/99.0%的图像/像素AUROC,超越了之前的统一EBM基线,提升幅度最高达10.8%。这些结果表明该方法在异常检测任务中的显著优势。

🎯 应用场景

该研究的潜在应用场景包括工业缺陷检测、网络安全监测和医疗图像分析等领域。通过提高异常检测的准确性,ReFP-AD能够帮助相关行业更有效地识别潜在问题,降低损失并提升安全性。未来,该方法有望在更多复杂数据环境中得到应用。

📄 摘要(原文)

Unified anomaly detection requires modeling highly heterogeneous normal data without access to anomalous samples. While foundation models like DINOv2 provide rich token representations, leveraging these spaces for explicit density estimation remains challenging. Energy-Based Models (EBMs) offer a principled formulation, but their training in high-dimensional token spaces is unstable due to anisotropy and strong cross-dimensional correlations, which degrades finite-step Markov Chain Monte Carlo (MCMC) sampling. We identify this instability as fundamentally geometric and introduce ReFP-AD (Rectified Flow Preconditioning for Anomaly Detection), which learns a geometric reparameterization that maps high-dimensional embeddings into a well-conditioned latent space via an optimal transport (OT)-coupled rectified flow. This preconditioning enables stable persistent contrastive divergence with preconditioned Stochastic Gradient Langevin Dynamics (SGLD) in full-dimensional token spaces. Anomaly scores are then derived from the learned energy landscape using gradient norms. Under a strict unified protocol on the MVTec-AD and VisA datasets, ReFP-AD achieves 98.6%/97.9% Image/Pixel AUROC on MVTec-AD and 97.3%/99.0% on VisA, outperforming prior unified EBM baselines by up to +10.8% in Image AUROC. Ablation experiments demonstrate that geometric reparameterization is critical for finite-step MCMC and accurate anomaly localization in high-dimensional token spaces. Code is available at https://github.com/CLendering/ReFP-AD