DF-MoE: Generalizable Deepfake Detection via Multimodal Sparse Mixture-of-Experts

📄 arXiv: 2608.23363v1 📥 PDF

作者: Vlad Hondru, Florinel Alin Croitoru, Iuliana Georgescu, A. Sophia Koepke, Radu Tudor Ionescu

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-08-24

备注: Accepted at BMVC 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出DF-MoE以解决深度伪造检测的泛化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 深度伪造检测 多模态融合 稀疏混合专家 特征提取 模型泛化

📋 核心要点

  1. 现有深度伪造检测方法在不同生成技术之间的泛化能力不足,容易出现过拟合现象。
  2. 本研究提出DF-MoE框架,通过多模态稀疏混合专家网络提取音频和视觉特征,增强检测器的泛化能力。
  3. 实验结果显示,DF-MoE在多个基准数据集上均优于现有最先进方法,提升了检测准确率。

📝 摘要(中文)

音频-视觉深度伪造检测是一个活跃的研究领域,其中一个主要挑战是开发能够在不同深度伪造生成方法之间泛化的检测器。我们推测,通过从可用的音频和视觉模态中提取多个高层次线索,可以减轻过拟合。因此,我们组装了多种预训练模型,以提取编码口型运动、面部解析、面部表情、头部姿态、注视追踪、心率、音频情感和语音活动的特征。我们进一步通过混合专家(MoE)骨干网络整合单模态和多模态线索来检测深度伪造。我们在五个深度伪造检测基准(MAVOS-DD、AVLips、PolyGlotFake、BioDeepAV、FakeAVCeleb)上进行领域内和跨领域实验,比较我们的框架(DF-MoE)与最先进的方法。结果表明,DF-MoE在深度伪造检测中表现优越,超越了所有竞争方法。

🔬 方法详解

问题定义:本论文旨在解决深度伪造检测中检测器泛化能力不足的问题。现有方法往往在特定生成技术上表现良好,但在不同生成方法之间的适应性较差,导致过拟合现象。

核心思路:论文提出通过多模态稀疏混合专家(MoE)网络,结合音频和视觉模态的多种高层次特征,来提高深度伪造检测的泛化能力。通过整合多种预训练模型提取的特征,DF-MoE能够更全面地捕捉伪造内容的线索。

技术框架:DF-MoE的整体架构包括多个预训练模型用于特征提取,随后将这些特征输入到混合专家网络中进行融合和分类。主要模块包括音频特征提取、视觉特征提取和MoE融合模块。

关键创新:DF-MoE的核心创新在于其多模态特征提取和稀疏混合专家架构的结合,这使得模型能够在不同的深度伪造生成方法中保持较高的检测准确率。与传统方法相比,DF-MoE在特征融合和模型泛化能力上具有显著优势。

关键设计:在设计中,采用了多种预训练模型以提取不同类型的特征,如面部表情、头部姿态等。同时,损失函数的设计考虑了多模态特征的融合效果,以优化模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DF-MoE在五个深度伪造检测基准上进行的实验结果显示,其检测准确率显著高于现有最先进方法,具体提升幅度达到XX%(具体数据未知)。该框架在音频和视觉特征的融合上表现出色,展现了良好的泛化能力。

🎯 应用场景

该研究的潜在应用场景包括社交媒体内容审核、视频监控系统以及虚假信息检测等领域。随着深度伪造技术的不断发展,DF-MoE能够为相关行业提供更为可靠的检测工具,帮助维护信息的真实性和安全性。

📄 摘要(原文)

Audio-visual deepfake detection is an actively studied topic, where one of the main challenges is to develop detectors able to generalize across deepfake generation methods. We conjecture that overfitting can be mitigated by extracting multiple high-level cues from the available audio and visual modalities via pre-trained models. We therefore assemble a wide variety of pre-trained models to extract features that encode mouth movements, face parsing, facial expressions, head pose, gaze tracking, heart rate, audio emotion and speech activity. We further integrate both unimodal and multimodal cues via a Mixture-of-Experts (MoE) backbone to detect deepfakes. We perform in-domain and cross-domain experiments on five benchmarks for deepfake detection (MAVOS-DD, AVLips, PolyGlotFake, BioDeepAV, FakeAVCeleb) to compare our framework (DF-MoE) with state-of-the-art methods. Our results indicate that DF-MoE obtains superior deepfake detection results, surpassing all competing methods. We release our code at https://github.com/vladhondru25/DF-MoE.