TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment
作者: MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys
分类: cs.CV
发布日期: 2026-07-30
💡 一句话要点
提出几何锚定的舌头合成方法以解决面部重演中的舌头动态问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 面部重演 舌头动态 几何锚定 潜在掩膜扩散 自适应掩膜 虚拟现实 人机交互
📋 核心要点
- 现有的面部重演方法在舌头动态处理上存在不足,导致口腔内部在语音和表情动作中不一致。
- 本文提出了一种基于基础模型的引导流程,生成专用舌头分割模型,解决了无注释的舌头动态转移问题。
- 实验结果显示,本文方法在所有舌头特定指标上性能提升超过两倍,验证了其有效性和优越性。
📝 摘要(中文)
现代面部重演系统在姿态和表情转移方面取得了显著进展,但在舌头动态方面的忽视导致了在语音和表情动作中口腔内部的解剖不一致。本文首次提出了跨身份舌头动态转移的框架,采用基础模型辅助的引导流程,生成专用的舌头分割模型,适用于无注释的野外重演。此外,提出了一种空间约束的潜在掩膜扩散模型,实现了逼真的舌头合成,并通过自适应掩膜扩展实现无缝的口腔边界过渡。大量实验表明,在所有舌头特定指标上,性能提升超过两倍。我们还提出了一种基于视觉语言模型的评估协议,能够大规模复制专家注释,确认了所有消融变体的感知优越性。
🔬 方法详解
问题定义:本文旨在解决现有面部重演系统中舌头动态处理不足的问题,导致口腔内部在语音和表情动作中出现解剖不一致的现象。
核心思路:提出了一种基础模型辅助的引导流程,生成专用的舌头分割模型,能够在无注释的情况下进行舌头动态转移,确保重演的自然性和一致性。
技术框架:整体架构包括舌头分割模型的生成、空间约束的潜在掩膜扩散模型的应用,以及自适应掩膜扩展技术,确保舌头合成的逼真性和口腔边界的无缝过渡。
关键创新:最重要的技术创新在于引入了空间约束的潜在掩膜扩散模型,并结合自适应掩膜扩展,显著提升了舌头合成的质量,与现有方法相比,提供了更高的自然度和一致性。
关键设计:在模型设计中,采用了特定的损失函数以优化舌头合成的质量,并通过调整掩膜扩展参数来实现口腔边界的无缝过渡,确保了合成结果的自然性和真实感。
🖼️ 关键图片
📊 实验亮点
实验结果表明,本文方法在所有舌头特定指标上性能提升超过两倍,相较于所有基线方法均表现出显著的优越性,验证了所提方法的有效性和实用性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在虚拟现实、动画制作和人机交互等领域。通过提高面部重演的自然性和一致性,可以增强用户体验,推动相关技术的进一步发展和应用。
📄 摘要(原文)
Modern face reenactment systems achieve impressive pose and expression transfer using geometry-driven representations. However, they largely ignore tongue dynamics, leading to anatomically inconsistent mouth interiors during speech and expressive motions. We introduce the first framework for cross-identity tongue dynamics transfer in face reenactment. We propose a foundation-model-assisted bootstrapping pipeline that produces a dedicated tongue segmentation model for in-the-wild reenactment without curated annotations. We further introduce a spatially constrained latent masked diffusion model for realistic tongue synthesis, with adaptive mask dilation for seamless mouth boundary transitions. Extensive experiments demonstrate improvements of more than two times over all baselines on every tongue-specific metric. We additionally propose a VLM-based evaluation protocol that replicates expert annotation at scale, confirming perceptual superiority across all ablation variants.