Split and Drive: Dual-Axis Disentanglement for Real-Time Gaussian Head Avatars

📄 arXiv: 2607.28032v1 📥 PDF

作者: MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

分类: cs.CV

发布日期: 2026-07-30


💡 一句话要点

提出SpiD框架以解决单图像生成头部头像问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 高斯头像 数字人类合成 实时渲染 面部动画 计算机视觉 机器学习

📋 核心要点

  1. 现有的3D高斯点云方法依赖外部跟踪,导致推理延迟未被考虑,影响实时性。
  2. SpiD框架通过内部化每帧驱动和特征解耦,解决了外部依赖和面部区域纠缠的问题。
  3. 实验结果显示,SpiD在推理速度上优于所有对比方法,同时在表现力和渲染保真度上也有显著提升。

📝 摘要(中文)

从单一图像创建可动画的真实感头部头像仍然是数字人类合成中的一项基本挑战。尽管最近的3D高斯点云方法取得了良好效果,但它们依赖于外部跟踪管道,且其延迟未计入推理测量。此外,这些方法采用统一表示,导致几何上不同的面部区域相互纠缠,限制了表现力和渲染保真度。我们提出了SpiD(Split and Drive),一个基于两个解耦轴的单图像高斯头部头像框架。计算轴内部化每帧驱动,消除了推理时对外部跟踪的依赖。特征轴将头像分解为三个专门的高斯分支,每个分支建模一个几何上不同的面部领域。大量实验表明,SpiD在与最先进方法的比较中表现出色,同时在包含完整驱动管道的情况下,在单个GPU上实现了最快的推理速度。

🔬 方法详解

问题定义:本论文旨在解决从单一图像生成可动画的高质量头部头像的问题。现有方法依赖外部跟踪管道,导致推理延迟未被考虑,且统一表示限制了面部区域的表现力和渲染质量。

核心思路:论文提出的SpiD框架通过两个解耦轴来解决上述问题。计算轴内部化每帧驱动,消除了对外部跟踪的依赖;特征轴将头像分解为三个高斯分支,分别建模几何上不同的面部区域。

技术框架:SpiD框架包括两个主要模块:计算轴和特征轴。计算轴负责处理每帧的驱动输入,特征轴则将头像分解为三个独立的高斯分支,确保每个分支专注于特定的面部几何特征。

关键创新:SpiD的核心创新在于通过解耦面部特征和驱动输入,显著提高了头像生成的表现力和渲染速度。这一设计与现有方法的统一表示形成鲜明对比,允许更灵活的面部动画生成。

关键设计:在技术细节上,SpiD采用了特定的损失函数来优化每个高斯分支的表现,同时在网络结构上进行了优化,以确保在单个GPU上实现快速推理。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SpiD在与最先进方法的比较中表现出色,推理速度在所有对比方法中最快,且在表现力和渲染保真度上均有显著提升,展示了其在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发和社交媒体等,能够为用户提供更加真实和个性化的虚拟形象。未来,SpiD框架可能在数字人类合成和人机交互中发挥重要作用,推动相关技术的进步。

📄 摘要(原文)

Creating photorealistic animatable head avatars from a single image remains a fundamental challenge in digital human synthesis. While recent 3D Gaussian Splatting methods have achieved promising results, they rely on external tracking pipelines whose latency is excluded from inference measurements. Furthermore, they adopt unified representations that entangle geometrically distinct facial regions, limiting both expressiveness and rendering fidelity. We propose SpiD (Split and Drive), a single-image Gaussian head avatar framework built on two disentanglement axes. The compute axis internalizes per-frame driving, eliminating external tracking dependency at inference. The feature axis decomposes the avatar into three specialized Gaussian branches, each modeling a geometrically distinct facial domain. Extensive experiments demonstrate consistently strong performance against state-of-the-art methods while achieving the fastest inference speed among all compared methods on a single GPU with the complete driving pipeline included.