DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

📄 arXiv: 2608.20759v1 📥 PDF

作者: Jiakun Li, Li Fang, Hao Zhu, Fei Hu, Long Ye, Yuan Zhang, Jinyao Yan

分类: cs.CV

发布日期: 2026-08-21

备注: ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出DiGS-Avatar以解决单图像3D人类重建问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D重建 扩散模型 UV潜在补全 教师-学生框架 视觉保真度 零-shot泛化 动画制作

📋 核心要点

  1. 现有的单图像3D重建方法在纹理和几何一致性上存在明显不足,导致生成结果质量不高。
  2. DiGS-Avatar通过将3D重建任务转化为基于扩散的UV潜在补全任务,确保了3D一致性,并引入教师-学生框架以提高重建精度。
  3. 实验结果表明,DiGS-Avatar在视觉保真度和零-shot泛化能力上表现优异,重建速度达到0.71秒,具有较强的实用性。

📝 摘要(中文)

单图像3D人类重建常常面临纹理过于平滑和几何不一致的问题。尽管扩散模型提高了生成质量,但其依赖于多视图合成的3D重建过程计算开销大且易出现视图不一致。本文提出DiGS-Avatar,将该任务重新构建为高效的基于扩散的UV潜在补全任务,确保3D一致性。通过教师-学生框架,利用多视图教师提供几何对齐的伪真实潜在数据来监督单视图扩散学生。我们的方法在保持空间完整性的同时,注入高级语义特征,准确恢复细致的纹理细节。经过广泛实验,DiGS-Avatar在视觉保真度和零-shot泛化方面达到了最先进的水平,同时仅需0.71秒即可重建一个完全可动画的3D头像。

🔬 方法详解

问题定义:本文旨在解决单图像3D人类重建中的纹理过于平滑和几何不一致的问题。现有方法依赖于多视图合成,计算开销大且容易出现视图不一致。

核心思路:DiGS-Avatar将重建任务重新定义为高效的基于扩散的UV潜在补全任务,通过设计确保3D一致性。引入教师-学生框架,使多视图教师提供几何对齐的伪真实潜在数据来指导单视图扩散学生。

技术框架:整体架构包括教师模型和学生模型。教师模型负责生成几何对齐的潜在表示,而学生模型则通过扩散过程从单视图中学习并重建3D结构。

关键创新:最重要的创新在于将扩散模型应用于UV潜在补全任务,确保了重建结果的3D一致性,同时有效恢复了细致的纹理细节。与传统方法相比,DiGS-Avatar在计算效率和生成质量上有显著提升。

关键设计:在模型设计中,采用了特定的损失函数以平衡几何一致性和纹理细节的恢复。此外,网络结构经过优化,以提高潜在表示的质量和重建速度。具体参数设置和网络架构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DiGS-Avatar在视觉保真度和零-shot泛化能力上达到了最先进的水平,重建速度为0.71秒,显著优于现有方法。实验结果显示,该方法在多个基准测试中表现出色,具有较强的竞争力。

🎯 应用场景

DiGS-Avatar在虚拟现实、游戏开发和动画制作等领域具有广泛的应用潜力。其高效的3D重建能力能够为用户提供更加真实的虚拟形象,提升交互体验。此外,该技术还可用于医学影像分析和人机交互等领域,具有重要的实际价值和未来影响。

📄 摘要(原文)

Single-image 3D human reconstruction often suffers from over-smoothed textures and geometric inconsistencies. While diffusion models improve generative quality, their reliance on multi-view synthesis prior to 3D reconstruction is computationally expensive and prone to view inconsistency. We propose DiGS-Avatar, which reformulates this task as an efficient, diffusion-based UV-latent completion task, ensuring 3D consistency by design. To capture accurate spatial structure, we introduce a teacher-student framework where a multi-view teacher provides geometrically aligned pseudo-ground-truth latents to supervise a single-view diffusion student. Treating this inferred latent as a robust structural skeleton, our method injects high-level semantic features to accurately recover fine textural details without disrupting spatial integrity. The refined representation is then decoded into 3D Gaussian primitives. Extensive experiments demonstrate that DiGS-Avatar achieves state-of-the-art or highly competitive visual fidelity and zero-shot generalization, while reconstructing a fully animatable 3D avatar in just 0.71 seconds. Code is available at https://github.com/KLMAV-CUC/DiGS-Avatar.