4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans
作者: Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li
分类: cs.CV
发布日期: 2026-07-30
备注: 14 pages
💡 一句话要点
提出4DHumanDiff以解决360度动态人类生成问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 动态人类生成 4D高斯点云 文本到图像生成 扩散模型 计算机视觉 虚拟现实 动画制作
📋 核心要点
- 现有方法在生成360度动态人类时,通常需要先合成视频,导致高成本和几何体不完整。
- 4DHumanDiff通过直接从文本生成4D高斯点云,避免了视频预生成和逐场景重建,提升了生成效率。
- 实验结果显示,该方法在一分钟内生成动态人类,时间和视角一致性显著提高,推理时间减少超过10倍。
📝 摘要(中文)
生成高质量的360度动态人类资产从文本提示中是一个具有挑战性的任务。现有方法通常首先合成单目或多视角视频,然后再拟合4D表示,这种方法成本高且常导致几何体不完整或视图不一致的渲染。我们提出了4DHumanDiff,这是一种扩散框架,能够直接从文本提示生成以4D高斯点云(4DGS)表示的动态人类。通过端到端建模结构化的4D表示空间,4DHumanDiff避免了视频预生成和逐场景重建,更适合生成视图一致和时间连贯的资产。该模型使用具有时间注意力的3D U-Net骨干网络进行运动感知生成。我们还构建了一个大规模的文本到4DGS数据集,包含60,000对高质量样本,并引入了2D正则化和无训练的4D插值,以提高渲染质量和运动平滑性。实验表明,4DHumanDiff在一分钟内生成一致的360度动态人类,获得更好的时间和多视角一致性,并将推理时间减少超过10倍。
🔬 方法详解
问题定义:本论文旨在解决从文本提示生成360度动态人类资产的挑战。现有方法通常依赖于视频合成,导致高成本和视图不一致的问题。
核心思路:论文提出的4DHumanDiff框架直接生成4D高斯点云(4DGS),通过端到端建模结构化的4D表示空间,避免了视频预生成的复杂性,从而提高了生成的效率和一致性。
技术框架:该方法基于3D U-Net骨干网络,结合时间注意力机制,能够有效捕捉动态人类的运动特征。整体流程包括文本输入、4DGS生成和渲染输出。
关键创新:4DHumanDiff的核心创新在于其直接生成4D表示的能力,与现有方法相比,省去了视频合成和逐场景重建的步骤,显著提升了生成的时间一致性和视图一致性。
关键设计:模型采用了2D正则化和无训练的4D插值技术,以提高渲染质量和运动的平滑性。此外,时间注意力机制的引入使得模型在运动感知生成方面表现更佳。
🖼️ 关键图片
📊 实验亮点
实验结果表明,4DHumanDiff在一分钟内生成360度动态人类,显著提高了时间和多视角一致性,推理时间减少超过10倍,相较于传统方法具有显著优势。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、游戏开发、影视制作等,能够为动态人类角色的生成提供高效且一致的解决方案。未来,该技术可能推动人机交互、动画制作等领域的进一步发展,提升用户体验和创作效率。
📄 摘要(原文)
Generating high-quality 360-degree dynamic human assets from text prompts is challenging. Existing methods usually synthesize monocular or multi-view videos first and then fit a 4D representation, which is expensive and often causes incomplete geometry or view-inconsistent renderings. We present 4DHumanDiff, a diffusion framework that directly generates dynamic humans represented by 4D Gaussian Splatting (4DGS) from text prompts. By modeling the structured 4D representation space end-to-end, 4DHumanDiff avoids video pre-generation and per-scene reconstruction, making it better suited for view-consistent and temporally coherent asset generation. The model uses a 3D U-Net backbone with temporal attention for motion-aware generation. We further construct a large-scale text-to-4DGS dataset with 60,000 high-quality pairs, and introduce 2D regularization and training-free 4D interpolation to improve rendering quality and motion smoothness. Experiments show that 4DHumanDiff generates consistent 360-degree dynamic humans within one minute, achieves better temporal and multi-view consistency, and reduces inference time by more than 10x.