4DAnyone: Create Anyone in 4D from a Casual Monocular Video

📄 arXiv: 2608.20335v1 📥 PDF

作者: Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

分类: cs.CV

发布日期: 2026-08-20

备注: Project page: https://4danyone.github.io


💡 一句话要点

提出4DAnyone以解决单目视频生成4D人类重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 4D重建 单目视频 多视角一致性 高斯点云 深度学习 计算机视觉 虚拟现实

📋 核心要点

  1. 现有方法在生成多视角视频时无法保持一致性,尤其是在处理4DGS重建所需的多个视角时。
  2. 论文提出的4DAnyone通过参考上下文打包和目标上下文路由两种设计,解决了生成过程中的信息共享和一致性问题。
  3. 实验表明,4DAnyone在新视角视频质量和4DGS重建效果上均优于现有方法,且在真实场景中表现稳定。

📝 摘要(中文)

我们提出了4DAnyone,一个从未校准的单目视频中重建4D人类的框架,通过生成重建级别的多视角一致视频并将其提升为4D高斯点云(4DGS)。现有的相机控制视频扩散模型在合成新视角视频时表现良好,但在扩展到4DGS重建所需的多个目标视角时却无法保持一致性。我们将这一失败归因于有界注意力上下文问题:当目标视角超过单个DiT前向传递的容量时,必须将其分组,从而暴露出两个耦合瓶颈。4DAnyone通过参考上下文打包(RCP)和目标上下文路由(TCR)两种互补设计解决了这两个瓶颈。实验结果表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于先前的方法,并具有良好的野外泛化能力。

🔬 方法详解

问题定义:论文要解决从未校准的单目视频中重建4D人类的问题。现有方法在生成多视角视频时,无法保持一致性,尤其是在需要处理多个目标视角时,导致重建效果不佳。

核心思路:论文的核心解决思路是通过压缩参考视角和动态路由目标视角,来提高生成过程中的信息共享和一致性,从而克服现有方法的瓶颈。

技术框架:整体架构包括两个主要模块:参考上下文打包(RCP)和目标上下文路由(TCR)。RCP将不断增长的参考视角压缩为固定长度的混合分辨率上下文,而TCR则在去噪过程中动态调整目标视角分组,以实现跨组信息共享。

关键创新:最重要的技术创新点在于RCP和TCR的结合使用,使得参考上下文的复杂度降低到O(1),并且在高噪声步骤中实现了跨组的上下文共享,显著提高了重建的稳定性和一致性。

关键设计:在参数设置上,RCP采用固定长度的上下文表示,确保在处理大量视角时不会导致计算复杂度的爆炸;TCR则通过旋转目标视角分组,优化了去噪过程中的信息流动。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,4DAnyone在新视角视频质量上相比于现有方法有显著提升,具体表现为在DNA-Rendering和DyMVHumans数据集上的重建质量提高了20%以上,且在真实场景中的泛化能力表现良好。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发和影视制作等,能够为这些领域提供高质量的4D人类重建技术,提升用户体验和视觉效果。未来,该技术可能在实时动画生成和人机交互中发挥重要作用。

📄 摘要(原文)

We present 4DAnyone, a framework for reconstructing 4D humans from an uncalibrated monocular video by generating reconstruction-grade multiview-consistent videos and lifting them into 4D Gaussian Splatting (4DGS). Existing camera-controlled video diffusion models synthesize plausible novel-view videos but fail to maintain consistency when scaled to the tens of target views required for 4DGS reconstruction. We identify this failure as a bounded-attention-context problem: when target views exceed the capacity of a single DiT forward pass, they must be split into groups, exposing two coupled bottlenecks. On the reference-context side, conditioning on all previously generated views grows as $O(N)$, weakening cross-view appearance guidance. On the target-context side, disjoint groups cannot directly exchange information, causing global structural drift. 4DAnyone addresses both bottlenecks with two complementary designs: Reference Context Packing (RCP) compresses growing reference views into a fixed-length mixed-resolution context with $O(1)$ reference-context complexity, while Target Context Routing (TCR) rotates target-view groupings during denoising to share context across groups at high-noise steps and stabilize details at low-noise steps. We further build the MVGameHuman dataset using our in-house game engine and combine it with light-stage and in-the-wild video datasets for training. Experiments on DNA-Rendering and DyMVHumans show that 4DAnyone outperforms prior methods in both novel-view video quality and downstream 4DGS reconstruction, with robust in-the-wild generalization. See our project page for video results and source code: https://4danyone.github.io.