Amortized Anchor Refinement for Deployable Continuous-Time 4D Gaussian Reconstruction

📄 arXiv: 2608.30218v1 📥 PDF

作者: Jingong Chen, Qingwen Zhang, Sanghyeon Jun, Chulwoo Pack, Kyle Gao, Kwanghee Won

分类: cs.CV

发布日期: 2026-08-31

备注: 18 pages, 13 figures


💡 一句话要点

提出可部署的连续时间4D高斯重建方法以解决XR头戴设备计算限制问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 4D重建 高斯表示 虚拟现实 增强现实 计算机视觉 持久同调 优化算法

📋 核心要点

  1. 现有的连续时间4D重建方法在XR头戴设备上面临计算资源不足的问题,导致无法有效部署。
  2. 本文提出的摊销锚点细化方法通过冻结主干网络进行初始高斯表示预测,并在固定预算下进行短期优化,解决了细节恢复问题。
  3. 在Stage-Capture基准测试中,该方法实现了24.31±2.22dB的重建性能,并成功在消费级GPU上进行重建和播放。

📝 摘要(中文)

连续时间4D重建在独立的XR头戴设备上仍然不够实用。逐场景优化需要过高的计算资源,而较低的预算则导致重建崩溃而非逐渐降级。尽管前馈预测速度较快,但在恢复场景特定细节方面存在困难。本文提出了“摊销锚点细化”方法,利用冻结的主干网络预测初始高斯表示,并在固定计算预算下进行短期优化以专门化表示,同时保持表示密度的下限。训练无关的阶段应用持久同调约束来修剪不稳定的高斯,同时保留拓扑持久结构,并将结果轨迹直接作为场景流。在Stage-Capture基准测试中,摊销锚点细化方法达到了24.31±2.22dB的性能,而我们的部署实验则展示了在单个消费级GPU上进行重建并在独立XR头戴设备上播放的能力。

🔬 方法详解

问题定义:本文旨在解决在独立XR头戴设备上进行连续时间4D重建时面临的计算资源不足和重建崩溃问题。现有方法需要逐场景优化,计算需求过高,导致无法有效部署。

核心思路:提出的摊销锚点细化方法通过冻结的主干网络预测初始高斯表示,并在固定计算预算下进行短期优化,以专门化该表示,同时保持表示密度的下限。

技术框架:该方法主要分为两个阶段:第一阶段是利用冻结的主干网络进行初始高斯表示的预测,第二阶段是进行短期优化和应用持久同调约束以修剪不稳定的高斯。

关键创新:最重要的创新在于引入了持久同调约束来修剪不稳定的高斯,同时保留拓扑持久结构,这一设计与现有方法在处理高斯表示的稳定性上有本质区别。

关键设计:在参数设置上,保持了计算预算的固定性,损失函数设计上强调了表示密度的保持,网络结构上采用了冻结的主干网络以提高预测效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Stage-Capture基准测试中,摊销锚点细化方法达到了24.31±2.22dB的重建性能,相较于现有方法有显著提升。此外,实验表明该方法能够在单个消费级GPU上进行有效重建,并在独立XR头戴设备上实现流畅播放。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、增强现实和其他XR技术,能够在资源受限的环境中实现高质量的4D重建,提升用户体验。未来,该方法可能推动更多实时应用的发展,尤其是在移动设备和消费级硬件上的应用。

📄 摘要(原文)

Continuous-time 4D reconstruction remains impractical on standalone XR headsets. Per-scene optimization demands deployment-infeasible compute, and lower budgets cause collapse rather than degrade gradually. Feed-forward prediction is fast, but struggle to recover scene-specific detail. We present Amortized Anchor Refinement, which uses a frozen backbone to predict an initial Gaussian representation and a short optimization to specialize it under a fixed compute budget, with a capacity floor preserving representational density. A training-free stage then applies a persistent-homology constraint to prune unstable Gaussians while preserving topologically persistent structures, and streams the resulting trajectories directly as scene flow. On the Stage-Capture benchmark, Amortized Anchor Refinement achieves 24.31$\pm$2.22dB, while our deployment experiments demonstrate reconstruction within the target budget on a single consumer GPU and playback on a standalone XR headset.