GeoWeaver: Accurate Long-Sequence 3D Reconstruction via Hierarchical Geometric Assembly

📄 arXiv: 2608.17389v1 📥 PDF

作者: Tinghao Jiang, Sheng Tang, Shengzhe Wei, Juntong Fang, Weiqi Zhang, Junsheng Zhou, Zesong Li

分类: cs.CV

发布日期: 2026-08-18

备注: 15 pages, including supplementary material; 7 figures and 10 tables. Project page: https://kosmoresearch.github.io/GeoWeaver/


💡 一句话要点

提出GeoWeaver以解决长序列3D重建中的几何一致性问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 长序列3D重建 几何一致性 相机运动估计 深度预测 测试时自适应 点云质量 虚拟现实 增强现实

📋 核心要点

  1. 现有的长序列3D重建方法在处理大规模数据时面临内存消耗和几何一致性不足的挑战。
  2. GeoWeaver通过引入几何先验模型和测试时自适应,提供了一种新的框架来优化块级深度和相机参数。
  3. 实验结果显示,GeoWeaver在多个长序列基准测试中显著提高了相机精度和点云质量,验证了其有效性。

📝 摘要(中文)

长序列3D重建需要准确的局部几何和全局一致的相机运动。现有的前馈模型虽然提供了强大的深度和姿态预测,但其内存消耗限制了对长序列的联合推理。Chunk-wise处理提高了可扩展性,但独立预测的块常常出现尺度漂移、姿态错误和点云错位。本文提出GeoWeaver,一个统一框架,包含几何先验模型(GPM)和测试时自适应(TTA)。GPM预测块级深度、置信度和相机参数作为可调几何先验。TTA则执行顺序初始化、全局块级Sim(3)对齐和相机姿态、仿射深度校正及内参的粗到细优化。实验表明,GeoWeaver在相机精度、全局一致性和点云质量上均有显著提升。

🔬 方法详解

问题定义:本文旨在解决长序列3D重建中的局部几何准确性与全局相机运动一致性问题。现有方法在处理长序列时,往往因内存限制而无法进行联合推理,导致尺度漂移和姿态错误。

核心思路:GeoWeaver的核心思路是结合几何先验模型(GPM)与测试时自适应(TTA),通过块级深度预测和相机参数调整,来实现更高的几何一致性和准确性。这样的设计使得模型能够在保持局部几何准确性的同时,纠正累积的姿态和深度误差。

技术框架:GeoWeaver的整体架构包括两个主要模块:几何先验模型(GPM)和测试时自适应(TTA)。GPM负责预测块级深度和相机参数,而TTA则进行顺序初始化、全局对齐和细化优化。

关键创新:GeoWeaver的关键创新在于其统一框架,能够有效整合块级深度预测与全局一致性优化,避免了传统方法中独立处理带来的误差积累。与现有方法相比,GeoWeaver在处理长序列时表现出更强的鲁棒性和准确性。

关键设计:在设计上,GeoWeaver采用了CDF风格的目标函数,联合优化加权的2D重投影和3D一致性残差。此外,模型的参数设置和网络结构经过精心设计,以确保在不同几何先验模型下均能实现良好的适应性和性能提升。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个长序列基准测试中,GeoWeaver显著提高了相机精度和点云质量,具体表现为相机位置估计的误差降低了XX%,点云重建的质量提升了YY%。这些结果验证了GeoWeaver在处理长序列数据时的有效性和优势。

🎯 应用场景

GeoWeaver在长序列3D重建中的应用潜力巨大,适用于虚拟现实、增强现实、自动驾驶和机器人导航等领域。其高精度的相机运动估计和点云重建能力,将为这些应用提供更为可靠的基础,推动相关技术的发展与应用。

📄 摘要(原文)

Long-sequence 3D reconstruction from RGB videos requires both accurate local geometry and globally consistent camera motion. Feed-forward models provide strong depth and pose predictions, but their memory cost prevents joint inference over long sequences. Chunk-wise processing improves scalability, yet independently predicted chunks often exhibit scale drift, pose errors, and point-cloud misalignment. We present GeoWeaver, a unified framework comprising a Geometric Prior Model (GPM) and Test-Time Adaptation (TTA). The GPM predicts chunk-wise depth, confidence, and camera parameters as adjustable geometric priors. TTA then performs sequential initialization, global chunk-level Sim(3) alignment, and coarse-to-fine refinement of camera poses, affine depth corrections, and intrinsics. Dense correspondences provide adjacent, cross-chunk, and long-range constraints, while a robust CDF-style objective jointly optimizes weighted 2D reprojection and 3D consistency residuals. This design preserves local geometric accuracy while correcting accumulated pose, scale, depth, and calibration errors. Experiments across diverse long-sequence benchmarks demonstrate improved camera accuracy, global consistency, and point-cloud quality. Ablations verify the contribution of each adaptation stage, and applying the same TTA procedure to different geometric prior models consistently improves their trajectory estimates, demonstrating that GeoWeaver is not tied to a specific GPM.