Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

📄 arXiv: 2609.04201v1 📥 PDF

作者: Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu

分类: cs.CV

发布日期: 2026-09-03

备注: ECCV 2026. Project page: https://linjohnss.github.io/scal3r/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Scal3R以解决长视频在线3D重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 在线3D重建 多参考姿态查询 轻量级模型 姿态图优化 长视频处理

📋 核心要点

  1. 现有的在线3D重建方法在处理长视频时容易出现几何崩溃,导致重建精度下降。
  2. 论文提出的Scal3R通过多参考相对姿态查询,利用轻量级tokens和非对称注意力机制来改善姿态估计。
  3. 实验结果表明,Scal3R在KITTI数据集上将平均绝对轨迹误差降低超过60%,并在多个基准数据集上达到最先进的性能。

📝 摘要(中文)

在线3D重建模型在处理长视频时表现不佳,主要由于相对于固定第一帧锚点回归姿态时,导致超出训练分布的外推,进而造成小漂移累积并放大为显著的几何崩溃。论文提出Scal3R,通过将在线重建重新表述为多参考相对姿态查询,利用轻量级可学习的tokens,注入到完全冻结的骨干网络中,并通过非对称注意力机制进行查询。该方法在单个GPU上8小时内收敛,相较于在线基线在KITTI数据集上平均绝对轨迹误差减少超过60%,并在多个数据集上实现了最先进的性能。

🔬 方法详解

问题定义:论文要解决的问题是现有在线3D重建方法在长视频处理时的几何崩溃现象,主要由于相对于固定第一帧的姿态回归导致的漂移累积。

核心思路:Scal3R的核心思路是将在线重建任务重新定义为多参考相对姿态查询,通过引入轻量级的可学习tokens来增强模型的灵活性和准确性。

技术框架:整体架构包括一个完全冻结的骨干网络和一个非对称注意力机制,利用多个过去关键帧进行姿态查询,同时结合在线姿态图优化系统以抑制长距离漂移。

关键创新:最重要的技术创新在于引入轻量级tokens和多参考姿态查询的设计,使得模型能够在保持局部几何稳定的同时,改善全局姿态估计的准确性。

关键设计:在参数设置上,tokens占模型参数的约1%,并通过非对称注意力机制与骨干网络进行交互,此外,采用在线姿态图优化系统以实现闭环校正。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Scal3R在KITTI数据集上实现了超过60%的平均绝对轨迹误差降低,相较于在线基线表现出显著的提升。此外,该方法在Virtual KITTI、Sintel、TUM-Dynamic、ScanNet和7-Scenes等多个数据集上也达到了最先进的性能,展示了其广泛的适用性和有效性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等场景,能够有效提升长视频下的3D重建精度,具有重要的实际价值和广泛的应用前景。未来,该方法可能推动相关领域的技术进步,改善实时3D重建的性能。

📄 摘要(原文)

Online 3D reconstruction models perform poorly on long videos. This happens because regressing poses relative to a fixed first-frame anchor forces extrapolation far beyond the training distribution. Small drifts accumulate and amplify into significant geometric collapse. However, we observe that per-frame depth remains stable throughout this failure. The backbone's local geometry remains intact; only the global pose head breaks down. Motivated by this decoupling, we introduce Scal3R. This approach reformulates online reconstruction as multi-reference relative pose querying. We use lightweight learnable tokens, which make up about ~1% of the parameters, and inject them into a completely frozen backbone via asymmetric attention. This setup queries poses relative to multiple past keyframes. An online pose-graph optimization system with loop closure suppresses long-range drift. Scal3R reaches convergence in 8 hours on a single GPU. It reduces the average ATE by over 60% on KITTI compared to the online baseline. It also achieves state-of-the-art performance across Virtual KITTI, Sintel, TUM-Dynamic, ScanNet, and 7-Scenes. Project page: https://linjohnss.github.io/scal3r/