UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

📄 arXiv: 2608.01706v1 📥 PDF

作者: Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

分类: cs.CV

发布日期: 2026-08-03

备注: Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出UniSim-SLAM以解决SLAM中的几何不一致性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: SLAM 几何一致性 因子图 深度学习 机器人导航 增强现实 自动驾驶

📋 核心要点

  1. 现有SLAM方法在长序列中容易出现几何不一致性和轨迹漂移,尤其是在输入视图集变化时。
  2. UniSim-SLAM通过前端的两视图关键帧跟踪和后端的多视图子图优化相结合,解决了上述问题。
  3. 在TUM RGB-D和7-Scenes数据集上,UniSim-SLAM的轨迹误差分别减少了38.5%和45.9%,显示出显著的性能提升。

📝 摘要(中文)

近年来,几何基础模型使得SLAM的前馈推理成为可能,但其预测结果强烈依赖于输入视图集,导致在长序列中出现几何不一致性和轨迹漂移。在线部署进一步暴露了两视图跟踪的低延迟与多视图推理的约束丰富性之间的权衡。为此,本文提出了UniSim-SLAM,一个集成系统,在前端运行轻量级的两视图关键帧跟踪,并在后端进行周期性的多视图子图优化。通过在$Sim(3)$上构建统一的多层因子图,本文实现了全局关键帧姿态和子图姿态的联合优化,显著提高了SLAM的准确性。实验结果表明,UniSim-SLAM在TUM RGB-D和7-Scenes数据集上分别减少了38.5%和45.9%的轨迹误差,达到了最先进的准确性。

🔬 方法详解

问题定义:本文旨在解决SLAM中由于输入视图集变化导致的几何不一致性和轨迹漂移问题。现有方法在长序列中表现不佳,尤其是在在线部署时,低延迟与多视图推理的约束丰富性之间存在权衡。

核心思路:UniSim-SLAM的核心思路是结合轻量级的两视图关键帧跟踪和周期性的多视图子图优化,通过在$Sim(3)$上构建统一的多层因子图,实现全局关键帧姿态和子图姿态的联合优化,以提高SLAM的稳定性和准确性。

技术框架:该系统分为前端和后端两个模块。前端负责实时的两视图关键帧跟踪,后端则定期进行多视图子图的优化。整体架构通过因子图的方式整合了时间视图间的里程计边、视图与子图间的桥接边以及子图间的约束。

关键创新:UniSim-SLAM的创新在于其统一的多层因子图设计,能够有效整合不同局部坐标系下的预测结果,解决了尺度不一致的问题。这一方法与传统SLAM方法的本质区别在于其优化过程的统一性和灵活性。

关键设计:在设计中,采用了深度统计尺度锚定的视图与子图桥接边,以及子图间的约束,确保了子图间的一致性关系。此外,因子图的构建和优化策略也经过精心设计,以提升整体系统的鲁棒性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在TUM RGB-D和7-Scenes数据集上的实验结果显示,UniSim-SLAM在无标定设置下达到了最先进的准确性,轨迹误差分别减少了38.5%和45.9%。这一显著的性能提升证明了其在解决SLAM问题上的有效性。

🎯 应用场景

UniSim-SLAM在机器人导航、增强现实和自动驾驶等领域具有广泛的应用潜力。其高精度的SLAM能力能够为自主系统提供稳定的环境感知和定位支持,进而提升智能系统的自主决策能力和操作效率。未来,随着技术的进一步发展,UniSim-SLAM可能会在更复杂的动态环境中发挥重要作用。

📄 摘要(原文)

Recent geometric foundation models enable feed-forward inference for SLAM, but their predictions are strongly dependent on the input view set, which leads to geometric inconsistencies and trajectory drift when results are chained over long sequences. Online deployment further exposes a trade-off between the low latency of two-view tracking and the constraint richness of multi-view inference. We introduce UniSim-SLAM, an integrated system that runs lightweight two-view keyframe tracking in the frontend and performs periodic multi-view submap refinement in the backend. To combine predictions defined in heterogeneous local coordinates with inconsistent scales, we formulate a unified multi-level factor graph on $Sim(3)$ that jointly optimizes global keyframe poses and submap poses. The graph integrates temporal view-to-view odometry edges, view-to-submap bridge edges with depth-statistics scale anchoring, and submap-to-submap tie and scale constraints to enforce consistent similarity relations across submaps. Experiments on TUM RGB-D and 7-Scenes show that UniSim-SLAM achieves state-of-the-art accuracy in the uncalibrated setting, reducing trajectory error by $38.5\% $ on TUM RGB-D and $45.9\%$ on 7-Scenes compared to prior best results. Project page: https://vision3d-lab.github.io/unisim-slam/