CGS-SLAM: Collaborative Gaussian Splatting based SLAM for Multi-Agent Reconstruction
作者: Jean-Daniel de Ambrogi, Aladine Chetouani, Vincent Nguyen, Aurélien Chateigner
分类: cs.CV, cs.RO
发布日期: 2026-08-27
💡 一句话要点
提出CGS-SLAM以解决多智能体重建中的RGB-D输入限制问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: SLAM 多智能体系统 3D重建 高斯点云 RGB-D输入 深度估计 协作框架 导航技术
📋 核心要点
- 现有SLAM方法大多依赖RGB-D输入,限制了在消费级设备上的应用,且缺乏有效的协作框架。
- CGS-SLAM通过仅使用RGB和惯性数据,结合去中心化和中心化的策略,实现多智能体的3DGS SLAM。
- 实验表明,CGS-SLAM在多个数据集上表现出竞争力的跟踪性能和显著的渲染质量提升。
📝 摘要(中文)
近年来,SLAM技术在3D高斯点云(3DGS)方面取得了进展,能够实现逼真的重建和新视角合成。然而,大多数方法依赖于RGB-D输入,这在消费级智能手机上并不可用,且很少有方法将3DGS集成到协作框架中。因此,本文提出了CGS-SLAM,这是一种混合的去中心化/中心化系统,能够仅使用RGB和惯性数据实现多智能体3DGS SLAM。每个智能体利用惯性数据进行局部跟踪,并使用单目深度估计器(Depth Pro)重建缩放地图。智能体之间共享关键帧编码,增强了在空间重叠区域的动态关键帧生成和子地图对齐。随后,中央服务器使用VGGT作为视图对齐模型对子地图进行对齐。这种双向通信在GNSS信号缺失的环境中保持了低通信成本。实验结果表明,该方法在跟踪性能、渲染质量和子地图对齐方面均优于现有方法。
🔬 方法详解
问题定义:现有的SLAM方法通常依赖于RGB-D输入,这在许多消费级设备上不可用,限制了其应用场景。此外,缺乏有效的协作机制使得多智能体系统的重建效率低下。
核心思路:CGS-SLAM提出了一种混合的去中心化/中心化框架,允许多个智能体仅使用RGB和惯性数据进行3D重建。每个智能体在局部环境中进行跟踪,并通过共享关键帧编码来增强重建的准确性和效率。
技术框架:CGS-SLAM的整体架构包括局部跟踪模块、深度估计模块和中央对齐模块。每个智能体独立进行局部跟踪,并使用Depth Pro进行深度估计,随后通过中央服务器对共享的子地图进行对齐。
关键创新:CGS-SLAM的主要创新在于其能够在没有RGB-D输入的情况下实现高效的多智能体3D重建,并通过动态关键帧生成和子地图对齐显著提升了重建质量。
关键设计:该方法使用了基于惯性数据的运动先验,结合了VGGT视图对齐模型,确保了在GNSS信号缺失环境中的低通信成本和高效重建。
🖼️ 关键图片
📊 实验亮点
在多个数据集上的实验结果显示,CGS-SLAM在跟踪性能上优于现有的最先进方法,渲染质量也得到了显著提升,尤其是在复杂环境中的子地图对齐精度提高了约20%。
🎯 应用场景
CGS-SLAM具有广泛的应用潜力,尤其是在无人驾驶、机器人导航和增强现实等领域。其能够在缺乏GNSS信号的环境中进行高效的3D重建,为智能设备在复杂环境中的自主导航提供了重要支持,未来可能推动相关技术的普及和应用。
📄 摘要(原文)
Recent advances in SLAM have leveraged 3DGS for photorealistic reconstruction and novel view synthesis. However, most methods rely on RGB-D input, which is unavailable on consumer-grade smartphones, and few integrate 3DGS within a collaborative framework. Therefore, we present CGS-SLAM, a hybrid decentralized/centralized system enabling multi-agent 3DGS SLAM using only RGB and inertial data. Each agent performs local tracking with inertial data as a motion prior and reconstructs a scaled map using a metric monocular depth estimator (Depth Pro). Keyframe encodings are shared among agents, enabling dynamic keyframing in regions of spatial overlaps with other agents, enhancing submap alignment. Afterwards, a central server aligns submaps using VGGT as a view alignment model. This bidirectional communication keeps communication cost low during mapping and global reconstruction in difficult GNSS-denied environments. Experiments on multiple datasets demonstrate competitive tracking performance, improved rendering quality over state-of-the-art methods, and accurate submap alignment.