AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

📄 arXiv: 2608.22906v1 📥 PDF

作者: Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

分类: cs.CV

发布日期: 2026-08-24

备注: Preprint


💡 一句话要点

提出AquaFlow以解决水下场景重建中的视觉退化问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 水下重建 单目SLAM 高斯点云 视觉退化 增量映射 深度学习 场景表示

📋 核心要点

  1. 现有的单目3D高斯点云流重建方法在水下场景中面临光衰减和散射等严重视觉退化问题,影响重建效果。
  2. AquaFlow通过微调3D视觉基础模型和引入增量高斯初始化策略,提升了水下场景的姿态和点图估计的稳健性。
  3. 实验结果表明,AquaFlow在62条水下轨迹上实现了13.2%的定位误差降低和4.74 dB的PSNR提升,表现优于现有方法。

📝 摘要(中文)

近年来,单目3D高斯点云流重建方法在重建质量与效率之间取得了显著平衡。然而,将这些框架扩展到水下场景面临着严峻挑战,如光衰减和散射导致的视觉退化,影响相机姿态跟踪并扭曲场景几何。为了解决这些问题,我们提出了AquaFlow,一个用于高效且高保真水下重建的单目高斯点云流重建框架。AquaFlow通过在大规模水下数据上微调3D视觉基础模型,实现了稳健的姿态和点图估计,并引入了中介引导的增量高斯初始化策略以支持流式映射。此外,我们开发了一种流式兼容的混合场景表示,结合了结构化的距离条件神经高斯与物理启发的光学模型,以补偿水下图像形成效应,从而实现准确的场景重建。我们在62条多样化的水下轨迹数据集上评估了AquaFlow,实验结果表明其在跟踪和渲染性能上达到最先进水平,平均定位误差降低了13.2%,PSNR提高了4.74 dB。

🔬 方法详解

问题定义:本论文旨在解决水下场景重建中的视觉退化问题,现有方法在光衰减和散射影响下,难以保持准确的相机姿态跟踪和场景几何重建。

核心思路:AquaFlow通过在大规模水下数据上微调3D视觉基础模型,结合中介引导的增量高斯初始化策略,增强了水下重建的稳健性和效率。

技术框架:AquaFlow的整体架构包括数据预处理、姿态估计、点图生成和流式映射四个主要模块,确保在水下环境中实现高效重建。

关键创新:AquaFlow的核心创新在于其混合场景表示,结合了结构化的距离条件神经高斯与物理启发的光学模型,显著改善了水下图像形成效果。

关键设计:在参数设置上,AquaFlow采用了特定的损失函数以优化姿态估计,并设计了适应水下场景的网络结构,以提高重建的准确性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

AquaFlow在62条多样化水下轨迹上的实验结果显示,其平均定位误差降低了13.2%,PSNR提升了4.74 dB,超越了现有的WaterSplat-SLAM方法,展现出卓越的跟踪和渲染性能。

🎯 应用场景

AquaFlow在水下环境中的应用潜力巨大,适用于海洋探测、环境监测和水下机器人导航等领域。其高效的重建能力能够为科学研究和工业应用提供可靠的数据支持,推动水下技术的发展与创新。

📄 摘要(原文)

Recent monocular 3D Gaussian Splatting (3DGS) streaming reconstruction methods have achieved impressive performance by balancing reconstruction quality and efficiency. However, extending these frameworks to underwater scenes remains challenging due to severe visual degradation, such as light attenuation and scattering, which degrades camera pose tracking and distorts scene geometry. To address these challenges, we propose AquaFlow, a monocular Gaussian Splatting streaming reconstruction framework for efficient and high-fidelity underwater reconstruction. Specifically, AquaFlow fine-tunes a 3D vision foundation model on large-scale underwater data for robust pose and pointmap estimation, and introduces a medium-guided incremental Gaussian initialization strategy for streaming mapping. Furthermore, we develop a streaming-compatible hybrid scene representation that integrates structured, distance-conditioned neural Gaussians with a physics-inspired optical model to compensate for underwater image formation effects, enabling accurate scene reconstruction. We evaluate AquaFlow on a comprehensive dataset of 62 diverse underwater trajectories, collected from both public benchmarks and in-the-wild web videos across various scales. Extensive experiments demonstrate that AquaFlow achieves state-of-the-art tracking and rendering performance, reducing average localization error by 13.2% and improving PSNR by 4.74 dB compared to WaterSplat-SLAM.