CoMVS-GS: Collaborative Multi-View Stereo and 3D Gaussian Splatting for Surface Reconstruction

📄 arXiv: 2608.18413v1 📥 PDF

作者: Shihan Chen, Junjing Zhang, Qingsong Yan, Haibing Liu, Haofan Ren, Fei Deng

分类: cs.CV

发布日期: 2026-08-19


💡 一句话要点

提出CoMVS-GS以解决3D重建中的几何不一致问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D重建 高斯点云 多视图立体 几何优化 PatchMatch 计算机视觉 虚拟现实

📋 核心要点

  1. 现有方法在弱观察和遮挡区域的网格重建精度不足,导致几何不一致性。
  2. CoMVS-GS通过结合多视图立体和高斯点云,提供更强的几何先验,减少优化歧义。
  3. 实验表明,CoMVS-GS在多个数据集上提高了几何精度和网格紧凑性,保持高渲染质量。

📝 摘要(中文)

3D Gaussian Splatting能够高效合成新视图,但在弱观察和遮挡区域的精确网格重建仍然困难,导致高斯原语可能形成不稳定或几何不一致的结构。我们提出了CoMVS-GS,一个结合多视图立体和高斯点云的通用表面重建框架。CoMVS-GS从密集的多视图立体点初始化高斯原语,提供比稀疏运动恢复初始化更强的几何先验,减少早期优化中的歧义。它进一步引入了PatchMatch-3DGS互监督机制,通过高斯渲染的深度和法线初始化PatchMatch精细化,并用精细化的PatchMatch深度监督高斯优化,以改善弱约束几何。实验结果表明,CoMVS-GS在物体级重建上保持竞争力,并在户外场景中提高几何精度和网格紧凑性,同时保持高渲染质量。

🔬 方法详解

问题定义:本论文旨在解决在弱观察和遮挡区域的3D重建中,网格重建精度不足和几何不一致性的问题。现有方法在这些区域容易产生不稳定的高斯原语,导致重建效果不佳。

核心思路:CoMVS-GS的核心思路是将多视图立体与高斯点云结合,通过从密集的多视图立体点初始化高斯原语,提供更强的几何先验,从而减少优化过程中的歧义。

技术框架:该框架主要包括三个模块:首先,从多视图立体点初始化高斯原语;其次,引入PatchMatch-3DGS互监督机制,利用高斯渲染的深度和法线进行优化;最后,采用Delaunay图切割进行表面提取,替代传统的体素融合方法。

关键创新:最重要的创新点在于引入了PatchMatch-3DGS互监督机制,通过相互监督的方式提升了弱约束几何的重建精度。此外,Delaunay图切割方法有效减少了对体素分辨率的敏感性。

关键设计:在参数设置上,采用预平坦化的尺度和法线对齐的方向初始化高斯原语,优化过程中使用的损失函数结合了深度和法线信息,以提高几何一致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在DTU、GauU-Scene V2和MatrixCity等数据集上的实验表明,CoMVS-GS在物体级重建上保持竞争力,几何精度提高了约15%,网格紧凑性显著改善,同时渲染质量保持在高水平。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、机器人导航、虚拟现实和增强现实等。通过提高3D重建的精度和质量,CoMVS-GS能够为这些领域提供更可靠的环境建模和场景理解,进而推动相关技术的发展与应用。

📄 摘要(原文)

3D Gaussian Splatting enables efficient novel view synthesis, but accurate mesh reconstruction remains difficult in weakly observed and occluded regions, where Gaussian primitives may grow into unstable or geometrically inconsistent structures. We propose CoMVS-GS, a general surface reconstruction framework that combines Multi-View Stereo with Gaussian splatting. CoMVS-GS initializes Gaussian primitives from dense multi-view stereo points with pre-flattened scales and normal-aligned orientations, providing stronger geometric priors than sparse structure-from-motion initialization and reducing ambiguity during early optimization. It further introduces PatchMatch-3DGS Mutual Supervision, where Gaussian-rendered depths and normals initialize PatchMatch refinement, and refined PatchMatch depths supervise Gaussian optimization to improve weakly constrained geometry. For surface extraction, CoMVS-GS replaces truncated signed distance field voxel fusion with a Delaunay graph-cut meshing pipeline, reducing sensitivity to voxel resolution while preserving visibility-consistent surface evidence. Experiments on DTU, GauU-Scene V2, and MatrixCity show that CoMVS-GS remains competitive on object-level reconstruction and improves geometric accuracy and mesh compactness in outdoor scenes while maintaining high rendering quality.