ObjectSplat: Improving Mesh Fidelity and Interactivity for 3D Scenes via Object-Level Mesh Splatting

📄 arXiv: 2608.30423v1 📥 PDF

作者: Minhas Kamal, Hiranya Garbha Kumar, Mahedi Kamal, Balakrishnan Prabhakaran

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-08-31


💡 一句话要点

提出ObjectSplat以解决3D场景重建中的对象级结构缺失问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D场景重建 对象级结构 Splatting算法 实例分割 背景修复 实时渲染 可交互性

📋 核心要点

  1. 现有的Splatting算法将3D场景表示为单一的整体场域,缺乏对象级结构,限制了后续的编辑和交互能力。
  2. 本文提出了一种分解再重建的方法,通过实例分割和背景修复,独立重建每个对象和背景,最终组合成完整场景。
  3. 实验结果表明,该方法在网格保真度和新视图合成方面有显著提升,F-score提升超过5%,并支持对象级的交互性。

📝 摘要(中文)

基于Splatting的算法能够从常规图像重建出逼真、实时可渲染且可导出网格的3D场景,但其将场景表示为单一的整体场域,缺乏对象级结构,导致后续编辑和交互变得不可行。此外,未直接观察到的区域受到周围纹理的污染,影响了网格的保真度和新视图合成。为此,本文提出了一种分解再重建的方法:对每帧进行实例分割,将剩余部分视为背景并进行修复,独立重建每个实例及背景,并将其组合为单一场景。该方法显著提高了网格的保真度(F-score提升超过5%)和新视图合成,同时支持对象级的可修改性和交互性。

🔬 方法详解

问题定义:本文旨在解决现有Splatting算法在3D场景重建中缺乏对象级结构的问题。现有方法将场景视为单一整体,导致无法进行有效的后续编辑和交互,同时未观察区域的纹理污染影响了重建质量。

核心思路:论文提出的核心思路是分解再重建,即首先对每帧进行实例分割,将背景单独处理,随后独立重建每个实例和背景,最后将它们组合成完整的3D场景。这样的设计使得每个对象都能被单独处理,从而提高了重建的灵活性和精度。

技术框架:整体架构包括三个主要模块:首先是实例分割模块,用于从输入帧中提取对象;其次是背景修复模块,处理未观察到的区域;最后是重建模块,采用mesh splatting技术独立重建对象和背景,并将其合成。

关键创新:本文的关键创新在于提出了分解再重建的方法,使得每个对象和背景可以独立处理,显著提高了网格的保真度和新视图合成能力。这一方法与传统的整体重建方法形成了鲜明对比。

关键设计:在技术细节上,本文对实例分割的精度、背景修复的算法以及mesh splatting的参数设置进行了优化,确保了重建结果的高质量和实时性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,采用ObjectSplat方法后,网格保真度的F-score提升超过5%,显著改善了新视图合成的质量。同时,该方法支持对象级的可修改性和交互性,拓宽了3D场景重建的应用范围。

🎯 应用场景

该研究在计算机视觉和图形学领域具有广泛的应用潜力,尤其是在虚拟现实、增强现实和游戏开发中。通过提供高保真度和可交互的3D场景重建,能够提升用户体验和交互性。此外,该方法也可用于影视制作和建筑可视化等领域,具有实际的商业价值和影响力。

📄 摘要(原文)

Splatting-based algorithms reconstruct photorealistic, real-time-renderable, and mesh-exportable 3D scenes from regular images, but they represent a scene as a single monolithic field. Therefore, the reconstruction has no object-level structure, leaving it infeasible for downstream editing or interaction. Moreover, regions that are never directly observed in the input scans are contaminated by the surrounding texture and left uncorrected, capping both mesh fidelity and novel-view synthesis. We propose a decompose-before-reconstruct approach: we segment the instances out of every frame, consider the remaining as background and inpaint it, reconstruct each instance and the background independently with mesh splatting, and compose them into a single scene. Our method significantly improves mesh fidelity (over a 5\% gain in F-score) and novel-view synthesis, while supporting object-wise modifiability and interactivity. The code will be made publicly available.