GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

📄 arXiv: 2608.17988v1 📥 PDF

作者: Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

分类: cs.CV

发布日期: 2026-08-18


💡 一句话要点

提出GS-Voxel框架以解决大规模3D场景生成问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D高斯点云 结构化潜在变量 大规模场景生成 变分自编码器 航空图像生成

📋 核心要点

  1. 现有的3D高斯点云重建方法存在无序和空间不规则的问题,且原始数量变化大,难以处理大规模场景生成。
  2. GS-Voxel框架通过无拟合的方式将预优化的3D高斯重建转换为稀疏活跃体素,避免了每场景的额外优化。
  3. 实验结果表明,GS-Voxel能够有效生成大规模航空3D场景,其潜在变量容量随着占用体素数量的增加而提升。

📝 摘要(中文)

许多可扩展的潜在3D生成器在结构化张量上运行,而预优化的3D高斯点云重建则是无序的、空间不规则的,并且原始数量变化很大。我们提出了GS-Voxel,一个无拟合的结构化潜在框架,并评估其在大规模航空3D高斯场景生成中的应用。GS-Voxel确定性地将兼容的预优化3D高斯重建转换为稀疏活跃体素,而无需额外的每场景优化,保留所选原始体素的亚体素位置和渲染属性。GS特定的分解变分自编码器(VAE)分别编码体素几何和局部高斯属性为稀疏3D潜在变量,其大小随着占用体素数量的增加而增长,而不是受限于固定的场景原始数量。我们在GS-Voxel潜在空间中训练图像条件流模型以生成航空3D高斯场景。GS-Voxel的一个关键应用是大面积场景生成:重叠感知的平铺推理扩展了合成,超出了单个训练裁剪,依赖于卫星视图图像。我们的结果表明,GS-Voxel为预优化的航空3D高斯重建提供了结构化潜在变量,其潜在容量随着占用体素数量的增加而增长。

🔬 方法详解

问题定义:本论文旨在解决现有3D高斯点云重建方法在大规模场景生成中的无序性和空间不规则性问题。现有方法在处理不同数量的原始体素时,往往需要复杂的优化过程,限制了其扩展性。

核心思路:GS-Voxel框架的核心思想是通过无拟合的方式将预优化的3D高斯重建直接转换为稀疏活跃体素,从而简化生成过程并提高效率。该设计允许潜在变量的容量随着占用体素数量的增加而增长,避免了固定的场景原始数量限制。

技术框架:GS-Voxel的整体架构包括两个主要模块:首先是将预优化的3D高斯重建转换为稀疏活跃体素的过程,其次是使用GS特定的分解变分自编码器(VAE)对体素几何和局部高斯属性进行编码。

关键创新:GS-Voxel的主要创新在于其无拟合的结构化潜在框架,能够在不进行额外优化的情况下,直接从预优化的3D高斯重建中提取稀疏体素。这一方法与传统的需要复杂优化的生成方法本质上不同。

关键设计:在设计中,GS-Voxel采用了分解变分自编码器(VAE)来分别处理体素的几何形状和局部高斯属性。此外,重叠感知的平铺推理技术被引入,以扩展合成能力,支持大面积场景生成。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GS-Voxel在生成大规模航空3D场景时,能够有效保持结构化潜在变量的特性,并且其潜在容量随着占用体素数量的增加而显著提升。与传统方法相比,GS-Voxel在合成质量和效率上均表现出明显的优势。

🎯 应用场景

GS-Voxel框架在航空3D场景生成中具有广泛的应用潜力,能够支持城市规划、环境监测和虚拟现实等领域。其高效的生成能力和扩展性将推动相关技术的发展,提升大规模场景建模的实际应用价值。

📄 摘要(原文)

Many scalable latent 3D generators operate on structured tensors, whereas pre-optimized 3D Gaussian Splatting (3DGS) reconstructions are unordered, spatially irregular, and vary widely in primitive count. We present GS-Voxel, a fitting-free structured latent framework, and evaluate it for large-scale aerial 3D Gaussian scene generation. GS-Voxel deterministically converts a compatible pre-optimized 3DGS reconstruction into sparse active voxels without additional per-scene optimization, retaining the sub-voxel positions and rendering attributes of the selected primitives. A GS-specific factorized VAE then separately encodes voxel geometry and local Gaussian attributes into sparse 3D latents whose size grows with the number of occupied voxels rather than being limited by a fixed scene-wide primitive count. We train image-conditioned flow models in the GS-Voxel latent space to generate aerial 3DGS scenes. A key application enabled by GS-Voxel is large-area scene generation: overlap-aware tiled inference extends synthesis beyond a single training crop conditioned on satellite-view images. Our results show that GS-Voxel provides structured latents for pre-optimized aerial 3DGS reconstructions, with latent capacity that grows with the number of occupied voxels.