TileGS: Tile-Local Depth Binning for Gaussian Splatting Rasterization

📄 arXiv: 2609.03613v1 📥 PDF

作者: Wei Tan, Matias Turkulainen, Lauri Ilola, Hamed Rezazadegan Tavakoli, Juho Kannala

分类: cs.GR

发布日期: 2026-09-03


💡 一句话要点

提出TileGS以解决高效3D高斯点云光栅化问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 高斯点云 光栅化 实时渲染 性能优化 计算机图形学 深度局部范围 选择性修复

📋 核心要点

  1. 现有的3D高斯点云光栅化方法在处理全局排序瓦片流时,导致了长范围和重的几何属性流量,影响性能。
  2. TileGS通过局部重组高斯点云光栅化,将长瓦片范围转化为短的深度局部范围,从而提高光栅化效率。
  3. 实验结果表明,TileGS在多个场景中实现了显著的性能提升,尤其在RTX 4090上,光栅内核加速达到1.44倍。

📝 摘要(中文)

实时3D高斯点云光栅化(3DGS)实现了高质量渲染,但标准光栅化仍需遍历全局排序的瓦片流,导致每个瓦片的范围过长和几何属性流量过大。本文提出TileGS,通过将每个长瓦片范围转变为一系列较短的深度局部范围,按前到后顺序光栅化这些范围,并在粗略排序不足以匹配基线合成时应用选择性修复。在对9个场景的基准测试中,TileGS的默认No-GW变体在RTX 4090上实现了平均1.44倍的光栅内核加速,且在RTX 4090和RTX 1000 Ada上分别实现了1.069倍和1.094倍的端到端帧加速,同时在数值噪声上与gsplat输出相匹配。

🔬 方法详解

问题定义:本文旨在解决现有3D高斯点云光栅化方法中全局排序瓦片流带来的性能瓶颈,特别是长瓦片范围和几何属性流量过大的问题。

核心思路:TileGS的核心思路是将长瓦片范围重组为短的深度局部范围,并按前到后顺序进行光栅化,以减少光栅遍历工作量。

技术框架:TileGS的整体架构包括瓦片局部重组、深度局部范围的光栅化和选择性修复三个主要模块。首先对瓦片进行局部重组,然后按顺序光栅化短范围,最后在必要时进行修复。

关键创新:TileGS的主要创新在于通过局部化处理减少了有效光栅遍历工作,而不是单纯减少字节量或提高合并效率,这与现有方法有本质区别。

关键设计:TileGS的设计中,选择性修复机制是关键,确保在粗略排序不足时仍能匹配基线合成,此外,优化了光栅化过程中的内存使用和计算效率。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,TileGS在RTX 4090上实现了平均1.44倍的光栅内核加速,且在端到端帧速率上分别在RTX 4090和RTX 1000 Ada上提升了1.069倍和1.094倍,表现出色。尽管SM吞吐量较低,TileGS依然在性能上超越了广泛使用的gsplat实现。

🎯 应用场景

该研究的潜在应用领域包括实时3D渲染、游戏开发、虚拟现实和增强现实等。通过提高光栅化效率,TileGS能够在资源受限的设备上实现更高质量的3D图形渲染,具有重要的实际价值和未来影响。

📄 摘要(原文)

Real-time 3D Gaussian Splatting (3DGS) achieves high rendering quality, but standard rasterization still traverses a globally sorted tile stream that creates long per-tile ranges and heavy geometry-attribute traffic. We present TileGS, a tile-local reorganization of Gaussian splatting. TileGS turns each long tile range into a sequence of shorter depth-local ranges, rasterizes those ranges in front-to-back order, and applies selective repair where coarse ordering is insufficient to match baseline compositing. Across a 9-scene benchmark on desktop and laptop Ada GPUs, our default No-GW (No Geometry-Write) variant delivers a mean 1.44x raster-kernel speedup on RTX 4090 and mean end-to-end frame speedups of 1.069x on RTX 4090 and 1.094x on RTX 1000 Ada over gsplat--a widely used optimized open-source 3DGS implementation--while matching the gsplat output up to numerical noise (|Delta PSNR| < 0.001 dB, |Delta SSIM| < 0.001, |Delta LPIPS| < 0.001). Full-suite RTX 4090 Nsight Compute profiling reveals TileGS is faster despite lower SM throughput, lower active-warp occupancy, and higher DRAM traffic, while total SASS thread instructions fall by 1.26x. Source-attributed profiling confirms that geometry attributes dominate the remaining memory pressure (85.8% of total raster traffic and 88.6% of excess sectors). Together, these counters support the interpretation that TileGS improves raster performance by reducing effective raster traversal work, rather than by reducing byte volume, improving coalescing, increasing occupancy, or directly reducing measured warp divergence.