ABCD: Alpha-Composited Block Coordinate Descent: Constant-VRAM Training for Large Radiance Fields

📄 arXiv: 2608.27735v1 📥 PDF

作者: Ka Heng Shiu, Kartic Subr

分类: cs.CV, cs.GR

发布日期: 2026-08-27

备注: Presented at ACM SIGGRAPH 2026 Posters

期刊: ACM SIGGRAPH 2026 Posters (SIGGRAPH Posters '26), Article 62, 3 pages, 2026

DOI: 10.1145/3799825.3818779

🔗 代码/项目: GITHUB


💡 一句话要点

提出ABCD框架以解决大规模辐射场训练中的内存限制问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 辐射场 块坐标下降 GPU训练 内存优化 三维重建 计算机图形学 alpha混合

📋 核心要点

  1. 现有方法在训练大规模辐射场时面临内存限制,导致无法处理超大场景。
  2. ABCD通过块坐标下降法和alpha混合技术,优化了训练过程,降低了内存需求。
  3. 实验结果显示,ABCD在重建质量上保持高水平,PSNR降级小于5%,显著优于去掉合成的版本。

📝 摘要(中文)

我们提出了ABCD(Alpha-Composited Block Coordinate Descent),这是一个针对alpha合成辐射场的外存训练框架,特别应用于3D高斯点云。该方法将训练过程重新构造为在空间分区上的块坐标下降:每次仅激活一个参数块,其余块保持冻结。通过利用alpha混合的结合性,这些非激活区域可以预渲染并合并为前景和背景的RGBA图像。因此,在固定的分区大小和图像分辨率下,峰值VRAM与总场景范围呈O(1)关系,而不是随完整场景大小增长。这使得内存有限的GPU能够训练那些原本无法在内存中适配的场景。实验表明,我们的方法在重建质量上与3DGS相近,PSNR降级小于5%,而去掉合成的ABCD则降级约40%。

🔬 方法详解

问题定义:本论文旨在解决在训练大规模辐射场时GPU内存不足的问题。现有方法在处理超大场景时,内存需求随场景大小增长,导致无法有效训练。

核心思路:ABCD框架通过块坐标下降法,将训练过程分为多个空间分区,每次仅激活一个参数块,其余块保持冻结。利用alpha混合的结合性,非激活区域可以预渲染,降低内存使用。

技术框架:该方法的整体架构包括参数块的管理、空间分区的划分、以及前景和背景图像的合成。训练过程通过逐块更新参数,确保内存使用保持在固定水平。

关键创新:ABCD的主要创新在于通过块坐标下降法和alpha混合技术的结合,使得峰值VRAM需求与场景大小无关,从而解决了大规模场景训练的内存瓶颈。

关键设计:在参数设置上,分区大小和图像分辨率是关键因素。损失函数设计上,保持重建质量的同时,确保内存使用最小化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,ABCD方法在重建质量上与3D高斯点云模型相近,PSNR降级小于5%。相比之下,去掉合成的ABCD方法降级约40%,显示出ABCD框架在性能上的显著优势。

🎯 应用场景

该研究的潜在应用领域包括计算机图形学、虚拟现实和增强现实等领域,尤其是在需要处理大规模三维场景的应用中。ABCD框架的实际价值在于能够在内存有限的情况下,训练复杂的辐射场模型,从而推动相关技术的发展与应用。

📄 摘要(原文)

We present ABCD (Alpha-Composited Block Coordinate Descent), an out-of-core training framework for alpha-composited radiance fields, instantiated here for 3D Gaussian Splatting. Our method reformulates training as block coordinate descent over spatial partitions: only one block of parameters is active at a time, while all others are frozen. By exploiting the associativity of alpha blending, these inactive regions can be pre-rendered and collapsed into foreground and background RGBA images. As a result, for fixed partition size and image resolution, peak VRAM becomes O(1) with respect to total scene extent, rather than growing with full scene size. This enables GPUs with limited memory to train scenes that would otherwise not fit in core. In experiments, our method closely preserves the reconstruction quality of 3DGS, with less than 5% PSNR degradation, while ABCD with compositing ablated suffers roughly 40% degradation. Our code can be found at https://github.com/shiukaheng/abcd