Seeing the Unseen: Semantic-in-Gaussian for Sparse-View 3D Generalization
作者: Zeyang Bai, Yunpeng Wang, Yunbiao Wang, Jun Xiao
分类: cs.CV
发布日期: 2026-08-24
备注: Accepted at the ECCV 2026 Workshop on 3DWM
💡 一句话要点
提出SeeU框架以解决稀疏视图下3D重建问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D重建 高斯点云 稀疏视图 语义条件 跨视图聚合 计算机视觉 图形学 深度学习
📋 核心要点
- 现有的G-3DGS方法在部分观察或遮挡区域的高斯估计上存在不足,导致表面不完整或结构崩溃。
- 本文提出SeeU框架,通过语义条件的高斯空间细化,利用跨视图熵感知模块聚合多视图信息,提升重建质量。
- 实验结果显示,SeeU在多个基准测试中显著提高了渲染质量,尤其在外推设置下PSNR平均提升2.44 dB。
📝 摘要(中文)
通用3D高斯点云(G-3DGS)已成为稀疏视图下新视角合成的有前景的方法。然而,现有框架受限于像素对齐的高斯估计,在部分观察或遮挡区域表现不佳,导致表面不完整或结构崩溃。为了解决这些挑战,本文提出了SeeU(Seeing the Unseen),一个新颖的G-3DGS框架。其核心设计为语义条件下的高斯空间细化。具体而言,我们引入了跨视图熵感知(CEA)模块,将多视图的语义和几何线索聚合为紧凑的嵌入。这些嵌入指导条件高斯变换器,对粗糙高斯进行残差更新,帮助恢复部分观察结构的欠约束区域,同时保持表面一致性。综合实验表明,SeeU在多个基准测试中显著提高了渲染质量和结构完整性,尤其在具有挑战性的外推设置下,SeeU在PSNR上平均提高了2.44 dB,相较于最新的SOTA G-3DGS方法。
🔬 方法详解
问题定义:本文旨在解决现有G-3DGS方法在稀疏视图下高斯估计不准确的问题,尤其是在部分观察或遮挡区域,导致表面不完整和结构崩溃的痛点。
核心思路:提出SeeU框架,通过引入语义条件的高斯空间细化,利用跨视图熵感知模块聚合多视图的语义和几何信息,以指导高斯的细化过程,从而改善重建效果。
技术框架:SeeU框架主要包括跨视图熵感知(CEA)模块和条件高斯变换器。CEA模块负责将多视图信息聚合为紧凑的嵌入,而条件高斯变换器则对粗糙高斯进行残差更新,以恢复欠约束区域。
关键创新:最重要的创新点在于引入了语义条件的高斯空间细化和跨视图熵感知模块,这与现有方法的像素对齐高斯估计形成了本质区别,显著提升了重建质量。
关键设计:在设计中,CEA模块通过熵感知机制优化了信息聚合过程,条件高斯变换器则采用残差学习策略,确保了高斯更新的有效性和表面一致性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SeeU在多个基准测试中显著提高了渲染质量,尤其在外推设置下,PSNR平均提升2.44 dB,相较于最新的SOTA G-3DGS方法,展示了其在结构完整性和渲染效果上的优势。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、增强现实以及计算机图形学中的3D重建和场景合成。通过提高稀疏视图下的重建质量,SeeU框架能够在实际应用中提供更为真实和完整的3D场景,具有重要的实际价值和未来影响。
📄 摘要(原文)
Generalizable 3D Gaussian Splatting (G-3DGS) has emerged as a promising approach for novel view synthesis undersparse-view settings. However, existing frameworks remain restricted by pixel-aligned Gaussian estimation, whichstruggles in partially observed or occluded regions and often leads to incomplete surfaces or structural collapse. Toaddress these challenges, we propose SeeU (Seeing the Unseen), a novel G-3DGS framework. We frame its core design asSemantic-in-Gaussian: semantic-conditioned refinement in Gaussian space. Specifically, we introduce a Cross-viewEntropy-Aware (CEA) module that aggregates multi-view semantic and geometric cues into compact embeddings. Theseembeddings guide the Conditional Gaussian Transformer, which applies residual updates to coarse Gaussians, helpingrecover under-constrained regions of partially observed structures while preserving surface consistency. Comprehensiveexperiments on multiple benchmarks demonstrate that SeeU consistently improves rendering quality and structuralcompleteness while retaining efficient feed-forward inference. Especially under challenging extrapolation settings,SeeU achieves an average improvement of 2.44 dB in PSNR compared to recent SOTA G-3DGS methods.