Generative Semantic Scene Completion
作者: Shi Chen, Weifeng Ge
分类: cs.CV, cs.LG, cs.RO
发布日期: 2026-08-27
备注: 18 pages, 12 figures, 4 tables. Supplementary material (29 pages) is included as an ancillary file. Project page: https://shichen.world/GSSC-project-page/ - Code, models and the PS$^3$ dataset: https://github.com/BillyChern/GSSC-S2D2
💡 一句话要点
提出生成语义场景补全方法以解决户外LiDAR数据稀疏问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 语义场景补全 LiDAR数据 生成模型 离散扩散 深度学习 自动驾驶 城市建模
📋 核心要点
- 现有的LiDAR语义场景补全方法在处理稀疏数据时面临严重的类别不平衡问题,导致补全效果不佳。
- 本文提出生成语义场景补全(GSSC)方法,通过离散扩散框架实现稀疏到稠密的场景生成,解决了长尾问题。
- 实验结果表明,GSSC在SemanticKITTI数据集上达到了38.8%的mIoU,超越了现有方法的最佳表现,显示出显著的性能提升。
📝 摘要(中文)
户外LiDAR语义场景补全(SSC)旨在从仅观察目标体积1%的扫描中恢复稠密的语义体素网格,面临超过7000倍的类别不平衡问题。本文将SSC重新定义为生成语义场景补全(GSSC),采用单一的离散扩散框架,分为三个角色:首先,配对稀疏-稠密场景合成(PS$^3$)生成匹配的稀疏LiDAR观测及其稠密语义补全,解决了长尾问题,并生成了用于训练的PS$^3$-SemanticKITTI数据集;其次,语义引导生成场景补全(SGSC)通过多项式离散扩散从噪声生成场景,依赖于稀疏扫描、鸟瞰视图语义图和稀疏3D特征流;最后,结构化源离散扩散(S$^2$D$^2$)在一个流匹配步骤中精炼现有补全,提升了SGSC输出及所有测试的外部SSC基准的mIoU,无需基准重训练或测试时适应。在最强基准上,未进行测试时增强的一步达到了38.8%的mIoU,超越了同一限制下的最佳已发布成绩2.1个百分点。
🔬 方法详解
问题定义:本文旨在解决户外LiDAR数据稀疏导致的语义场景补全问题,现有方法在处理类别不平衡时效果不佳,尤其是在长尾分布下。
核心思路:通过生成语义场景补全(GSSC)方法,利用离散扩散模型实现稀疏LiDAR观测与稠密语义补全的匹配,旨在从根源上解决长尾问题。
技术框架:GSSC框架包括三个主要模块:配对稀疏-稠密场景合成(PS$^3$)、语义引导生成场景补全(SGSC)和结构化源离散扩散(S$^2$D$^2$),分别负责生成匹配数据、从噪声生成场景和精炼现有补全。
关键创新:最重要的创新在于将SSC重新定义为生成任务,利用离散扩散模型在多个阶段进行场景生成和补全,显著提升了补全精度。
关键设计:在模型设计中,采用多项式离散扩散作为生成机制,结合鸟瞰视图语义图和稀疏3D特征流进行条件生成,确保生成结果的语义一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GSSC在SemanticKITTI数据集上达到了38.8%的mIoU,超越了同类方法的最佳成绩2.1个百分点。经过四个修正步骤和八视图测试时增强,最终结果达到了39.2%,进一步验证了方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人导航和城市建模等,能够有效提升在稀疏LiDAR数据下的环境理解能力,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Outdoor LiDAR semantic scene completion (SSC) recovers a dense semantic voxel grid from a scan observing 1% of the target volume, under class imbalance beyond 7,000x. We recast SSC as generative semantic scene completion (GSSC): a single discrete-diffusion formulation in three roles. First, paired sparse-dense scene synthesis (PS$^3$) generates matched sparse LiDAR observations with their dense semantic completions, addressing the long tail at its source and yielding the PS$^3$-SemanticKITTI corpus we train on alongside SemanticKITTI. Second, semantic-guided generative scene completion (SGSC) generates the scene from noise with multinomial discrete diffusion, conditioned on the sparse scan through a bird's-eye-view semantic map and a sparse 3D feature stream. Third, the same framework instead refines an existing completion in one flow-matching step: structured source discrete diffusion (S$^2$D$^2$). S$^2$D$^2$ improves the mIoU of SGSC's own output and every external SSC base tested, without base retraining or test-time adaptation. On the strongest base, one step without test-time augmentation reaches 38.8% mIoU on the SemanticKITTI hidden test. To our knowledge that is the best causal, single-sweep, single-sample result on that leaderboard, +2.1 pp over the previous best published score under the same restriction. Four correction steps with eight-view test-time augmentation reach 39.2%, outside that restriction.