SiZeUp: Fast 3D Proxy from Aerial Images via Depth Ordinal Loss
作者: Wenjun Zhou, Yunshan Li, Qiaoyu Zhu, Weidan Xiong, Hao Zhang, Daniel Cohen-Or, Hui Huang
分类: cs.CV
发布日期: 2026-08-24
备注: Accepted to SIGGRAPH Asia 2026 Conference Papers
💡 一句话要点
提出SiZeUp以解决大规模城市3D建模问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 3D建模 城市建模 深度学习 航拍图像 优化算法 计算机视觉 机器学习
📋 核心要点
- 现有方法在从航拍图像构建3D城市模型时,面临速度慢和精度不足的挑战。
- 论文提出了一种基于高度-轮廓表示的优化方法,通过序深度一致性损失提高高度估计的准确性。
- 实验结果表明,SiZeUp在速度上比现有方法快23-52倍,同时保持了良好的模型覆盖率和一致性。
📝 摘要(中文)
我们提出了SiZeUp,一种快速且可扩展的方法,能够直接从校准的倾斜航拍图像构建大规模的3D城市代理模型。该方法采用基于建筑物轮廓的高度表示,将3D建筑抽象简化为一个低维优化问题,通过单一高度参数来挤出建筑物轮廓。为了实现高效且稳健的高度估计,我们引入了一种序深度一致性损失,确保渲染代理的相对深度顺序与单目深度模型预测的深度先验之间的一致性。通过可微渲染器将参数化建筑代理映射到多视图深度图像,实现了从深度监督到建筑高度的梯度传播。我们的序深度一致性损失在多个视图中提供了更可靠的信号,避免了对度量深度的依赖,从而在大规模城市建模任务中实现了23-52倍的速度提升,同时保持了相似的代理覆盖率和体积一致性。
🔬 方法详解
问题定义:本论文旨在解决从航拍图像快速构建大规模3D城市模型的问题。现有方法通常依赖于复杂的特征匹配和密集点云重建,导致速度慢且难以扩展。
核心思路:论文提出的SiZeUp方法通过高度-轮廓表示,将3D建筑建模简化为一个低维优化问题,利用序深度一致性损失来提高高度估计的稳健性。
技术框架:该方法的整体架构包括三个主要模块:首先是建筑物轮廓的提取,其次是通过可微渲染器生成多视图深度图像,最后是优化过程,通过序深度一致性损失进行高度调整。
关键创新:最重要的技术创新在于引入了序深度一致性损失,该损失函数通过相对深度的约束,避免了对度量深度的依赖,从而提高了模型的稳定性和准确性。
关键设计:在技术细节上,论文设计了一个可微渲染器,能够将参数化建筑代理映射到深度图像,并通过动态视图选择来优化计算效率。损失函数的设计确保了相对深度的一致性,增强了模型的鲁棒性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SiZeUp在速度上相比于现有的代理重建管道实现了23-52倍的加速,同时在代理覆盖率和体积一致性方面保持了相似的水平。这一显著的性能提升使得SiZeUp在大规模城市建模任务中具有重要的应用价值。
🎯 应用场景
SiZeUp方法在城市建模、城市规划和环境监测等领域具有广泛的应用潜力。其高效的建模能力能够支持实时数据处理和大规模城市信息系统的构建,推动智能城市的发展。未来,该方法还可能与其他数据源结合,进一步提升城市模型的精度和实用性。
📄 摘要(原文)
We present SiZeUp, a fast and scalable approach for constructing large-scale 3D urban proxy models directly from calibrated oblique aerial imagery. Our method adopts a height-from-footprint representation, reducing 3D building abstraction to a low-dimensional optimization problem in which building footprints are extruded by a single height parameter. To enable efficient and robust height estimation, we introduce an ordinal depth consistency loss that enforces agreement between the relative depth ordering of rendered proxies and depth priors predicted by a monocular depth model. This is realized through a differentiable renderer that maps parametric building proxies into multi-view depth images, allowing gradients to be propagated from depth supervision to building heights. Our ordinal formulation produces stable optimization in practice and avoids explicit feature matching or dense point cloud reconstruction. Rather than relying on metric depth, which can be unreliable under monocular scale ambiguity, our ordinal depth consistency loss operates on relative depths, providing a more reliable signal across views. Combined with an efficient dynamic view selection, our approach achieves a 23-52$\times$ speedup over state-of-the-art proxy reconstruction pipelines while maintaining comparable proxy-level coverage and volume consistency, making it well suited for large-scale urban modeling tasks.