GenRec: Knowing Where to Reconstruct and Where to Generate
作者: Ata Çelen, Jaewoo Jung, Federico Tombari, Marc Pollefeys, Sunghwan Hong, Michael Niemeyer, Daniel Barath
分类: cs.CV
发布日期: 2026-08-18
💡 一句话要点
提出GenRec以解决稀疏输入图像的生成与重建问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 生成性合成 多视图流匹配 深度估计 图像重建 计算机视觉 虚拟现实 增强现实
📋 核心要点
- 现有生成性新视角合成方法将重建与生成混合,导致几何保真度与创造性幻觉之间的界限模糊。
- 本文提出GenRec,通过多视图流匹配模型实现重建与生成的分离,利用观察掩码和单目深度估计器进行指导。
- 在多个数据集上,GenRec在观察区域的重建保真度和未观察区域的感知质量均表现优异,显示出显著的提升。
📝 摘要(中文)
生成性新视角合成从稀疏输入图像中提取信息时,通常既涉及重建又涉及生成。现有方法将这两者混合在一个统一的损失函数下,模糊了几何保真度与创造性幻觉之间的界限。本文提出GenRec,一个多视图流匹配模型,直接在其架构、监督和梯度流中构建重建与生成的分离。通过源相机导出的观察掩码和单目深度估计器,流匹配主干共同去噪RGB和场景坐标图,同时像素空间细化阶段恢复观察像素的高频细节。实验结果表明,GenRec在RealEstate10K、DL3DV-10K和Mip-NeRF~360数据集上,在观察区域实现了最佳重建保真度,并在未观察区域的感知质量上超越了纯生成基线,展示了该方法的有效性。
🔬 方法详解
问题定义:本文旨在解决生成性新视角合成中重建与生成的混合问题。现有方法在处理稀疏输入图像时,未能有效区分几何信息与生成信息,导致输出质量下降。
核心思路:GenRec通过构建一个多视图流匹配模型,直接在架构中实现重建与生成的分离。该方法利用观察掩码和单目深度估计器来指导模型,确保重建区域的几何保真度。
技术框架:GenRec的整体架构包括流匹配主干和像素空间细化阶段。流匹配主干负责在所有目标视图中共同去噪RGB和场景坐标图,而细化阶段则专注于恢复观察像素的高频细节。
关键创新:GenRec的主要创新在于其将重建与生成的分离直接融入模型设计中,通过观察掩码来防止回归信号污染生成先验,这一设计与现有方法形成了本质区别。
关键设计:在关键设计方面,GenRec采用了观察掩码来指导监督信号,并结合单目深度估计器以增强模型的重建能力。损失函数的设计也考虑了重建与生成的不同需求,确保模型在不同区域的表现最优。
🖼️ 关键图片
📊 实验亮点
在RealEstate10K、DL3DV-10K和Mip-NeRF~360数据集上,GenRec在观察区域实现了最佳重建保真度,并在未观察区域的感知质量上超越了纯生成基线,显示出显著的性能提升,具体表现为在单视图外推和双视图插值任务中的优越性。
🎯 应用场景
GenRec的研究成果在虚拟现实、增强现实和计算机图形学等领域具有广泛的应用潜力。通过提高稀疏输入图像的生成与重建质量,该方法可以用于创建更真实的三维场景重建,提升用户体验。此外,该技术在自动驾驶、机器人视觉等领域也可能发挥重要作用,推动相关技术的发展。
📄 摘要(原文)
Generative novel view synthesis from sparse input images is rarely all reconstruction or all generation: pixels visible in some source view have a unique correct value modulated only by view-dependent shading, while pixels in disocclusions or beyond the captured volume admit a distribution of plausible completions. Existing generative novel-view-synthesis methods conflate these regimes under a single uniform loss, blurring the line between geometric fidelity and creative hallucinations even when scene geometry is injected through warped point clouds or projected depth. We introduce GenRec, a multi-view flow matching model that builds the reconstruction--generation split directly into its architecture, supervision, and gradient flow. Guided by an observation mask derived from the source cameras and a monocular depth estimator, a flow matching backbone jointly denoises RGB and scene-coordinate maps across all target views, while a pixel-space refinement stage restores high-frequency detail on observed pixels; the same mask gates supervision so regression signals do not contaminate the generative prior. Across RealEstate10K, DL3DV-10K, and Mip-NeRF~360, in both single-view extrapolation and two-view interpolation, GenRec attains the best reconstruction fidelity in observed regions while also surpassing purely generative baselines on perceptual quality in unobserved ones, showing the effectiveness of our approach.