GenRec: Knowing Where to Reconstruct and Where to Generate

📄 arXiv: 2608.17832v1 📥 PDF

作者: Ata Çelen, Jaewoo Jung, Federico Tombari, Marc Pollefeys, Sunghwan Hong, Michael Niemeyer, Daniel Barath

分类: cs.CV

发布日期: 2026-08-18


💡 一句话要点

提出GenRec以解决稀疏输入图像的生成与重建问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 生成性合成 多视图流匹配 深度估计 图像重建 计算机视觉 虚拟现实 增强现实

📋 核心要点

  1. 现有生成性新视角合成方法将重建与生成混合,导致几何保真度与创造性幻觉之间的界限模糊。
  2. 本文提出GenRec,通过多视图流匹配模型实现重建与生成的分离,利用观察掩码和单目深度估计器进行指导。
  3. 在多个数据集上,GenRec在观察区域的重建保真度和未观察区域的感知质量均表现优异,显示出显著的提升。

📝 摘要(中文)

生成性新视角合成从稀疏输入图像中提取信息时,通常既涉及重建又涉及生成。现有方法将这两者混合在一个统一的损失函数下,模糊了几何保真度与创造性幻觉之间的界限。本文提出GenRec,一个多视图流匹配模型,直接在其架构、监督和梯度流中构建重建与生成的分离。通过源相机导出的观察掩码和单目深度估计器,流匹配主干共同去噪RGB和场景坐标图,同时像素空间细化阶段恢复观察像素的高频细节。实验结果表明,GenRec在RealEstate10K、DL3DV-10K和Mip-NeRF~360数据集上,在观察区域实现了最佳重建保真度,并在未观察区域的感知质量上超越了纯生成基线,展示了该方法的有效性。

🔬 方法详解

问题定义:本文旨在解决生成性新视角合成中重建与生成的混合问题。现有方法在处理稀疏输入图像时,未能有效区分几何信息与生成信息,导致输出质量下降。

核心思路:GenRec通过构建一个多视图流匹配模型,直接在架构中实现重建与生成的分离。该方法利用观察掩码和单目深度估计器来指导模型,确保重建区域的几何保真度。

技术框架:GenRec的整体架构包括流匹配主干和像素空间细化阶段。流匹配主干负责在所有目标视图中共同去噪RGB和场景坐标图,而细化阶段则专注于恢复观察像素的高频细节。

关键创新:GenRec的主要创新在于其将重建与生成的分离直接融入模型设计中,通过观察掩码来防止回归信号污染生成先验,这一设计与现有方法形成了本质区别。

关键设计:在关键设计方面,GenRec采用了观察掩码来指导监督信号,并结合单目深度估计器以增强模型的重建能力。损失函数的设计也考虑了重建与生成的不同需求,确保模型在不同区域的表现最优。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在RealEstate10K、DL3DV-10K和Mip-NeRF~360数据集上,GenRec在观察区域实现了最佳重建保真度,并在未观察区域的感知质量上超越了纯生成基线,显示出显著的性能提升,具体表现为在单视图外推和双视图插值任务中的优越性。

🎯 应用场景

GenRec的研究成果在虚拟现实、增强现实和计算机图形学等领域具有广泛的应用潜力。通过提高稀疏输入图像的生成与重建质量,该方法可以用于创建更真实的三维场景重建,提升用户体验。此外,该技术在自动驾驶、机器人视觉等领域也可能发挥重要作用,推动相关技术的发展。

📄 摘要(原文)

Generative novel view synthesis from sparse input images is rarely all reconstruction or all generation: pixels visible in some source view have a unique correct value modulated only by view-dependent shading, while pixels in disocclusions or beyond the captured volume admit a distribution of plausible completions. Existing generative novel-view-synthesis methods conflate these regimes under a single uniform loss, blurring the line between geometric fidelity and creative hallucinations even when scene geometry is injected through warped point clouds or projected depth. We introduce GenRec, a multi-view flow matching model that builds the reconstruction--generation split directly into its architecture, supervision, and gradient flow. Guided by an observation mask derived from the source cameras and a monocular depth estimator, a flow matching backbone jointly denoises RGB and scene-coordinate maps across all target views, while a pixel-space refinement stage restores high-frequency detail on observed pixels; the same mask gates supervision so regression signals do not contaminate the generative prior. Across RealEstate10K, DL3DV-10K, and Mip-NeRF~360, in both single-view extrapolation and two-view interpolation, GenRec attains the best reconstruction fidelity in observed regions while also surpassing purely generative baselines on perceptual quality in unobserved ones, showing the effectiveness of our approach.