SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis
作者: Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala
分类: cs.CV
发布日期: 2026-08-17
💡 一句话要点
提出SplatGuide以解决无姿态图像的视角合成问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 无姿态合成 3D几何理解 视角合成 多视图重建 深度学习
📋 核心要点
- 现有方法在生成无姿态图像的新视角时,无法充分利用重建过程中的几何和可见性信息,导致信息断裂。
- SplatGuide通过将单一的3D几何场景重用为三种互补角色,结合几何条件、可见性选择和特征指导,解决了这一问题。
- 在多个数据集上,SplatGuide在无姿态新视角合成方面达到了最先进的性能,尤其在输入视图数量适中的情况下超越了真实姿态基线。
📝 摘要(中文)
生成逼真的新视角图像需要对3D几何的理解和合成未见内容的能力。现有方法在重建过程中通常只能提取单一信号,未能充分利用可见性信息。SplatGuide通过重用单一的3D几何场景,结合像素对齐的几何条件、可见性线索和特征级指导,成功解决了这一信息断裂问题。在多个数据集上,SplatGuide实现了无姿态新视角合成的最先进性能,尤其在RealEstate10K数据集中超越了真实姿态基线。
🔬 方法详解
问题定义:论文旨在解决从无姿态图像生成新视角图像的挑战。现有方法通常只能提取单一信号,未能充分利用可见性信息,导致信息断裂。
核心思路:SplatGuide的核心思路是重用单一的3D几何场景,通过三种互补角色来整合几何条件、可见性线索和特征指导,从而实现更高效的视角合成。
技术框架:整体架构包括三个主要模块:1) 渲染图像提供像素对齐的几何条件;2) 每个高斯源视图索引被渲染为目标视图投票图,用于考虑遮挡的参考选择;3) 重建令牌通过交叉注意力提供特征级指导。所有信号均来自同一重建前向传递。
关键创新:SplatGuide的主要创新在于同时利用几何、可见性和特征信息,解决了现有方法中信息断裂的问题。这种多信号整合的方式显著提升了合成质量。
关键设计:在设计中,采用了特定的损失函数以平衡不同信号的贡献,同时在网络结构中引入了交叉注意力机制,以增强特征的相关性和可见性信息的利用。
🖼️ 关键图片
📊 实验亮点
在多个数据集上,SplatGuide实现了无姿态新视角合成的最先进性能。在RealEstate10K数据集中,使用适量的输入视图时,其性能超越了真实姿态基线,展示了显著的提升效果。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、增强现实和游戏开发等领域,能够为用户提供更真实的视觉体验。未来,SplatGuide可能在自动驾驶、机器人视觉等需要高质量视角合成的领域发挥重要作用。
📄 摘要(原文)
Generating photorealistic novel views from unposed images requires both 3D geometric understanding and the ability to synthesize unseen content. A natural strategy combines feed-forward 3DGS reconstruction with multi-view diffusion. Yet prior pipelines extract at most one signal from the reconstruction, either pixel rendering or learned features, while none exploits per-Gaussian visibility for occlusion-aware reference selection. This information disconnect leaves renderable geometry, visibility cues, and learned features unused. SplatGuide closes this disconnect by reusing a single 3DGS scene across three complementary roles. Rendered images provide pixel-aligned geometric conditioning. Per-Gaussian source-view indices are rendered into a target-view voting map for occlusion-aware reference selection. Reconstruction tokens supply feature-level guidance via cross-attention. All three signals derive from the same reconstruction forward pass. Across RealEstate10K, DL3DV, Tanks-and-Temples, and Mip-NeRF 360, SplatGuide achieves state-of-the-art pose-free novel view synthesis. On RealEstate10K, with a moderate number of input views, it surpasses the ground-truth-pose baseline.