Stabilizing Camera-Controlled Novel View Synthesis at Inference Time
作者: Prajwal Singh, Arjun Badola, Seema Kumari, Hajime Nagahara, Shanmuganathan Raman
分类: cs.CV
发布日期: 2026-09-03
💡 一句话要点
提出CamTrol++以解决相机控制的新视图合成不稳定问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting)
关键词: 新视图合成 相机控制 几何一致性 3D重建 深度学习
📋 核心要点
- 现有基于相机控制的新视图合成方法在大幅相机运动和长时间生成时表现不稳定,影响生成质量。
- 本文提出将相机运动分解为小的自回归步骤,以限制几何失真并减少误差累积,从而提升稳定性。
- 实验结果表明,CamTrol++在多个数据集上显著提高了时间和几何一致性,以及3D重建质量和生成效率。
📝 摘要(中文)
在推断时,基于相机控制的单图像新视图合成常因大幅相机运动和长生成时间而不稳定。现有方法通常结合多个推断时组件,使得不清楚哪些设计选择对稳定性最为重要。本文表明,稳定性的主要来源是简单的。通过将相机运动分解为小的自回归步骤,限制每步几何失真并减少误差累积。控制相机步骤的研究表明,小运动下性能稳定,而当每步运动接近18-20度时,性能显著下降。我们进一步评估了几何约束的空间注意力和低频外观锚定作为支持性改进,结合高效的无注册变形管道。在RealEstate10K和MegaScene数据集上,CamTrol++在时间和几何一致性、下游3D重建质量和生成效率上优于无训练基线。该方法在56帧生成和显著的深度损坏下仍然有效,表明在推断时仔细控制相机运动可以显著提高相机控制的新视图合成的稳定性,而无需重新训练或修改扩散骨干网络。
🔬 方法详解
问题定义:本文旨在解决基于相机控制的新视图合成在推断时因大幅相机运动而导致的不稳定性。现有方法通常依赖多个推断组件,导致不清晰的设计选择影响稳定性。
核心思路:论文的核心思路是将相机运动分解为小的自回归步骤,这样可以有效限制每一步的几何失真,并减少误差的累积,从而提高生成过程的稳定性。
技术框架:整体架构包括相机运动控制、几何约束空间注意力、低频外观锚定和高效的无注册变形管道。通过这些模块的协同作用,提升了生成的稳定性和质量。
关键创新:最重要的技术创新在于提出了小步长的自回归相机运动控制策略,这一设计与现有方法的本质区别在于其对运动步长的严格控制,从而有效减少了生成过程中的几何失真。
关键设计:在参数设置上,控制每步运动不超过18-20度,并结合几何约束的空间注意力机制和低频外观锚定,以增强生成的稳定性和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CamTrol++在RealEstate10K和MegaScene数据集上,相比于无训练基线,显著提高了时间和几何一致性,3D重建质量和生成效率均有明显提升,尤其在56帧生成和深度损坏情况下表现优异。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、增强现实以及影视制作等场景,能够在这些领域中实现更高质量的图像生成和3D重建。通过提升相机控制的新视图合成的稳定性,未来可能推动相关技术的广泛应用和发展。
📄 摘要(原文)
Training-free, camera-controlled novel view synthesis from a single image using pre-trained video diffusion models often becomes unstable under large camera motion and long generation horizons. Existing approaches commonly combine several inference-time components, making it unclear which design choices are most important for stability. We show that the main source of stability is simple. Decomposing camera motion into small autoregressive steps limits per-step geometric distortion and reduces error accumulation. A controlled camera-step study shows that performance remains stable for small motions and degrades more strongly as the per-step motion approaches $18$-$20^\circ$. We further evaluate geometry-constrained spatial attention and low-frequency appearance anchoring as supporting refinements, together with an efficient registration-free warping pipeline. Across RealEstate10K and MegaScene, CamTrol++ improves temporal and geometric consistency, downstream 3D reconstruction quality, and generation efficiency over training-free baselines. The method remains effective for 56-frame generation and under substantial controlled depth corruption. These results show that careful control of camera motion at inference time can substantially improve the stability of camera-controlled novel view synthesis without retraining or modifying the diffusion backbone.