Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations

📄 arXiv: 2609.03657v1 📥 PDF

作者: Onat Şahin, Mohammad Altillawi, George Eskandar, Carlos Carbone, Ziyuan Liu

分类: cs.CV

发布日期: 2026-09-03


💡 一句话要点

提出3D形态扰动以解决稀疏视图下3D场景重建问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D场景重建 形态扰动 空间一致性 机器人操作 深度学习

📋 核心要点

  1. 现有的3D场景表示方法在稀疏视图条件下容易产生伪影,影响重建质量。
  2. 本文提出3D形态扰动作为一种无优化的正则化方法,旨在保持视图间的空间一致性。
  3. 实验结果表明,该方法在多个操作任务中提高了机器人策略成功率,平均深度误差降低了12.5%。

📝 摘要(中文)

3D场景表示如NeRF和3D高斯散点(3DGS)在稀疏视图设置中存在严重伪影。现有的3D伪影修复方法依赖于成对的损坏和清晰渲染,需进行昂贵的逐场景重建。本文提出3D形态扰动作为一种无优化的正则化方法,能够保持视图间的空间一致性。通过显式的3DGS,我们将每个高斯视为基本构建块,并在其形态参数空间中进行扰动。该方法消除了逐场景3DGS优化循环,同时在轻量级视频扩散沙箱中使模型学习到比稀疏视图基线更强的几何先验。最终,该方法在14B参数的视频模型中实现了视觉保真度的保持,并将平均深度误差降低了12.5%。

🔬 方法详解

问题定义:本文旨在解决在稀疏视图条件下3D场景重建中出现的伪影问题。现有方法依赖于成对的损坏和清晰渲染,导致需要昂贵的逐场景重建过程,效率低下。

核心思路:论文提出3D形态扰动作为一种无优化的正则化手段,通过对3DGS中的每个高斯进行扰动,保持视图间的空间一致性。这种设计旨在消除对逐场景优化的依赖,从而提高训练效率。

技术框架:整体架构包括三个主要模块:首先是3DGS的显式表示,其次是形态参数空间的扰动,最后是基于这些扰动进行的模型训练。通过这种方式,模型能够在不进行逐场景优化的情况下学习更强的几何先验。

关键创新:该方法的核心创新在于引入了3D形态扰动,作为一种新的正则化手段,与传统的2D图像增强方法相对应。这一创新使得3D表示能够在稀疏视图条件下保持空间一致性,显著提升了模型的表现。

关键设计:在技术细节上,论文对高斯的形态参数进行了精细的设置,包括尺度、旋转和修剪等操作。这些设计使得扰动能够有效地覆盖形态参数空间,从而增强模型的学习能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,本文方法在14B参数的视频模型中实现了视觉保真度的保持,并将平均深度误差降低了12.5%。此外,该方法在4个操作任务中提高了机器人策略成功率,最高提升幅度达到8.0%。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、虚拟现实和增强现实等。通过提高3D场景重建的质量和效率,该方法能够在实际应用中提升机器人在复杂环境中的操作能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

3D scene representations like NeRF and 3D Gaussian Splatting (3DGS) suffer severe artifacts in sparse-view settings. Recent generative 3D artifact fixers attempt to address this, but rely on paired corrupted and clean renders requiring costly, per-scene reconstructions across varying view configurations. While 2D image augmentations act as instant regularizers, no explicit equivalents exist for 3D representations to preserve spatial consistency across views, an essential property for 3D-aware training. We propose 3D Morphological Perturbations as an optimization-free regularizer that preserves spatial consistency. Leveraging explicit 3DGS, we treat each Gaussian as a fundamental building block - analogous to a 2D pixel - and apply perturbations across its morphological parameter space via scale, rotation, and pruning. Our method eliminates per-scene 3DGS optimization loops from dataset curation while enabling models to learn stronger geometric priors than sparse-view baselines in diagnostic ablations conducted on a lightweight video diffusion sandbox. Scaled to a 14B-parameter video model via ControlNet, our approach maintains visual fidelity while reducing mean depth error by 12.5% over state-of-the-art image-to-image 3D artifact refiners, ultimately boosting downstream robotics policy success rates by up to 8.0% across 3 of 4 manipulation tasks.