FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors
作者: Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan
分类: cs.CV
发布日期: 2026-08-24
备注: Appearing in ECCV 2026. Project page: https://fix-anything.github.io
💡 一句话要点
提出FixAnything以解决3D渲染伪影问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D渲染 生成模型 视频生成 渲染伪影 计算机视觉 深度学习 模型微调
📋 核心要点
- 现有的3D渲染方法在输入视图稀疏或目标视图远离输入时容易产生伪影,影响渲染质量。
- FixAnything通过重新利用预训练的视频生成模型,利用其隐式多视图先验,进行轻量级微调以修复渲染伪影。
- 在四种不同的3D表示中,FixAnything显著提高了渲染质量,证明了其作为通用修复工具的有效性。
📝 摘要(中文)
在使用3D场景表示(如高斯散点、神经辐射场、网格或点云)进行渲染时,稀疏输入视图或目标视图远离输入时会产生伪影。尽管近期研究通过基于扩散的生成先验来缓解这些伪影,但这些方法通常专门针对单一表示,且需要定制架构或大量重训练。本文提出FixAnything,通过重新利用预训练的视频生成模型,利用其隐式多视图先验,仅需最小修改和轻量微调即可修复多种渲染伪影。我们的关键见解是,即使是噪声渲染序列也能保留相机运动和粗略场景结构,从而将清理过程形式化为视频到视频的转换。为控制保留的场景结构,我们引入了一个二进制掩码,标记干净像素,使模型能够将输出锚定到高质量输入(如训练视图),同时优化其他部分。为了鼓励FixAnything生成支持下游重建的3D一致性渲染,我们使用相机姿态精度作为直接偏好优化的奖励信号。在四种不同的3D表示中,FixAnything通过轻量微调持续改善渲染质量,证明了单一通用视频先验可以替代多个专用的修复管道。该框架的简单性使得未来更强的视频模型能够立即采用,而无需重新设计架构。
🔬 方法详解
问题定义:本文旨在解决3D渲染中的伪影问题,现有方法在处理稀疏输入或远离输入的目标视图时效果不佳,导致渲染质量下降。
核心思路:FixAnything的核心思路是利用预训练的视频生成模型,通过最小修改和轻量微调,利用其隐式多视图先验来修复渲染伪影。该方法将清理过程视为视频到视频的转换,能够有效利用噪声渲染序列中的相机运动和场景结构信息。
技术框架:FixAnything的整体架构包括输入的渲染序列、二进制掩码用于标记干净像素、以及基于相机姿态精度的奖励信号。模型通过微调来优化输出,确保生成的渲染在3D空间中保持一致性。
关键创新:FixAnything的主要创新在于将视频生成模型应用于3D渲染伪影修复,打破了传统方法对特定表示的依赖,展示了通用性和灵活性。
关键设计:在设计中,使用了二进制掩码来指示需要保留的干净像素,并通过结构从运动恢复的相机姿态精度作为奖励信号,优化了模型的输出质量。
🖼️ 关键图片
📊 实验亮点
在四种不同的3D表示中,FixAnything通过轻量微调显著提高了渲染质量,证明其有效性。与传统方法相比,FixAnything能够在不需要重训练的情况下,利用单一模型修复多种渲染伪影,展现出更高的通用性和效率。
🎯 应用场景
FixAnything的研究成果在计算机视觉、虚拟现实和增强现实等领域具有广泛的应用潜力。通过提高3D渲染的质量,该方法能够改善用户体验,推动相关技术的发展,尤其是在需要高质量视觉效果的场景中,如游戏、影视制作和模拟训练等。
📄 摘要(原文)
Rendering views using 3D scene representations such as Gaussian Splatting (3DGS), Neural Radiance Fields (NeRF), meshes, or even point clouds produces artifacts when input views are sparse or target views lie far from the input. Recent work mitigates these artifacts using diffusion-based generative priors, but is specialized to individual representations and require custom architectures or extensive retraining. We present FixAnything, a single model for fixing a wide range of rendering artifacts. It does so by repurposing a pretrained video generative model, leveraging its implicit multi-view priors with only minimal modification and lightweight finetuning. Our key insight is that even noisily-rendered sequences preserve camera motion and coarse scene structure, allowing cleanup to be formulated as video-to-video translation. To control what scene structure should be preserved, we introduce a binary mask denoting the clean pixels, enabling the model to anchor its output to high-quality inputs (e.g. training views) while refining the rest. To encourage FixAnything to produce 3D-consistent renderings that support downstream reconstruction, we use camera pose accuracy (recovered via structure-from-motion) as a reward signal for direct preference optimization (DPO). Across four distinct 3D representations, FixAnything consistently improves rendering quality with lightweight finetuning, demonstrating that a single generalist video prior can replace multiple specialist refinement pipelines. The simplicity of the framework enables immediate adoption of stronger future video models without architectural redesign.