FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow
作者: Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung
分类: cs.CV
发布日期: 2026-09-03
备注: Project page: https://byeongjun-park.github.io/FlashRender/
💡 一句话要点
提出FlashRender以解决多步生成渲染中的离散化误差问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting)
关键词: 生成渲染 视频处理 离散化误差 几何一致性 相机控制 蒸馏训练 计算机视觉
📋 核心要点
- 现有的多步生成渲染模型在相机控制上存在离散化误差,导致去噪轨迹曲率过高,影响渲染质量。
- 本文提出了表示变换与对齐(RETA)方法,通过对齐源视频与目标视频特征,解决了相机控制的一致性问题。
- 实验结果表明,FlashRender在视频质量和几何一致性上与多步基线相当,但采样成本降低了25倍,同时在相机可控性上表现优越。
📝 摘要(中文)
我们提出了FlashRender,一个几步生成渲染框架,可以在几秒钟内沿目标相机轨迹重新拍摄源视频。我们识别出采样步依赖的相机控制是现有多步生成渲染模型中离散化误差的显著表现,并展示了解决这一不一致性显著降低去噪轨迹曲率,从而促进后续步骤的蒸馏。为此,我们引入了表示变换与对齐(RETA),将隐藏的源视频表示与来自冻结视觉几何模型的目标视频特征对齐。这直接编码了源视频流中的几何变换,使得相机控制在采样步上保持一致。随后,我们在RETA诱导的低曲率去噪轨迹上使用均流目标对模型进行微调,使模型更有效地解决离散化误差。最后,我们应用在线流图蒸馏来纠正固定少步采样下的自回归错误。大量实验表明,RETA、均流和在线流图蒸馏在几步生成渲染中发挥了互补作用。
🔬 方法详解
问题定义:本文旨在解决现有多步生成渲染模型中相机控制的离散化误差问题。现有方法在不同采样步之间存在不一致性,导致去噪轨迹曲率过高,影响最终渲染效果。
核心思路:我们提出了表示变换与对齐(RETA)方法,通过将源视频的隐藏表示与目标视频特征对齐,直接编码几何变换,从而实现采样步一致的相机控制。
技术框架:整体架构包括三个主要模块:RETA用于对齐表示,均流目标用于微调模型,以及在线流图蒸馏用于纠正自回归错误。这些模块协同工作以降低离散化误差。
关键创新:最重要的创新在于RETA的引入,它有效解决了相机控制的不一致性问题,显著降低了去噪轨迹的曲率,与现有方法相比,提供了更高的几何一致性和视频质量。
关键设计:在模型训练中,我们采用了均流目标作为损失函数,优化低曲率去噪轨迹。此外,在线流图蒸馏技术用于修正固定少步采样下的自回归错误,确保模型在不同条件下的稳定性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,FlashRender在视频质量和几何一致性方面与多步基线相当,但其采样成本降低了25倍。此外,模型在面对超出分布的目标相机轨迹时,仍能保持优越的相机可控性,展示了其在实际应用中的潜力。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉中的视频生成、虚拟现实和增强现实等场景。FlashRender能够在短时间内生成高质量视频,具有广泛的实际价值,尤其是在需要快速渲染和高相机可控性的应用中。未来,该技术可能推动实时视频处理和生成领域的发展。
📄 摘要(原文)
We present FlashRender, a few-step generative rendering framework that retakes a source video along a target camera trajectory in seconds. We identify sampling-step-dependent camera control as a prominent manifestation of discretization error in existing multi-step generative rendering models and show that resolving this inconsistency substantially lowers denoising trajectory curvature, facilitating subsequent step distillation. To this end, we introduce Representation Transformation and Alignment (RETA), which aligns hidden source-video representations with target-video features from a frozen visual geometry model. This directly encodes the geometric transformation within the source-video stream, enabling sampling-step-consistent camera control. We then fine-tune the model with the MeanFlow objective on the lower-curvature denoising trajectory induced by RETA, allowing the model to more effectively address discretization error. Finally, we apply on-policy flow map distillation to correct self-rollout errors under fixed few-step sampling. Extensive experiments show that RETA, MeanFlow, and on-policy flow map distillation play complementary roles in few-step generative rendering. Together, they enable our approach to match multi-step baselines in video quality and geometric consistency at 25x lower sampling cost while achieving superior camera controllability, even under out-of-distribution target camera trajectories.