Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation
作者: Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang
分类: cs.CV
发布日期: 2026-08-11
备注: 15 pages,6 figures
💡 一句话要点
提出Stream Forcing以解决流媒体视频生成中的训练与推理不一致问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 流媒体视频生成 视频扩散模型 训练与推理一致性 随机过程 联合校准算法 时间相关性 生成质量提升
📋 核心要点
- 现有流媒体视频生成模型在训练与推理过程中存在不一致性,导致生成质量下降。
- 本文提出Stream Forcing框架,通过构建连续训练轨迹来解决训练覆盖与推理效率之间的矛盾。
- 实验结果显示,Stream Forcing在UCF-101基准上实现了36.6%的FVD提升,并在长时间视频生成中实现27.9%的FVD提升。
📝 摘要(中文)
流媒体视频生成在世界建模中具有重要潜力,但现有的流媒体视频扩散模型存在训练与推理不一致的问题。推理过程遵循特定的去噪顺序,而训练策略通常需要多样的噪声水平配置。为了解决这一矛盾,本文将视频扩散采样重新定义为噪声水平上的帧索引随机过程,并构建了一个连续的训练轨迹,使得采样调度从独立采样逐步演变为推理一致的采样。此外,提出了联合校准算法和时间相关采样算法,以确保轨迹的平滑性和跨帧相关性。实验结果表明,Stream Forcing在UCF-101基准上显著提高了生成质量,FVD提升达36.6%。
🔬 方法详解
问题定义:本文旨在解决流媒体视频生成中的训练与推理不一致问题。现有方法在推理时遵循特定的去噪顺序,而训练通常需要多样的噪声水平配置,导致生成质量下降。
核心思路:论文通过将视频扩散采样重新定义为帧索引随机过程,构建连续的训练轨迹,使得采样调度从独立采样逐步演变为推理一致的采样,从而实现训练与推理的一致性。
技术框架:整体架构包括两个主要模块:一是构建帧索引随机过程以定义采样调度,二是引入联合校准算法和时间相关采样算法以确保轨迹的平滑性和跨帧相关性。
关键创新:最重要的创新在于提出了Stream Forcing框架,通过连续训练轨迹的构建,解决了训练覆盖与推理效率之间的矛盾,与现有方法相比,显著提高了生成质量。
关键设计:在参数设置上,采用了动态噪声水平配置,并设计了适应性损失函数以优化生成效果。网络结构方面,结合了时间相关性和帧间平滑性,确保生成视频的连贯性和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,Stream Forcing在UCF-101基准上实现了36.6%的FVD提升,显著提高了生成质量。此外,在长时间视频生成任务中,FVD提升达27.9%,展示了该方法在零-shot外推方面的强大能力。
🎯 应用场景
该研究在流媒体视频生成领域具有广泛的应用潜力,能够用于视频监控、自动驾驶、虚拟现实等场景。通过提高生成视频的质量和连贯性,Stream Forcing框架可以为实时视频生成提供更可靠的解决方案,推动相关技术的发展。
📄 摘要(原文)
Streaming video generation holds strong potential for world modeling, where future frames must be inferred online sequentially to form a continuous video stream. However, streaming video diffusion models introduce a fundamental train-inference mismatch: inference follows a specialized denoising order, whereas advanced training strategies typically require diverse noise-level configurations. To address this trade-off between train-inference consistency and training coverage, we reformulate the video diffusion sampling as a frame-indexed stochastic process over noise levels. Within this stochastic process space, we construct a continuous training trajectory along which the sampling schedule progressively evolves from independent sampling to inference-consistent sampling. We further introduce a joint calibration algorithm and a temporal correlative sampling algorithm to ensure trajectory smoothness and cross-frame correlation. Building on these designs, we propose Stream Forcing, a unified training framework for streaming video generation that balances training sufficiency and inference efficiency. Extensive experiments demonstrate that Stream Forcing significantly improves generation quality with a 36.6% FVD improvement on the UCF-101 benchmark. Furthermore, our method facilitates robust zero-shot extrapolation to long-horizon video generation with a 27.9% FVD improvement on the UCF-101 benchmark.