LiveVVT: High-Fidelity Video Virtual Try-On in Real Time
作者: Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing
分类: cs.CV, cs.AI
发布日期: 2026-08-27
备注: 16 pages, 13 figures,
💡 一句话要点
提出LiveVVT以解决视频虚拟试穿中的延迟和计算开销问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视频虚拟试穿 扩散模型 因果生成 实时处理 长序列建模
📋 核心要点
- 现有的扩散基础视频虚拟试穿方法在延迟和计算开销上存在显著问题,影响了实时应用的可行性。
- LiveVVT通过引入滚动流扩散框架,在因果递归生成中保持双向建模,解决了延迟和质量下降的问题。
- 实验结果显示,LiveVVT在生成质量上优于同规模模型,并且在延迟和吞吐量上有显著提升。
📝 摘要(中文)
基于扩散的视频虚拟试穿(VVT)通过双向时空建模实现了高视觉保真度,但完整片段的依赖导致在实际连续部署中产生了巨大的延迟和计算开销。简单地强制因果关系会破坏预训练的双向先验,并显著降低合成质量。我们提出了LiveVVT,一个滚动流扩散框架,在因果递归生成中保持有界的双向建模。在固定大小的窗口内,LiveVVT在有界前瞻下联合去噪多个视频块,同时每次迭代输出一个干净的块。超出窗口的部分,两个互补的记忆保持长期一致性:有界时间记忆传播最近的动态和遮挡上下文,而持久的全局外观记忆则从目标服装和正面试穿关键帧构建,贯穿整个流保持服装细节和穿着外观。实验表明,在配对和非配对的长序列基准上,生成质量优于同等规模的模型,延迟降低了26倍,吞吐量提高了11倍,实现了高保真的实时流视频虚拟试穿。
🔬 方法详解
问题定义:本论文旨在解决现有视频虚拟试穿方法在实时应用中面临的延迟和计算开销问题。现有方法依赖完整片段,导致性能瓶颈。
核心思路:LiveVVT的核心思路是引入滚动流扩散框架,在因果递归生成中保持有界的双向建模,从而在保证生成质量的同时降低延迟。
技术框架:LiveVVT的整体架构包括固定大小的窗口用于联合去噪多个视频块,以及两个互补的记忆模块:有界时间记忆和持久全局外观记忆,分别用于传播动态和保持服装细节。
关键创新:最重要的技术创新在于通过滚动流扩散实现了因果生成中的双向建模,避免了传统方法中因果强制导致的质量下降。
关键设计:关键设计包括固定窗口的大小设置、去噪算法的选择、以及如何构建和更新时间记忆和全局外观记忆,以确保生成过程的高效性和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,LiveVVT在生成质量上优于同规模的模型,延迟降低了26倍,吞吐量提高了11倍。这些显著的性能提升使得高保真实时视频虚拟试穿成为可能,具有重要的应用价值。
🎯 应用场景
该研究的潜在应用场景包括在线服装试穿、虚拟时装秀以及增强现实购物体验等。通过实现高保真的实时视频虚拟试穿,LiveVVT能够显著提升用户体验,推动电商和时尚行业的数字化转型。
📄 摘要(原文)
Diffusion-based Video Virtual Try-On (VVT) achieves high visual fidelity through bidirectional spatio-temporal modeling, but complete-clip dependence incurs prohibitive latency and computational overhead in practical continuous deployment. Naively enforcing causality disrupts pretrained bidirectional priors and substantially degrades synthesis quality. We introduce LiveVVT, a rolling streaming diffusion framework that preserves bounded bidirectional modeling within causal recurrent generation. Within a fixed-size window, LiveVVT jointly denoises multiple video chunks under bounded look-ahead, preserving local bidirectional interactions while emitting one clean chunk per iteration. Beyond the window, two complementary memories sustain long-term consistency: a bounded temporal memory propagates recent dynamics and occlusion context, whereas a persistent global appearance memory, constructed once from the target garment and a frontal try-on keyframe, anchors garment details and dressed appearance throughout the stream. We further introduce a progressive distillation framework integrating bidirectional VVT learning, teacher-trajectory regression for causal few-step adaptation, and Collaborative Matching Distillation, which couples teacher-distribution matching with rolling flow matching on real videos to align optimization with recurrent inference. Experiments on paired and unpaired long-sequence benchmarks demonstrate superior generation quality over similarly sized models, with $26\times$ lower latency and $11\times$ higher throughput, enabling high-fidelity real-time streaming VVT.