LiveVVT: High-Fidelity Video Virtual Try-On in Real Time

📄 arXiv: 2608.26714v2 📥 PDF

作者: Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing

分类: cs.CV, cs.AI

发布日期: 2026-08-27 (更新: 2026-08-28)

备注: 16 pages, 13 figures,


💡 一句话要点

提出LiveVVT以解决视频虚拟试穿中的延迟和计算开销问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视频虚拟试穿 扩散模型 实时生成 因果推理 双向建模 长序列处理 蒸馏学习

📋 核心要点

  1. 现有的扩散视频虚拟试穿方法在实时应用中面临高延迟和计算开销的问题,影响用户体验。
  2. 论文提出的LiveVVT框架通过滚动流扩散方法,在因果生成中保持双向建模,显著提升了生成效率。
  3. 实验结果显示,LiveVVT在生成质量上优于同类模型,延迟降低26倍,吞吐量提升11倍,具备实时应用潜力。

📝 摘要(中文)

基于扩散的视频虚拟试穿(VVT)通过双向时空建模实现了高视觉保真度,但完整片段依赖导致在实际连续部署中产生了高延迟和计算开销。简单地强制因果关系会破坏预训练的双向先验,并显著降低合成质量。我们提出了LiveVVT,一个滚动流扩散框架,在因果递归生成中保持有界的双向建模。在固定大小的窗口内,LiveVVT在有界前瞻下联合去噪多个视频块,保留局部双向交互,同时每次迭代输出一个干净的块。超出窗口的部分,两个互补的记忆保持长期一致性:有界时间记忆传播最近的动态和遮挡上下文,而持久的全局外观记忆则锚定服装细节和穿着外观。实验表明,LiveVVT在生成质量上优于同类模型,延迟降低了26倍,吞吐量提高了11倍,支持高保真的实时流媒体VVT。

🔬 方法详解

问题定义:本论文旨在解决现有视频虚拟试穿方法在实时应用中因完整片段依赖导致的高延迟和计算开销问题。现有方法在强制因果关系时,往往会破坏预训练的双向先验,降低合成质量。

核心思路:LiveVVT框架通过滚动流扩散的方式,在因果递归生成中保持有界的双向建模,允许在固定窗口内联合去噪多个视频块,提升生成效率和质量。

技术框架:LiveVVT的整体架构包括固定大小的窗口用于处理视频块,结合有界时间记忆和持久的全局外观记忆,确保生成过程中的一致性和细节保留。

关键创新:LiveVVT的核心创新在于其滚动流扩散框架和双向建模的结合,能够在因果生成中有效保留局部交互信息,显著提升生成质量和效率。

关键设计:在设计中,采用了有界前瞻机制来处理视频块,同时引入了教师轨迹回归和协作匹配蒸馏等技术细节,以优化生成过程中的学习和推理。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LiveVVT在生成质量上优于同类模型,延迟降低了26倍,吞吐量提高了11倍,显著提升了实时视频虚拟试穿的可行性和用户体验。

🎯 应用场景

该研究的潜在应用领域包括在线购物、虚拟试衣间和社交媒体平台等,能够为用户提供实时的高保真虚拟试穿体验,提升用户互动和购买决策的效率。未来,该技术可能在增强现实和虚拟现实等领域得到更广泛的应用,推动相关产业的发展。

📄 摘要(原文)

Diffusion-based Video Virtual Try-On (VVT) achieves high visual fidelity through bidirectional spatio-temporal modeling, but complete-clip dependence incurs prohibitive latency and computational overhead in practical continuous deployment. Naively enforcing causality disrupts pretrained bidirectional priors and substantially degrades synthesis quality. We introduce LiveVVT, a rolling streaming diffusion framework that preserves bounded bidirectional modeling within causal recurrent generation. Within a fixed-size window, LiveVVT jointly denoises multiple video chunks under bounded look-ahead, preserving local bidirectional interactions while emitting one clean chunk per iteration. Beyond the window, two complementary memories sustain long-term consistency: a bounded temporal memory propagates recent dynamics and occlusion context, whereas a persistent global appearance memory, constructed once from the target garment and a frontal try-on keyframe, anchors garment details and dressed appearance throughout the stream. We further introduce a progressive distillation framework integrating bidirectional VVT learning, teacher-trajectory regression for causal few-step adaptation, and Collaborative Matching Distillation, which couples teacher-distribution matching with rolling flow matching on real videos to align optimization with recurrent inference. Experiments on paired and unpaired long-sequence benchmarks demonstrate superior generation quality over similarly sized models, with $26\times$ lower latency and $11\times$ higher throughput, enabling high-fidelity real-time streaming VVT.