FlowVVTON: Flow-Guided Mask-Free Video Virtual Try-On
作者: Shengyao Chen, Xianbing Sun, Liqing Zhang, Jianfu Zhang
分类: cs.CV
发布日期: 2026-08-31
💡 一句话要点
提出FlowVVTON以解决视频虚拟试穿中的遮挡与不一致问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视频虚拟试穿 光流 时间一致性 无掩码方法 深度学习 计算机视觉 时尚电商
📋 核心要点
- 现有视频虚拟试穿方法依赖于解析掩码和姿态关键点,常在大动作和遮挡情况下失效,导致边界伪影和时间不一致。
- FlowVVTON提出了一种无掩码的框架,利用光流作为训练监督信号,强制相邻帧特征在物理运动约束下对齐,从而实现多尺度时间一致性。
- 在TikTokDress数据集上的实验表明,FlowVVTON在时间一致性上相较于SwiftTry提升了5.7倍,且不需要任何分割掩码或姿态关键点。
📝 摘要(中文)
视频虚拟试穿旨在将目标服装转移到动态人物身上,但现有方法依赖于人类解析掩码或姿态关键点,常在大动作和遮挡下失效,导致边界伪影和时间不一致。此外,大多数方法仅依赖注意力机制进行时间建模,缺乏明确的运动监督。本文提出FlowVVTON,一个完全无掩码依赖的框架,利用光流作为训练时的监督信号,通过流扭曲潜在损失在生成模型的各层施加多尺度时间一致性约束。实验结果表明,FlowVVTON在TikTokDress数据集上显著优于基线,尤其在时间一致性方面提升显著。
🔬 方法详解
问题定义:本文旨在解决视频虚拟试穿中由于大动作和遮挡导致的边界伪影和时间不一致问题。现有方法依赖于解析掩码和姿态关键点,常常在复杂场景下失效。
核心思路:FlowVVTON通过引入光流作为训练时的监督信号,完全消除了对解析掩码的依赖。通过流扭曲潜在损失,确保相邻帧特征在物理运动约束下的对齐,从而实现多尺度的时间一致性。
技术框架:该方法采用两阶段训练策略,首先进行无掩码的空间对齐,然后引入光流引导的时间监督。整体架构包括光流计算模块、特征对齐模块和生成模型。
关键创新:FlowVVTON的主要创新在于完全消除了对解析掩码的依赖,利用光流作为唯一的监督信号,从而在时间一致性上取得了显著提升。与现有方法相比,FlowVVTON在处理复杂运动时表现出更好的鲁棒性。
关键设计:在模型设计中,采用了多尺度特征提取和流扭曲损失函数,确保了生成过程中的时间一致性。此外,网络结构经过优化,以适应无掩码的训练需求。
🖼️ 关键图片
📊 实验亮点
在TikTokDress数据集上的实验结果显示,FlowVVTON在时间一致性方面相较于基线SwiftTry提升了5.7倍,且在整个过程中无需任何分割掩码、姿态关键点或区域注释,展现了其优越的性能和实用性。
🎯 应用场景
FlowVVTON的研究成果可广泛应用于时尚电商、虚拟试衣间和社交媒体平台等领域,帮助用户在动态环境中更好地体验服装试穿。其无掩码的特性使得系统部署更加灵活,降低了对标注数据的依赖,具有重要的实际价值和未来影响。
📄 摘要(原文)
Video virtual try-on aims to transfer a target garment onto a moving person across video frames. Current methods rely on human parsing masks or pose keypoints that frequently fail under large motions and occlusions, causing boundary artifacts and temporal inconsistency. A further limitation is that most approaches rely solely on attention mechanisms for temporal modeling, providing no explicit motion supervision. We propose FlowVVTON, a mask-free framework that eliminates parsing mask dependency entirely. Optical flow is used solely as a training-time supervision signal: a flow-warped latent loss, applied across all layers of the generation model, enforces multi-scale temporal consistency by aligning adjacent-frame features under explicit physical motion constraints. A two-stage training strategy establishes mask-free spatial alignment before introducing flow-guided temporal supervision. Experiments on TikTokDress show that FlowVVTON outperforms baselines by substantial margins, particularly in temporal consistency (5.7$\times$ VFID-R improvement over SwiftTry), while requiring no segmentation masks, pose keypoints, or region annotations at any stage.