AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation
作者: Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang
分类: cs.CV
发布日期: 2026-08-18
备注: Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS
🔗 代码/项目: GITHUB
💡 一句话要点
提出AViTS以解决动态分辨率生成中的冗余计算问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)
关键词: 动态分辨率生成 扩散变换器 自适应选择 时空建模 计算效率 图像生成 深度学习
📋 核心要点
- 现有的动态分辨率生成方法在分辨率转换时存在冗余计算,影响生成效率和细节一致性。
- AViTS通过潜在-文本注意力建模空间重要性,并通过标记级特征变化建模时间重要性,实现时空重要性感知的选择性上采样。
- 实验结果表明,AViTS在FLUX上实现了最高6.34倍的计算效率提升,在Qwen-Image-Edit和FLUX.1-Kontext-dev上接近9倍的FLOPs减少。
📝 摘要(中文)
扩散变换器(DiTs)在生成高质量图像方面表现出色,但由于迭代采样的成本较高,导致计算开销大。动态分辨率采样通过在低分辨率下去噪来降低早期阶段的成本,但在分辨率转换时均匀上采样所有潜在标记会引入冗余计算,并可能降低细节一致性。现有的部分上采样策略通常依赖于局部潜在结构线索或单步统计,难以同时捕捉标记与文本的语义相关性及标记在扩散步骤中的表示动态。为此,本文提出了AViTS,一种自适应时空标记选择框架,能够优先对关键标记进行分辨率细化,从而减少冗余的高分辨率计算,提高质量与效率的平衡。
🔬 方法详解
问题定义:本文旨在解决动态分辨率生成中冗余计算的问题,现有方法在分辨率转换时均匀上采样所有潜在标记,导致计算效率低下和细节一致性下降。
核心思路:AViTS的核心思想是通过潜在-文本注意力和标记级特征变化来建模标记的重要性,从而实现时空重要性感知的选择性上采样,优先处理关键标记。
技术框架:AViTS框架包括两个主要模块:空间重要性建模和时间重要性建模。空间模块通过潜在-文本注意力计算标记的空间重要性,时间模块则通过分析标记在扩散步骤中的特征变化来评估其时间重要性。
关键创新:AViTS的创新之处在于其自适应的时空标记选择机制,能够在不同的扩散步骤中动态调整标记的上采样优先级,与传统方法相比,显著减少了冗余计算。
关键设计:在设计中,AViTS采用了多层注意力机制以增强潜在-文本的关联性,同时在特征变化的计算中引入了动态阈值,以确保重要标记能够得到优先处理。整体网络结构经过优化,以适应不同的生成任务。
🖼️ 关键图片
📊 实验亮点
AViTS在FLUX数据集上实现了最高6.34倍的计算效率提升,几乎在Qwen-Image-Edit和FLUX.1-Kontext-dev上达到了9倍的FLOPs减少。这些结果表明,AViTS在保持生成质量的同时,显著提高了计算效率,展示了其在动态分辨率生成中的优势。
🎯 应用场景
AViTS的研究成果在图像生成、视频生成和其他需要动态分辨率处理的计算机视觉任务中具有广泛的应用潜力。通过提高生成效率和质量,AViTS能够为实时图像处理、虚拟现实和增强现实等领域提供更高效的解决方案,推动相关技术的发展。
📄 摘要(原文)
Diffusion Transformers (DiTs) achieve high-quality generation but are costly due to iterative sampling. Dynamic-resolution sampling reduces early-stage cost by denoising at low resolution; however, uniformly upsampling all latent tokens at resolution transitions incurs redundant computation and may degrade fine-detail consistency. Existing partial upsampling strategies typically rely on local latent structure cues or single-step statistics, making it difficult to jointly capture token-text semantic relevance and token-wise representation dynamics across diffusion steps. We propose AViTS, an adaptive spatiotemporal token selection framework for dynamic-resolution DiTs. AViTS models spatial importance via latent-text attention and temporal importance via token-level feature variation across diffusion timesteps, and fuses them to enable spatiotemporal importance-aware selective upsampling: it prioritizes resolution refinement for critical tokens while deferring less important ones, thereby reducing redundant high-resolution computation and improving the quality-efficiency trade-off. AViTS achieves up to 6.34x on FLUX and nearly 9x FLOPs reduction on Qwen-Image-Edit and FLUX.1-Kontext-dev, orthogonal to distillation, quantization, and feature caching, and reaching 14.76x with distilled models. Code: https://github.com/QHR69/AViTS