SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention
作者: Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li
分类: cs.CV
发布日期: 2026-08-13
💡 一句话要点
提出SCOPE框架以解决稀疏视频注意力的效率问题
🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)
关键词: 稀疏注意力 视频理解 扩散变换器 自注意力机制 深度学习
📋 核心要点
- 现有的稀疏注意力方法在处理细粒度键差异时存在不足,容易错过重要信息。
- SCOPE框架通过3D-RoPE对齐的键子空间聚类和在线每头Top-k估计来优化稀疏注意力的计算效率。
- 在多个实验中,SCOPE在保真度和延迟上均显著优于现有方法,展示了其高效性。
📝 摘要(中文)
扩散变换器(DiTs)在时空标记上引入了二次自注意力成本。现有的无训练稀疏注意力方法通常从块级或聚类级代理分数构建稀疏掩码,这可能会掩盖键之间的细微差异,并在激进稀疏下错过高贡献键。此外,这些代理分数可能导致过于集中化的softmax分布,导致某些查询聚类保留的键过少。为了解决这些问题,本文提出了SCOPE,一个无训练的稀疏注意力框架,结合了3D-RoPE对齐的键子空间聚类和在线每头Top-k估计,以实现高效的视频DiT推理。实验结果表明,SCOPE在六个模型-任务配置中,在保真度和延迟方面均优于现有的无训练基线,在720p HunyuanVideo上实现了高达1.99倍的端到端加速,PSNR相对密集注意力为28.46 dB。
🔬 方法详解
问题定义:本文旨在解决扩散变换器在时空标记上引入的高自注意力计算成本问题。现有方法在构建稀疏掩码时,往往忽视了键之间的细微差异,导致高贡献键的遗漏。
核心思路:SCOPE通过结合3D-RoPE对齐的键子空间聚类与在线每头Top-k估计,动态调整稀疏注意力的计算,确保在不同查询聚类中保留足够的关键键。
技术框架:SCOPE的整体架构包括三个主要模块:首先,对后处理的RoPE键进行时间、空间(高度和宽度)子空间的独立聚类;其次,通过查找表聚合相应的质心分数,获得每个查询聚类的每键代理分数;最后,基于现有的混合Top-p和固定Top-k选择,在线计算每头的Top-k值。
关键创新:SCOPE的主要创新在于其在线每头Top-k估计方法,能够根据查询聚类的大小动态调整保留的键数量,这与传统的固定Top-k方法形成鲜明对比。
关键设计:在设计中,SCOPE使用了查找表来高效聚合质心分数,并通过加权平均初始保留键计数来计算每头的Top-k值,确保了在不同输入和头之间的适应性。
🖼️ 关键图片
📊 实验亮点
在六个模型-任务配置中,SCOPE在保真度和延迟方面均显著优于现有的无训练基线,尤其在720p HunyuanVideo上实现了高达1.99倍的端到端加速,同时PSNR相对密集注意力达到28.46 dB,展示了其卓越的性能。
🎯 应用场景
SCOPE框架具有广泛的应用潜力,特别是在视频理解、实时视频处理和计算机视觉任务中。其高效的稀疏注意力机制能够显著提升模型的推理速度和性能,适用于需要快速响应的场景,如自动驾驶、监控系统和在线流媒体分析等。
📄 摘要(原文)
Diffusion Transformers (DiTs) incur quadratic self-attention cost over spatiotemporal tokens. Existing training-free sparse attention methods often construct sparse masks from block-level or cluster-level proxy scores, which can obscure fine-grained differences among keys and miss high contribution keys under aggressive sparsity. Moreover, such proxy scores may yield overly concentrated softmax distributions, causing Top-$p$ to retain too few keys for some query clusters. Although a fixed Top-$k$ minimum alleviates this failure mode, a shared value cannot adapt to variations across heads and inputs. To address both limitations, we propose SCOPE, a training-free sparse attention framework that combines 3D-RoPE-aligned key subspace clustering with online per-head Top-$k$ estimation for efficient video-DiT inference. SCOPE partitions post-RoPE keys into temporal, height, and width subspaces, clusters them independently, and aggregates the corresponding centroid scores through lookup tables to obtain per key proxy scores for each query cluster. Building on existing hybrid Top-$p$/fixed Top-$k$ selection, SCOPE derives a head-specific Top-$k$ value online by averaging the initial retained key counts within each head, weighted by query cluster size, and selects additional keys only for query clusters whose initial retained key counts fall below this value. Sparse attention is then computed over the selected original keys and values. Across six model--task configurations, SCOPE consistently outperforms existing training-free baselines in both fidelity and latency, achieving up to a $1.99\times$ end-to-end speedup on 720p HunyuanVideo with $28.46$ dB PSNR relative to dense attention.