Channel-wise Dynamic Knowledge Distillation via Adaptive Sample Generation for Action Recognition
作者: Ping Li, Chenhao Ping, Jie Song, Mingli Song
分类: cs.CV
发布日期: 2026-08-04
备注: Accepted in ACM MM2026, 16 pages, 7 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出自适应样本生成的通道动态知识蒸馏方法以提升动作识别性能
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 动作识别 知识蒸馏 自适应样本生成 通道动态蒸馏 深度学习
📋 核心要点
- 现有知识蒸馏方法依赖固定样本,导致教师与学生模型间特征对齐不佳,影响性能。
- 提出自适应样本感知通道动态知识蒸馏(ASCD KD)方法,通过样本梯度生成更新样本并进行动态蒸馏。
- 在UCF101、Kinetics-400等多个数据集上进行实验,结果显示该方法在性能上优于现有技术,达到最先进水平。
📝 摘要(中文)
知识蒸馏(KD)为压缩大型动作识别模型提供了一条有前景但尚未充分探索的路径。然而,现有的KD方法存在两个主要限制:一是依赖固定输入样本导致教师模型与学生模型之间的特征对齐不佳;二是对所有通道应用统一的蒸馏强度未能考虑通道在捕捉不同知识方面的重要性差异。为此,本文提出了一种自适应样本感知通道动态知识蒸馏(ASCD KD)方法,分为两个阶段:首先,通过结合样本梯度生成更新样本;其次,利用通道动态蒸馏模块在生成样本上训练学生模型。大量实验表明,该方法在多个视频和图像基准数据集上表现出色。
🔬 方法详解
问题定义:本文旨在解决现有知识蒸馏方法在动作识别中的不足,主要包括固定输入样本导致的特征对齐不佳和通道蒸馏强度统一的问题。
核心思路:提出自适应样本感知通道动态知识蒸馏(ASCD KD)方法,通过样本梯度生成更新样本,并根据通道特征频率动态调整蒸馏强度,以更好地捕捉不同知识。
技术框架:该方法分为两个主要阶段:第一阶段是自适应样本生成模块,利用样本梯度和通道中心频率差异生成更新样本;第二阶段是通道动态蒸馏模块,基于生成样本进行学生模型训练。
关键创新:最重要的创新在于结合样本梯度和通道频率动态调整蒸馏过程,显著提升了特征对齐效果,与传统方法相比具有本质区别。
关键设计:在样本生成中,采用高斯掩膜保留运动相关细节;损失函数通过通道频率加权,确保不同通道的重要性得到合理体现。
🖼️ 关键图片
📊 实验亮点
在UCF101、Kinetics-400和Something-Something-v2等视频基准数据集上,ASCD KD方法在多个任务上均实现了最先进的性能,相较于现有方法提升幅度达到XX%,具体性能数据可参考实验部分。
🎯 应用场景
该研究的潜在应用领域包括视频监控、智能交通和人机交互等场景,能够有效提升动作识别系统的性能和效率,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Knowledge Distillation (KD) offers a promising yet underexplored path for compressing large action recognition models. However, existing KD methods suffer from two key limitations: 1) reliance on fixed input samples leads to suboptimal feature alignment between the frozen teacher (larger model) and the learnable student (smaller model), and 2) applying a uniform distillation strength for all channels fails to account for their varying importance in capturing distinct knowledge (e.g., motion tempo or magnitude) across training epochs. This motivates us to develop an Adaptive Sample-aware Channel-wise Dynamic (ASCD) KD approach, which operates in two stages. First, we use an adaptive sample generation module to create updated samples by incorporating semantics from sample gradients, which are derived by minimizing a feature loss weighted by channel centroid frequency differences at each layer. Meanwhile, crucial motion-related details are preserved by applying a Gaussian mask to frequency features. Second, we employ a channel-wise dynamic distillation module to train student on these generated samples, guided by sample gradients and feature frequencies. For efficiency, samples are updated periodically rather than per epoch. Extensive experiments on three video benchmarks (UCF101, Kinetics-400, Something-Something-v2) and two image datasets (CIFAR-100, ImageNet) demonstrate the state-of-the-art performance of our method. Code is available at https://github.com/mlvccn/ASCD_KD_Action.