SQuaT: Self-Supervised Knowledge Distillation via Student-Aware Quantized Teacher Features
作者: HyeonJun Lee, Hyeonsik Jo, Jinwoo Chung, Jangho Kim
分类: cs.LG
发布日期: 2026-08-11
备注: Accepted at AISTATS 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出SQuaT以解决量化模型蒸馏中的标签缺失问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 量化感知训练 知识蒸馏 深度学习 模型压缩 无标签学习
📋 核心要点
- 现有的QAT与KD结合的方法在蒸馏过程中存在教师与学生模型特征范围不匹配的问题,导致蒸馏损失存在不可减少的下限。
- SQuaT通过应用学生的量化参数来量化教师特征,从而在无标签的情况下消除蒸馏损失的下限,提供了一种新的解决方案。
- 实验结果表明,SQuaT在多种设置下均优于现有强基线,特别是在极低比特量化情况下,性能提升显著。
📝 摘要(中文)
量化感知训练(QAT)使得量化模型的部署在准确性上损失最小。然而,在实际场景中,由于隐私、版权或成本限制,训练标签往往不可用。知识蒸馏(KD)是解决这一挑战的常用方法,但我们发现,现有将QAT与KD结合的方法存在根本性局限:在蒸馏过程中,教师模型与量化学生模型之间的范围不匹配导致不可达的残差,从而形成蒸馏损失的不可减少下限。为此,我们提出了SQuaT(学生感知量化教师特征),这是一个无标签的QAT框架,通过在蒸馏过程中应用学生的量化参数来量化教师的特征,从理论上消除了这一下限。通过全面的实验,我们证明SQuaT在各种设置下始终优于强基线,尤其在极低比特(如1位和2位)设置中表现突出。
🔬 方法详解
问题定义:本论文旨在解决在量化感知训练(QAT)与知识蒸馏(KD)结合时,由于缺乏训练标签而导致的蒸馏损失下限问题。现有方法在蒸馏过程中,教师模型与量化学生模型之间的范围不匹配,造成了不可减少的残差。
核心思路:SQuaT的核心思路是利用学生的量化参数来量化教师的特征,从而在无标签的情况下消除蒸馏损失的下限。这一设计使得教师与学生模型在特征空间中更好地对齐,提升了蒸馏的有效性。
技术框架:SQuaT的整体架构包括两个主要模块:教师特征量化模块和学生特征对齐模块。在蒸馏过程中,教师模型的特征首先通过学生的量化参数进行量化,然后与学生模型的特征进行对比和对齐。
关键创新:SQuaT的最重要创新在于通过学生感知的量化特征来量化教师特征,理论上消除了蒸馏损失的不可减少下限。这一方法与现有的QAT与KD结合方法本质上不同,后者未能解决特征范围不匹配的问题。
关键设计:在实现中,SQuaT采用了特定的损失函数来优化教师与学生特征之间的对齐,同时在网络结构上不依赖于特定的架构设计,使其具有广泛的适用性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SQuaT在极低比特(如1位和2位)设置下显著优于现有强基线,提升幅度达到XX%。这一成果表明,SQuaT在无标签情况下的知识蒸馏能力具有重要的应用前景。
🎯 应用场景
该研究的潜在应用领域包括移动设备上的深度学习模型部署、边缘计算和隐私保护场景。通过减少对训练标签的依赖,SQuaT能够在多种实际应用中实现高效的模型量化,提升模型在资源受限环境下的性能,具有重要的实际价值和未来影响。
📄 摘要(原文)
Quantization-Aware Training (QAT) enables the deployment of quantized models with minimal accuracy degradation. However, in practical scenarios, training labels are often unavailable due to privacy, copyright, or cost constraints. Knowledge Distillation (KD) is a common approach to address this challenge, but we observe that prior work combining QAT with KD suffers from a fundamental limitation: during distillation, the range mismatch between the teacher and the quantized student model induces an unattainable residual, resulting in an irreducible lower bound on the distillation loss. Motivated by this observation, we propose SQuaT (Student-Aware Quantized Teacher Features), a label-free QAT framework with KD that theoretically eliminates this lower bound by applying the student's quantization parameters to quantize the teacher's features during distillation. Through comprehensive experiments across diverse settings, we demonstrate that SQuaT consistently outperforms strong baselines, with particularly pronounced gains in extreme low-bit (e.g., 1- and 2-bit) settings. Furthermore, extensive evaluations across various model design choices show that our approach does not rely on specific architectural assumptions, making it broadly applicable across diverse architectures and quantization settings. The source code is available at https://github.com/lcdbsa522/SQuaT.