From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization
作者: Achille Jacquemond, Yuma Ichikawa, Akira Sakai
分类: cs.AI
发布日期: 2026-08-10
备注: 34 pages, 1 figure
💡 一句话要点
提出交错跨块后训练量化方法以提升模型压缩效果
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 后训练量化 模型压缩 Transformer 量化精度 深度学习
📋 核心要点
- 现有的块级后训练量化方法在处理模型压缩时存在早期错误无法修正的问题,导致性能下降。
- 论文提出的交错跨块量化(ICBQ)方法通过重新访问块之间的边界对,增强了量化过程的精度和效果。
- 实验结果表明,ICBQ在三元量化困惑度上显著优于顺序基线,并在基线退化情况下仍能保持良好性能。
📝 摘要(中文)
压缩大型语言模型至两位或更少的位数通过块级后训练量化变得越来越可行;跨块变体在移动窗口内重构相邻的Transformer块。在研究的固定两块设置中,匹配的顺序基线仅在网络中移动一次窗口,因此早期引入的错误不会被重新访问。我们提出了交错跨块量化(ICBQ),这是一种调度修改,重新访问连续块之间的边界对。每个接缝对被精炼两次:第一次在一个块的末尾,第二次在下一个块的开始。该方法保留了局部两块目标,并重用了现有块级PTQ管道的校准输入。在所述的局部收缩和平滑假设下,我们推导了深度上界比较,其中接缝重访使传播项成倍增加,而残差保持独立于深度的有界性。在报告的实验中,ICBQ相对于匹配的顺序CBQ基线减少了三元量化的困惑度,在基线严重退化的配置中产生有限的困惑度,并且还可以与3位和2位GPTQ一起使用。
🔬 方法详解
问题定义:本论文旨在解决现有块级后训练量化方法中早期引入的错误无法被修正的问题,这导致了模型压缩效果的下降。
核心思路:提出的交错跨块量化(ICBQ)方法通过在量化过程中重新访问连续块之间的边界对,能够有效地减少量化误差,从而提升模型的整体性能。
技术框架:ICBQ的整体架构包括两个主要阶段:首先在当前块末尾进行初步量化,然后在下一个块开始时再次对接缝进行精炼。该方法保留了局部两块目标,并重用了校准输入。
关键创新:ICBQ的核心创新在于其交错的量化调度策略,使得每个接缝对能够被两次精炼,这与传统的单次量化方法形成了鲜明对比,从而显著提高了量化精度。
关键设计:在设计中,ICBQ使用了局部收缩和平滑假设,并在实验中展示了其在不同量化位数(如3位和2位)下的有效性,确保了模型在压缩后的性能稳定性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ICBQ在三元量化困惑度上相较于匹配的顺序CBQ基线有显著降低,且在基线严重退化的情况下仍能保持有限的困惑度。此外,该方法也适用于3位和2位的GPTQ,展示了其广泛的适用性。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的压缩和优化,尤其是在资源受限的环境中,如移动设备和边缘计算。通过提高量化精度,ICBQ能够在保持模型性能的同时显著降低存储和计算开销,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Compressing large language models to two bits or fewer is increasingly feasible through block-wise post-training quantization; cross-block variants reconstruct neighboring Transformer blocks within a moving window. In the fixed two-block setting studied here, the matched sequential baseline moves this window through the network once, so errors introduced early in the sweep are not revisited. We propose Interleaved Cross-Block Quantization (ICBQ), a scheduling modification that revisits the boundary pair between consecutive chunks. Each seam pair is refined twice: first at the end of one chunk and again at the start of the next. The method retains the local two-block objective and reuses the calibration inputs of existing block-wise PTQ pipelines. Under stated local contraction and smoothness assumptions, we derive a depth-wise upper-bound comparison in which seam revisits multiply the propagated term while the residual remains bounded independently of depth. In the reported experiments, ICBQ reduces ternary-quantization perplexity relative to the matched Sequential CBQ baseline, yields finite perplexity in configurations where the baseline has severe degradation, and can also be used with 3-bit and 2-bit GPTQ.