ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

📄 arXiv: 2608.07019v1 📥 PDF

作者: Yongge Ma, Guoan Wang, Feiyu Wang, Yaoming Li, Qian Zhang, Zihan Yan, Yinjun Han, Tong Yang

分类: cs.AI

发布日期: 2026-08-07

备注: 10 pages, 3 figures, 16 tables


💡 一句话要点

提出ReQuant以优化后训练量化模型的权重分配

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 后训练量化 模型优化 权重分配 深度学习 量化模型

📋 核心要点

  1. 现有的后训练量化方法在量化完成后,权重分配通常被视为最终结果,缺乏进一步优化的能力。
  2. ReQuant提出了一种无反向传播的固定网格优化过程,允许在量化模型生成后继续改进权重分配。
  3. 实验结果显示,ReQuant在多种模型和任务中均能显著提升量化模型的性能,尤其在简单初始化器和低位宽情况下效果显著。

📝 摘要(中文)

后训练量化(PTQ)广泛用于降低大型语言模型的内存和计算成本。现有PTQ方法通常通过启发式规则或贪婪优化获得初始量化模型,量化完成后,得到的整数分配通常被视为最终结果。基于此观察,本文提出了一种补充优化阶段,允许在生成可执行量化模型后继续改进量化权重,同时保持量化格式。我们引入ReQuant,这是一种无反向传播的固定网格优化过程。ReQuant以现有量化模型为起点,迭代地重新审视其离散权重分配,接受的更新严格减少均方重建误差,并保持在原始网格上。实验表明,ReQuant在多种模型、位宽和下游任务中一致性地改善了量化模型,尤其在简单初始化器和较低位宽下表现出显著提升。

🔬 方法详解

问题定义:本文旨在解决后训练量化(PTQ)中,量化完成后权重分配无法进一步优化的问题。现有方法在量化后通常不再调整权重,导致模型性能未能达到最佳。

核心思路:ReQuant的核心思想是引入一个补充优化阶段,使得在生成可执行的量化模型后,仍然可以对量化权重进行迭代优化,从而减少重建误差。

技术框架:ReQuant的整体流程包括:首先以现有的量化模型为起点,然后在固定的量化网格上迭代更新权重分配,接受的更新必须严格减少均方重建误差,并保持在原始网格上。

关键创新:ReQuant的主要创新在于其无反向传播的优化过程,使得量化权重可以在保持离散格式的同时进行有效的改进。这与现有方法的固定权重分配形成了鲜明对比。

关键设计:ReQuant在设计上采用了固定的量化网格,并通过迭代过程来优化权重分配,确保每次更新都能有效降低重建误差。该方法不依赖于特定的PTQ初始化器,具有广泛的适用性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,ReQuant能够显著提升量化模型的性能,尤其是在使用简单的四舍五入初始化时,经过多次迭代优化后,模型性能接近或超过了现有的最佳量化方法GPTAQ。这一提升在低位宽情况下尤为显著,展示了ReQuant的有效性。

🎯 应用场景

ReQuant的研究成果在多个领域具有潜在应用价值,尤其是在需要高效模型部署的场景,如移动设备和边缘计算。通过优化量化模型的性能,ReQuant能够帮助开发者在资源受限的环境中实现更高效的推理,从而推动智能应用的发展。

📄 摘要(原文)

Post-training quantization (PTQ) is widely used to reduce the memory and computational cost of large language models. Existing PTQ methods typically obtain an initial quantized model through heuristic rules or greedy optimization, and once quantization is completed the resulting integer assignments are usually treated as final. This observation motivates a complementary optimization stage within PTQ that keeps quantized weights improvable after an executable quantized model has been produced, while preserving the quantized format. We introduce ReQuant, a backpropagation-free fixed-grid refinement procedure for this stage. Agnostic to the PTQ initializer, ReQuant takes an existing quantized model as a feasible starting point and iteratively revisits its discrete weight assignments on the fixed quantization grid. Accepted updates strictly reduce the mean squared reconstruction error and remain on the original grid. In this way, ReQuant turns the initially fixed PTQ output into an iteratively optimizable discrete solution and serves as a plug-and-play post-processing stage for existing PTQ pipelines. Experiments across diverse model families, bit-widths, and downstream tasks show that ReQuant consistently improves quantized models from heterogeneous PTQ initializers, with especially large gains on simple initializers and lower bit-widths. Notably, ReQuant can refine a simple round-to-nearest initialization across multiple sweeps until it approaches or surpasses GPTAQ under the same quantization format. These results establish ReQuant as a practical complementary stage for further improving existing PTQ pipelines.