H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference

📄 arXiv: 2608.28113v1 📥 PDF

作者: Hao Yu, Zheng Li, Dayiheng Liu, Jianwei Zhang

分类: cs.CL

发布日期: 2026-08-28


💡 一句话要点

提出H-Scale以解决NVFP4量化模型推理中的尺度选择问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 后训练量化 NVFP4 尺度选择 大型语言模型 推理优化 NVIDIA Blackwell 深度学习

📋 核心要点

  1. 现有的后训练量化方法主要关注量化权重值的优化,而对每组尺度选择的研究相对不足,导致推理性能受限。
  2. H-Scale通过使用校准激活导出的对角二阶代理,选择硬件有效的组尺度,直接优化层输出扰动,提供了一种新的尺度调整方法。
  3. 实验表明,H-Scale在多个主流LLM上显著提升了NVFP4基线性能,使多个变体更接近BF16参考标准。

📝 摘要(中文)

NVIDIA Blackwell架构原生支持超细粒度的NVFP4格式,为加速大型语言模型(LLM)推理提供了新机遇。NVFP4的微块设计虽然在捕捉局部权重分布方面表现出色,但也引入了对每组缩放因子高度敏感的空间。现有的后训练量化(PTQ)方法主要集中在量化权重值的优化,而对尺度选择步骤的研究相对较少。为此,本文提出了H-Scale,一种轻量级的后处理方法,旨在对NVFP4的每组尺度进行精细调整。H-Scale通过使用从校准激活中导出的对角二阶代理,选择硬件有效的组尺度,直接针对层输出扰动进行优化。该方法可作为RTN风格尺度选择的替代方案,要求的离线校准较少,并且在推理时引入零开销。实验结果表明,H-Scale在主流LLM上普遍提升了NVFP4基线的性能。

🔬 方法详解

问题定义:本文旨在解决NVFP4格式在推理过程中对每组尺度选择的敏感性问题。现有的后训练量化方法未能有效优化这一步骤,导致模型性能未能充分发挥。

核心思路:H-Scale的核心思路是通过校准激活生成的对角二阶代理,选择硬件有效的组尺度,从而直接针对层输出扰动进行优化,而不是单纯最小化权重重构误差。

技术框架:H-Scale的整体架构包括离线校准阶段和推理阶段。在离线校准阶段,通过收集激活数据生成对角二阶代理,进而选择合适的组尺度;在推理阶段,使用选定的组尺度进行高效推理。

关键创新:H-Scale的主要创新在于其选择尺度的方式,利用二阶代理直接优化层输出扰动,与传统方法相比,能够更有效地提升推理性能。

关键设计:H-Scale的设计中,关键参数包括组大小和校准激活的选择,损失函数则侧重于层输出的扰动,而非简单的权重重构误差。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,H-Scale在多种主流LLM上普遍提升了NVFP4基线的性能,多个变体的表现更接近BF16参考标准,具体提升幅度未明确给出,但整体效果显著。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的推理加速,尤其是在需要高效计算和低延迟的场景中,如实时自然语言处理、对话系统和智能助手等。H-Scale的设计使其能够在多种NVFP4管道中灵活应用,具有广泛的实际价值和未来影响。

📄 摘要(原文)

The NVIDIA Blackwell architecture, with native support for the ultra-fine-grained NVFP4 format, opens new opportunities for accelerating large language model (LLM) inference. NVFP4's micro-block design, such as a group size of 16, offers strong representational flexibility for capturing local weight distributions and isolating outliers, but it also introduces a large and highly sensitive space of per-group scaling factors. Existing post-training quantization (PTQ) methods primarily focus on refining quantized weight values, leaving this scale-selection step underexplored. To address this gap, we propose \textbf{H-Scale}, a lightweight post-processing method for NVFP4 per-group scale refinement. Instead of minimizing plain weight reconstruction error, H-Scale selects hardware-valid group scales using a diagonal second-order proxy derived from calibration activations, thereby targeting layer output perturbation more directly. It is designed as a drop-in replacement for RTN-style scale selection in diverse NVFP4 pipelines, requires only modest offline calibration, and introduces strictly zero overhead at inference time. Under a fixed evaluation protocol, experiments on mainstream LLMs show that H-Scale generally improves a broad range of NVFP4 baselines and brings several variants closer to the BF16 reference.