量化感知恢复:4 位压缩模型超越原始全精度性能

研究表明,将大型语言模型先结构压缩再量化至 4 位,配合“量化感知恢复”技术,可在保持更低算力和成本的同时,在多数基准测试中超越原始全精度模型,对部署成本与性能都有革命性影响。

量化感知恢复:4 位压缩模型超越原始全精度性能

背景:模型压缩与量化的两难

在实际部署大型语言模型(LLM)时,算力与存储成本往往是最大的制约因素。业界常用的做法是先通过结构压缩——削减层数、注意力头或神经元数量——降低参数规模,随后再将权重量化到 4 位(4‑bit)以进一步压缩内存和加速推理。虽然两步都能显著节约资源,但它们的叠加效应通常会导致模型在推理能力、数学推理和代码生成等关键任务上的表现出现明显下降。

“恢复”(Healing)步骤的必要性

为弥补压缩和量化带来的性能衰减,很多部署流水线会在模型上线前加入一次“恢复”训练,即在已有的压缩模型基础上进行微调,使其重新找回失去的能力。近年来,开源模型如 GPT‑OSS、NVIDIA 的 Nemotron 系列以及 Hypernova 60B 等,都采用了“压缩‑恢复”这一流程。

量化感知恢复(QAH)是什么?

在《Quantization‑Aware Healing: A Practical Recipe for Recovering Compressed, 4‑Bit LLMs》一文中,研究者提出了“量化感知恢复”(Quantization‑Aware Healing,简称 QAH)的概念。QAH 的核心思路是:在进行结构压缩后,直接在量化状态下进行恢复训练,而不是先恢复再量化。这样可以让模型在学习过程中感知到 4 位权重的离散化误差,从而更有效地适应低位表示。

实验以 GPT‑OSS 120B 为基准,将其结构压缩至 60B 参数并量化为 MXFP4(4‑bit)后进行 QAH,结果在 9 项基准测试中有 7 项成绩超越了原始的 bfloat16 全精度模型,显示出 4 位模型不仅更小、更便宜,还在准确性上实现了逆转。

QAH 的实现要点

  • 量化感知的微调数据:在恢复阶段使用的训练数据需覆盖模型常用的推理场景,包括自然语言理解、数学题解和代码生成等。
  • 混合精度训练:采用混合精度(fp16 + 4‑bit)进行微调,确保梯度计算的数值稳定性。
  • 正则化技巧:加入量化误差正则项,使模型在更新权重时主动抵消 4 位离散化带来的噪声。
  • 渐进式学习率调度:先使用较高学习率快速适应压缩结构,随后逐步降低学习率细化量化感知的细节。

对行业的意义

QAH 的成功表明,传统认知中“低位模型必然逊色于全精度模型”的假设可以被打破。这为大模型的商业化部署提供了新的思路:

  • 显著降低算力成本,尤其适用于边缘计算和资源受限的服务器。
  • 在保持或提升模型性能的前提下,缩小模型体积,便于模型分发与更新。
  • 为开源社区提供了一套可复现的压缩‑恢复流程,降低了高性能模型的使用门槛。

未来展望

虽然 QAH 已在部分基准上取得突破,但仍有值得深入研究的方向。例如,如何在更极端的位宽(2‑bit、1‑bit)下保持类似的恢复效果,或者将 QAH 与稀疏化、蒸馏等其他压缩技术结合,以进一步提升效率。同时,针对不同任务的专属恢复策略也将成为提升模型实用性的关键。

结语

量化感知恢复为 LLM 的高效部署提供了全新的技术路径。通过在量化阶段即进行针对性的恢复训练,模型能够在更低的位宽下实现甚至超越全精度版本的表现,为 AI 应用的规模化落地打开了更广阔的空间。