跳到主内容
@wquguru
精选82Hugging Face 每日论文(json_list)论文研究

量化感知修复:恢复4比特压缩LLM的实用配方

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

原文
发到 X

廉价地服务大型语言模型日益意味着发布在结构上压缩至其参数一小部分并量化至4比特的模型。这些步骤共同削弱了推理、数学、编码和长上下文行为,以至于在部署前需要一个恢复或“治愈”阶段。默认的配方——量化感知训练(QAT)——将压缩、量化后的模型重新拟合到硬标签上;在我们的流程中,它收敛缓慢,并在达到峰值后崩溃。我们转而采用了量化感知治愈(QAH)。由于结构压缩的模型从未以全精度独立训练,其bfloat16检查点是对原始模型的蒸馏恢复近似;QAH直接从原始未压缩模型中蒸馏4比特学生模型。在GPT-OSS 120B到60B再到MXFP4的流程中,QAH学生模型在9个基准测试中的7个上匹配或超越了其bfloat16来源,同时权重内存减少约4倍,参数量仅为教师模型的一半,并以Hypernova-60B之名发布开放权重。与匹配的QAT基线相比,它在大约7倍更快的时间内达到相当的峰值,并在持续训练下保持稳定,无需手动调整早停。我们还报告了部署经验,包括分布式训练后端之间一个巨大且可复现的质量差距。我们的目标是提供一个无需数周超参数搜索即可部署的配方。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近