把大模型做小的标准流水线是两步:先做结构压缩,砍掉层数或注意力头;再把权重量化到 4-bit。两步都在省钱,也都在损伤推理、数学、代码能力,所以部署流水线会在上线前加一步「修复」(healing)。gpt-oss、NVIDIA Nemotron、Multiverse Computing 的 Hypernova 60B,走的都是这条路线。
修复该怎么做,一直没被认真回答。Multiverse Computing 8 月 21 日挂上 arXiv 的论文(arXiv:2608.20953)给出答案,还附赠一个反直觉结果:GPT-OSS 120B 压到 60B、再量化 MXFP4 后,修复出的 4-bit 模型在 9 项基准里 7 项赢过自己的 bfloat16 版本——更小、更便宜,还更准。
旧方法的两个坑
主流方案 QAT 在前向里插入伪量化算子继续微调,论文实测它收敛慢,训过头还会崩,要人工 early stopping 兜底。另一方案 QAD(量化感知蒸馏,Liquid AI 上周公开过同类用法)冻结全精度 teacher 蒸馏,但有隐藏前提:存在「真正全精度」的同架构模型。结构压缩过的模型从未被独立全精度训练过,唯一 teacher 是恢复出的 bfloat16 checkpoint——本身就是蒸馏近似,拿它教 student 等于把上限锚在降级目标上。
QAH:换个 teacher,问题就解了
QAH 只改一处:蒸馏回到压缩前的原始模型。Teacher 全尺寸全精度,student 一半参数跑 MXFP4,架构不必相同——teacher 的输出分布与架构无关,KL 散度照样对齐 logits。换个角度:量化不再是修复后的有损后处理,而是对着原始 teacher 再做一轮完整蒸馏,补上 bfloat16 版本没来得及学的东西。长上下文复用配套论文的分块 KL 损失,32k token 语料能塞进固定显存。
数字说话
反超项里涨幅最大的是压缩最伤的能力:长上下文推理 AA-LCR 35.3→42.7(+7.4),数学 AIME 2025 70.7→76.3(+5.6),Aider +2.7、工具调用 τ²-bench +2.3、GPQA Diamond +1.7。输的两项 MMLU-Pro(−0.2)、SciCode(−1.4)都在 1.5 分内。对 120B teacher 本尊:LiveCodeBench 拿 66.5,反超其 66.0。
与 QAT 的对照消融(9B 量化到 MXFP4):峰值相当(54.9 对 54.6),但 QAH 约 100 步到峰、QAT 要约 700 步,慢约 7 倍;QAT 过峰后到 1200 步累计掉近 19 分,QAH 稳定不漂移——KL 蒸馏把 student 绑在固定 teacher 分布上,追平后没有漂移压力。
成本侧:4-bit 权重内存约为 bfloat16 四分之一,参数是 teacher 一半,每 token 计算约减半。成品已以 Hypernova-60B 开放权重发布。
量化不是税,是机会
最值得记住的是叙事翻转:量化从「为效率交的精度税」变成「一次额外的教学机会」。两个落地细节:作者在社区问答确认 QAH 不需要原始训练语料,公开数据加任务数据就够;方法明确瞄准「不需要数周超参搜索」的可复用配方。
下次有人断言 4-bit 必然掉点,把这篇甩给他:在正确的蒸馏目标下,更小的模型可以同时更便宜和更准。
参考:arXiv:2608.20953,官方博客 huggingface.co/blog/MultiverseComputingCAI/quantization-aware-healing。