为什么 Q4_0 是边缘部署的"硬骨头"
要在 16GB 内存的 MacBook 或一台树莓派上跑一个能聊天的 LLM,模型权重必须被压到 4-bit 以下。GGUF 生态里最常见的 4-bit 格式是 Q4_0 和 Q4_K_M:前者最快但最糙,后者略好但吞吐略慢。Q5_K_M 通常比 Q4_K_M 再涨 1-2 个百分点的能力,代价是文件大 25%。这意味着任何在 Q4_0 上做的精度恢复,都可以"白嫖"到一份比 Q4_K_M 更快、且接近 Q5_K_M 精度的权重。
传统做法是 post-training quantization(PTQ),把训好的 BF16 权重直接 round 到 4-bit。这个过程的精度损失在 LFM2.5-230M 这种小模型上尤其严重,因为权重之间的余量本来就薄。PTQ 的 Q4_0 GGUF 在 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF、BFCLv4 等六到七项任务上的平均,只能拿到 BF16 大约 80-90% 的水平,240M 和 350M 的相对损失明显比 2.6B 大。
Liquid AI 的解法:训练时就教学生"接受 4-bit"
Liquid AI 在 8 月 19 日释出的更新里,把 Q4_0 的 4 个尺寸(230M / 350M / 1.2B-Instruct / 2.6B)用 Quantization-Aware Distillation(QAD)重训了一次。核心思路:让一个高精度的 teacher 模型在训练阶段就把"被量化过"的 student 模型教到位——student 不是事后被 round,而是全程在模拟 4-bit 量化的反向传播里学。发布的 GGUF 和原生 Q4_0 是同一个文件格式、同一个 tensor 布局、同一条 llama.cpp 路径,所以没有吞吐损失:QAD Q4_0 用的是原生 Q4_0 的速度,精度却向 Q5_K_M 看齐。
数字到底差多少
Liquid AI 在四个真机后端上跑了完整 benchmark 套件:
- MacBook Pro(Apple M5 Max):GPU 推理,256 token prompt prefill 后生成 100 token。
- NucBox EVO-X2(AMD Ryzen AI Max+ 395):同上。
- Samsung Galaxy S26 Ultra(Qualcomm Snapdragon 8 Elite Gen 5):Arm CPU 推理。
- Raspberry Pi 5(Broadcom BCM2712):Arm CPU 推理,小模型用 32 token decode-only 测吞吐。
恢复率定义:BF16→PTQ Q4_0 的精度差,QAD 关闭了多少百分比。四个尺寸的结果是 70.6%(230M)/ 73.4%(350M)/ 65.5%(1.2B)/ 48.4%(2.6B);折算成"QAD Q4_0 保留 BF16 多少"是 97.1% / 96.5% / 97.4% / 96.6%。也就是说,即使是被 PTQ 砸得最狠的 230M,QAD 也能把 Q4_0 的精度抬到跟 Q5_K_M 在 run-to-run 方差内打平。1.2B 比 Q5_K_M 差不到 0.5 分。
在 1.2B 和 2.6B 上,QAD Q4_0 比标准 Q4_K_M 快 3-14%,精度持平;在 230M 和 350M 上,它比 Q5_K_M 快 4-33%,精度打平。它也追平了 Unsloth 之前发布的 UD-Q4_K_XL——一个被社区视为 4-bit SOTA 的外部 PTQ 检查点。
这件事为什么值得看
QAD 不是新概念,但工业界把它当成"Liquid AI 的工程输出"而不是论文概念来跑完整 benchmark 套件,而且和 PTQ、Q5_K_M、Q4_K_M、UD-Q4_K_XL 做了同一组对照实验,而不是只比"自己 vs 自己"——这件事的边际信息量其实很高。它把"Q4_0 = 廉价但是不能上线"这个长期共识推翻了。
对边缘部署的实际意义是:在 16GB MacBook、Ryzen AI Max+ NUC、Snapdragon 8 Elite 手机和树莓派上,Q4_0 现在能跑出 Q5_K_M 的精度,而体积和速度都更优。GGUF 仓库已经在 Hugging Face 公开,文件命名带 QAD-Q4_0 后缀,llama.cpp 直接拉。LLM 推理里,文件大小和吞吐通常比 benchmark 分数更影响能不能上线——这次的收益正好打在这条线上。
来源:Liquid AI 官方博客《LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment》(https://www.liquid.ai/blog/qad),以及 Hugging Face 团队博客《LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation》(https://huggingface.co/blog/LiquidAI/qad)。两个发布均在 2026 年 8 月 19 日公开,benchmark 套件与硬件配置完全一致。