混合架构 LLM 的量化圈有一条不成文的规矩:注意力层可以压到 4-bit,循环层不行。9 月 3 日提交到 arXiv 的一篇论文(2609.04098)把这条规矩正面拆了——Qwen3.8-27B 全部 496 个线性层压进 NVFP4 W4A4,连 Gated DeltaNet 的衰减门和写入强度门也没放过,论文测试口径下精度与 BF16 的差距落在种子噪声以内。
禁区是怎么来的
Qwen3.8-27B 是典型的混合架构:48 层 Gated DeltaNet(GDN)线性注意力,加上 16 层 softmax 注意力。GDN 的循环状态以固定尺寸概括上下文,社区一直担心递归结构里的量化误差会随长度累积。所以 unsloth、RadixArk 的早期 4-bit 版本都把 GDN 块留在 8-bit 甚至 16-bit,门控投影更是重点保护对象。
Minima AI 的 Sergii Kozyrev 和 Davyd Maiboroda 决定检验这个直觉。做法很直接:纯 PTQ 校准,不用 QAT 也不用蒸馏,496 个线性层一刀切全 4-bit。四份模型在完全相同的 serving 环境下对比——vLLM、TP=1、单张 96GB Blackwell:BF16 基线、他们的全 4-bit 版,以及两份保护 GDN 的社区版。
结果:4K/32K 困惑度、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、64K 以内 RULER 检索,五任务平均 -0.52;全 4-bit 版反而是四份配方里最小的(17.5 GiB,约为 BF16 的三分之一)且 prefill 最快的(+14-19%)。
循环层为什么耐压:四点机制
论文最有意思的部分是解释「为什么」,结论大多反直觉。
门控恰恰是最不敏感的部件。 大家最不敢动的衰减门和写入强度门,softplus/exponential 和 sigmoid 参数化把约 11% 的 GEMM 误差压缩到约 2% 的输出误差——非线性自己当了减震器。
噪声不会在循环状态里累积。 delta 规则的每次写入都沿着当前 key 方向覆写状态,注入的误差在 32K token 上保持平坦平台,一次状态冲击几百步内就被遗忘;32K 困惑度差距甚至随位置缩小。
另外两点:NVFP4 的 16 元素块缩放把残差流的极端离群点局部化,平衡了各层角色的激活误差;每个 token 的量化成本随上下文被冲淡,而不是复合放大。
工程师真正该带走的两条
一是 serving 陷阱:把 GDN 投影融合成单个 GEMM 的 kernel,会静默错配逐模块校准的 NVFP4 checkpoint 的全局 scale。论文修复了这一错配,放出的 checkpoint 预先调和过,开箱即对。二是校准过的 FP8 KV-cache scale 无性能代价,跟着一起发。一句话配方:全部量化,scale 随 checkpoint 一起发。
这份 17.5 GiB 的 checkpoint 已在 Hugging Face 开放(minima-ai/mnma_qwen3.8_27b_nvfp4),论文提交次日冲进 HF Daily Papers 榜前列(65 个 upvote)。参考:arxiv.org/abs/2609.04098
对本地部署玩家,这意味着一张 96GB 单卡跑 27B 混合模型,不再需要在精度和体积之间二选一——当然,以上全部数字是论文方自己的测试口径,等第三方复现再下最终结论。更普遍的启示是:混合架构普及之后,「哪些层脆弱」不能再靠直觉投票,得一篇一篇论文去实测。