低比特量化最容易翻车的地方,不是权重,是注意力。上海交大团队 8 月底放上 arXiv、已被 EMNLP 2026 Main 录用的 HyQuant 论文,把翻车原因指到一个很具体的结构上:注意力图里的「竖线 token」。理解了这个结构,4-bit 的注意力几乎可以无损压缩。
竖线:误差都挤在少数 token 上
论文作者在 Hugging Face 论文页评论区补充了一组关键观察:在 Qwen3、Llama-3、Gemma 4、Qwen3.5 上,注意力图持续存在「竖线」——少数 key 位置被几乎所有 query 关注。量化这些位置的误差会被放大到整个序列;反过来,top 5% 的 key 位置加上一个 128 token 的局部滑动窗口,就能覆盖 82-86% 的注意力质量,而识别这些竖线只需 3-5% 的运行时开销。
这组数字解释了为什么低比特 KV-cache 量化常常伤到长上下文推理:误差不是均匀分布的,而是集中砸在少数高关注 token 上。论文摘要也点明,现有方法主要靠 smoothing 技术处理离群值——这类平均主义方案抹不掉结构性集中的误差。
混合精度:关键的留 FP16,其余压进 4-bit
HyQuant 的设计顺着这个结构来:竖线 token 和局部窗口保留 FP16,其余注意力状态压成 K4V4 的 4-bit 格式。prefill 阶段用混合精度量化注意力算子;decode 阶段把同一原则用于 KV-cache 压缩,并将 KV 反量化与注意力计算融合,避免 KV cache 物化,省下显存与访存带宽。作者称这套设计"极其简单",在多任务、多模型、多数据集上保持接近无损的精度。
跑分与边界
论文自报的单张 H100 数字:
- LongBench 平均分 45.04,高于 FlashAttention-2 全精度的 44.59(Qwen3-8B thinking 模式);作为对照,KIVI、SageAttention、KVTuner 只有 37.7-40.5
- decode kernel 在 32K 上下文比 FlashAttention-2 快至 3.58 倍;端到端 decode 提速 1.04-1.17 倍,而 KIVI/KVTuner 端到端反而比 FA2 慢(0.69-0.80 倍)
- batch 16 搭配 32K prefix 时,它是唯一还能跑的方法(231.6 tok/s),FA2、KIVI、KVTuner 全部 OOM
- 上述结论在 Qwen3-32B、Llama-3.1-8B、GLM-4-9B 上复现
边界要讲清楚:以上均为论文与作者自报数字,代码已在 GitHub 开源,第三方复现还有待社区验证。
所以呢
「压到几 bit」是量化工程的老问题,「误差集中在哪」是 HyQuant 换的新问题。注意力天然存在结构性稀疏——竖线加局部窗口——意味着精度预算应该按注意力质量分配,而不是按比特均匀分配。对做长上下文推理降本的团队,这是条比全模型量化更立竿见影的路:注意力与 KV-cache 恰好是长上下文显存的大头,batch 16 + 32K 下唯一存活的实测也说明它解决的是真实容量瓶颈而非纸面速度。EMNLP 2026 Main 的录用说明这条路线已过同行评审第一关,接下来值得盯的是社区在更多模型家族上的复现结果。
参考:arXiv:2608.27875(https://arxiv.org/abs/2608.27875);代码:github.com/jerrysfls/HyQuant