LLM 推理的成本大头是权重显存,后训练量化(PTQ)不重训模型就能把权重压到 4-bit 甚至更低,是绝大多数部署团队的现实选择。但主流方法有个不太被讨论的软肋:数值稳定性——不是平均分不够高,而是某些层会突然炸掉。9 月 10 日提交到 arXiv 的一篇论文(arXiv:2609.11687)把一条 1977 年的数学老路线认真工程化了一遍,作者来自 Institute of Numerical Mathematics 与 Steklov 数学研究所,名单里就有定理提出者 Boris Kashin 本人(1977 年的分解定理即以他命名)。

先看翻车现场

论文的对比实验里,QuIP 家族的不稳定不是偶发:在 Pythia-6.9B 上,QuIP 与 QuIP-RG 的 WikiText-2 困惑度直接发散到 2000 以上,关掉微调与向量码本的 QuIP# 变体也飙到约 325,而 Kashin-DCT+H 收在 20.6±1.6,比同预算的 QuIP# 好一个数量级以上;同一配置下 OPTQ 尚能贴近自身基线,约 12.02,说明炸的是方法不是模型。Mistral-7B v0.1 上更尖锐:四个 QuIP 变体全部在 SwiGLU 的 mlp.down_proj 层因 LDL 回代出现 NaN 而中止,OPTQ 也退化到约 380 困惑度;Kashin-DCT 保持数值稳定,距 FP16 基线 8.63 只差约 0.3。按论文报告,在他们遇到的全部四个压力配置里,这是唯一每层都保持稳定的 pipeline。

三处手术

方法本身是对 Kashin 分解量化的三项改造:

  • 稠密正交矩阵换成符号随机化的 DCT。原方案要存一个 N×N 随机正交矩阵,单次迭代 O(N²);换成带随机符号的离散余弦变换后成本降到 O(N log N),矩阵本身零存储。
  • 交替更新的分块贪心算法。每四步固定两个因子的更新顺序,保证它们都呈现稳定 2-bit 聚类所需的四峰分布,收敛有几何衰减证明,不再是"经验上碰运气"。
  • 聚类中心闭式初始化。峰值位置 ±c1±c2 可由残差范数解析算出,直接用来初始化 k-means,砍掉了此前主导量化耗时的多次重启搜索。

外围再叠上 OPTQ 式顺序误差补偿与 QuIP 式 incoherence 预处理(Hadamard 或 Kronecker 两种),整条流水线用 JAX 实现,支持多 GPU。

结果:稳,且不牺牲平均分

4-bit per channel 配置下,在 OPT-1.3B、Llama-2-7B/13B、Pythia-1.4B 上,该方法与 OPTQ、QuIP、QuIP-RG 以及去微调版 QuIP# 基本打平:Llama-2-7B 的 WikiText-2 困惑度,FP16 基线 9.20,Kashin-DCT+H 为 9.60,略优于 OPTQ 的 9.80;QuIP 在同一配置上方差大到 48.30±29.84。规模往上走同样成立:Llama-2-13B 上 FP16 基线 8.11,去微调版 QuIP# 为 8.31,Kashin-DCT+H 为 8.37,差距都在零点几个点以内。推理时每个权重分解为两个 2-bit 因子码,结构上适配原生 2-bit 硬件。实验在单张 H100 上完成,校准用 1000 条长度 2048 的 WikiText-2 序列,评测走 lm-evaluation-harness,表中数字为三个随机种子下的均值与方差。

论文也明说局限:没有与 AWQ、OmniQuant、旋转类激活量化方法对比,只论证了旋转预处理与本方法的分解是正交可组合的。

所以呢

这篇论文值得注意的点不在刷分——它也没刷分——而在把"最坏情况不炸"摆到了和"平均困惑度"同等的位置。部署侧真正致命的从来不是 0.2 的困惑度差距,而是某一层静默 NaN 之后整个服务不可用。当 2-bit 原生硬件真的到来,先活下来的方法,才轮得到谈精度。