长上下文推理的成本大头不在计算,而在 KV cache——它随序列长度线性膨胀,先把显存吃光。主流解法是"驱逐":给缓存里的 token 打分,超出预算就丢掉低分项。但 Qualcomm AI Research 9 月 20 日挂在 arXiv 上的新论文 ValueDiff 指出一个尴尬现实:这套打分逻辑的地基,正在被模型架构自己拆掉。

老方法的根基:注意力锚点,正在消失

过去的驱逐方法基本都押注在 attention sink 上——少数 token 吸走不成比例的注意力,锚住整段上下文。StreamingLLM 直接保住 sink,H2O、TOVA、SnapKV 按注意力打分,KeyDiff、ManifoldKV 靠 key 向量几何。这些信号全在 key 一侧。但 QK 归一化、门控注意力混合架构、可学习的 sink、logit softcapping 这些新设计,恰恰都在压 sink。论文实测:Llama 3 的 sink 率还有 0.86–0.90,到 Qwen3.5 和 GPT-OSS-20B 已接近零。锚没了,靠锚的方法自然失灵。

ValueDiff:不看 key,看 value 的离散度

论文的关键观察是:sink 越弱的模型,value 向量相对 key 向量的离散度(σV/σK)越高。ValueDiff 的打分因此简单到一句话——算每个 token 的 value 向量到缓存均值的 L2 距离,离均值近的近似冗余、先丢;离得远的信息量独特、留下。这个分数还有个理论注脚:在"未来注意力未知、取最大熵假设"下,它恰好是对注意力输出扰动最小的驱逐策略。整个过程不碰注意力分数,信号与 query 无关。

数字:三类基准全面压过旧方法

RULER 的 2k token 紧预算下,ValueDiff 在七个 sink 受抑模型上保住稠密注意力性能的 88–99%,七个里六个第一。LongBench 4k 预算下平均留存 92%,最强旧基线只有 83%。更刺眼的是崩塌案例:Gemma3-4B 上 KeyNorm 只剩 49.5% 留存,GPT-OSS-20B 上 KeyNorm 25.3%、ManifoldKV 31.0%,几乎不可用。推理场景同样成立——MATH-500 的 25% 缓存预算下,ValueDiff 是全部 sink 受抑模型上最强的非稠密方法,在 Qwen3.5 上把注意力类和 key 类方法甩开约 19–24 分。显存账也直观:Qwen3.5-4B 跑 128k 上下文,峰值显存从 15.0 GB 降到 8.6 GB,省 43%;GPT-OSS-20B 在 65k 上下文省 29%。

所以呢

这篇论文真正值得记住的不是又一个驱逐算法,而是方法论:推理系统的研究必须跟着架构趋势重新校准。训练侧为了稳定性和长上下文能力改注意力(QK 归一化、门控),代价由推理侧的缓存策略来付。作者自己也把 key/value 双侧混合打分列为下一步——说明单一信号没有终局。对做部署的人,操作建议很直接:选 KV 驱逐策略前,先看手头模型的 sink 行为,老方法在新架构上可能不只是次优,而是塌方。

引用:arXiv:2609.23314