长推理模型的显存账,最后都算在 KV Cache 头上。模型每生成一个 token,注意力机制都要把之前的键值状态缓存下来;一条几万 token 的思维链跑下来,KV Cache 成了严重的内存瓶颈——这是 Salesforce AI Research 新论文(arXiv:2609.03430,9 月 3 日提交)开篇给出的背景。而这个方向已有整整一族方法,思路高度一致:给缓存里每个 token 打个分,估计它"以后还有没有用",留下分高的,扔掉分低的。论文的核心结论是:打分这个动作本身,几乎没有贡献。
随机驱逐,追平最强打分器
论文提出的方法叫 Random Attention,规则简单到不像一个方法:prompt 部分完整保留,生成的推理 token 在每个注意力头内部均匀随机驱逐,预算用完为止,外加一小段最近窗口兜底——不读注意力分数,不算 value 统计,不需要任何校准数据。作者在 Qwen3-4B/14B/32B 和 Phi-4-reasoning 四个模型、MATH-500、GPQA-Diamond、AIME、HMMT、LiveCodeBench 等六个推理任务上做了对照:同等缓存预算下,随机驱逐追平了 SnapKV、R-KV、VaSE、TriAttention 这些精心设计的选择性方法;更关键的是部署端数字——在 vLLM 服务栈里,它的吞吐比所对比的最强驱逐器高 32%-43%。省掉打分计算,直接省出了吞吐。
为什么随机就够:推理链自带两层冗余
论文最有价值的部分不是"随机也行"这个结论,而是机制解释。作者做了控制实验,拆出两层原因。其一,缓存里真正脆弱的是 prompt:各打分器之间的性能差距,大半可以归结为"它的选择信号碰巧有没有保住 prompt"——prompt 安全了,后面的推理 token 怎么选差别不大。其二,推理链自身有双保险:文本层面,模型边推理边重述自己还需要的信息;注意力头层面,每个头都持有一份推理链的副本。两层冗余叠加,随机抽取也总能留下足够份数的关键信息。
换句话说:不是随机有多聪明,而是此前的打分器一直在为"碰巧保住 prompt"和"冗余兜底"这两件本来不需要打分的事邀功。选择信号贡献近乎为零,才是这批方法真正共享的隐性前提。
工程视角:卖点在成本结构
对做推理服务的人,这篇论文的价值不在精度,在成本。项目 README 写得很直白:一轮驱逐的开销只剩下压缩动作本身;对比之下,TriAttention 需要逐模型的校准统计,部署门槛在模型之外。代码已按 Apache 2.0 开源,仓库包含驱逐引擎、评测 harness、显著性检验、vLLM 移植与机制研究工具链,论文实验在 8 张 H200(141GB)上完成。在 Hugging Face 论文页,它两天内已收获逾百个 upvote。
照例泼冷水:这是单团队结果,发布不到两天,还需要独立复现来检验;研究对象是长思维链的推理场景,结论不能直接外推到所有 KV Cache 压缩场景;32%-43% 的吞吐提升对照的是"最强选择性驱逐器",与不压缩的满血缓存相比是另一本账。
但对整个方向的提醒是实打实的:下次再看到某篇论文宣称新的 KV Cache 打分算法涨了多少点,第一个该问的问题是——随机基线,跑过了吗?
参考:arXiv:2609.03430(https://arxiv.org/abs/2609.03430);代码:github.com/SalesforceAIResearch/Random-Attention