大模型做长链推理时,吃不消的往往不是算力而是显存。Chain-of-Thought 越写越长,KV 缓存随序列长度线性膨胀,一条几万 token 的轨迹就能把 GPU 顶穿。常规解法是压缩 KV 缓存:给历史 token 打分,留高分扔低分。但打分依据是什么?几乎所有方法都默认同一条假设——最近几步的 query 可以代表未来的注意力模式。汉阳大学与成均馆大学的团队在一篇 ICML 2026 论文里把这条假设证伪了。
长推理里有"回头看"的时刻
论文的观察起点是一类被命名为 Thought Revisiting Tokens(TRT,思路回溯 token)的解码步骤。模型在长推理中并非一路向前:某些时刻它会突然回头,重新关注推理轨迹早期形成的任务规划,以维持全局连贯。
问题就在这里。RPC、R-KV 这类为长推理设计的压缩方法,都用最近若干步 query 估计哪些 KV 该留。可 TRT 的落点不在最近窗口视野里——等模型真要回头找早期规划时,那部分 KV 已被当作低分内容驱逐。显存省了,推理链条却断了。
作者进一步做几何分析,发现 TRT 对应的 query 并非散乱分布,而是在嵌入空间里聚成少数几个相似性簇。既然是簇,就能用少量代表点概括。
用信标 query 预判"哪些会被回看"
BeaconKV 由此而来:维护一小组 beacon queries(信标 query)作为各全局 query 簇的紧凑代表,预判哪些 KV 未来会被重新访问,不必存下整段 query 历史。机制三步:从已生成轨迹采样出信标 query,解码中通过 Continual FPS(持续最远点采样)在线刷新;缓存超预算时,用信标 query 连同最近 query 的注意力共同给历史 KV 打分;只保留最高分条目,同时永远保住一个最近滑动窗口。方法不需要训练,是纯推理期的插入式改造。
数字:精度差距最大 31.7 个百分点
实验覆盖四个开源长推理模型(R1-Distill-Qwen-7B、R1-Distill-Llama-8B、Qwen3-4B、Qwen3-14B)和四个基准(AIME24、MATH-500、GPQA-Diamond、LiveCodeBench)。论文报告:精度较现有压缩方法最多高 31.7 个百分点;激进压缩下峰值显存最多降到约 1/5.8,吞吐相对未压缩基线提升 4.3 倍以上。
效率表更说明取舍。单张 A100 80GB、Qwen3-4B、32K 生成长度下,Full KV 在 batch 14 时吞吐 82.3 tokens/s、显存 77.0 GB、LiveCodeBench 精度 54.4;BeaconKV 在 2K 预算同 batch 下为 356.4 tokens/s、13.3 GB、51.1。和 RPC 对比:1K 预算、batch 320 时吞吐(1380.8 对 1345.9)与显存(72.0 对 72.5 GB)几乎打平,精度却是 29.9 对 42.2——不是靠多花资源换精度,而是在同样预算里把该保住的内容留对了。
所以呢
这篇的价值不在"又快了几倍",而在指出一处方法论错位:长推理模型边生成边产生上下文,和传统长上下文处理不是同一个问题。后者上下文给定,重要性可静态估计;前者由模型自己写出上下文,且会回头读自己写过的东西。用最近窗口猜未来注意力,先天不成立。
压缩的天花板不取决于打分函数多精巧,而取决于观察窗口是否符合模型真实的注意力动力学。代码已开源(arXiv:2609.04971)。
模型会回头看自己写下的推理链——这件事本身,比任何加速倍数都更值得琢磨。