长上下文推理的痛点之一是KV cache随上下文增长,持续抢占GPU显存并压低吞吐。这个问题在Qwen3.8-Flash-Next、Qwen3.8-Max这类混合架构模型上更突出——它们把局部注意力、循环模块、线性注意力与少量全局注意力层叠加,而正是那几层残余的全局注意力决定了cache大小,也成了吞吐的瓶颈。\n\nRenjie Xie等人9月2日提交的HeadWiseKV(arXiv:2609.02029)给出训练免费的解法。它的核心是为每个物理KV head预先绑定一个静态的多级历史窗口,让cache占用在服务启动前就可预测;并把这个分配建模成受限的率失真问题,提出SeqCalib算法按层序生成策略,显式考虑层间policy的相互作用。最后用一个grouped-cache运行时把策略落地成真实的per-head驻留,而不是给full cache打mask。\n\n论文在Qwen3.6-27B等四个混合模型上验证:HeadWiseKV把112K上下文的峰值显存降低8.59%,并把「能稳定跑通」最大上下文从114K推到161K(约+41%),同时在RULER和LoCoMo长上下文基准上几乎不掉点。最关键的是它训练免费——存量混合架构模型直接挂载即可受益,不必重训或微调。\n\n对运营长上下文推理服务的人来说,这类工作正在把「显存墙」从结构性瓶颈变成调优问题。值得继续关注的是它与UltraQuant等KV cache量化方法的组合空间,以及在RAG、Agent长轨迹等真实场景里的端到端收益。