长上下文模型最贵的一段不是解码,而是 prefill——把几十万 token 的输入从头读一遍的那个阶段。注意力计算的复杂度随序列长度平方增长,上下文拉到 128K,prefill 的开销就成了长文本服务绕不开的税。8 月 20 日提交到 arXiv 的 FlashPrefill V2(编号 2608.19758)就是冲着这段税来的:用块稀疏注意力砍 prefill 的计算量,而且这次把「能进生产」写进了目标。

从算法原型到生产就绪

论文作者对自己前作的评价很直接:FlashPrefill 虽然靠瞬时模式发现和基于最大值的动态阈值把无关注意力块筛掉了,但仍然是个「距生产部署还很远的算法原型」。V2 沿三条线补课:

  • 误差修正:稀疏化必然丢信息,新加入的均值修正项用于压制近似误差,论文称即便在极端稀疏度下,性能退化也保持在可控范围;
  • 算子对齐:重写稀疏注意力算子,采用 PackGQA 内存访问、warp 特化与 pingpong 流水线,对齐最新的 FlashAttention-3/4 实现,并支持 FP8 推理——在量化已成推理标配的当下,不支持 FP8 的加速方案很难进机房;
  • 框架接入:原生支持 paged KV cache 与 continuous batching,可作为 SGLang 等现代推理框架的 attention backend 直接挂载。

关键数字

评测在 NVIDIA H20 GPU 上完成,论文称这是「部署最广泛的推理加速器之一」。作者报告的成绩:128K 上下文长度下,FP8 精度相对 FlashAttention-2 最高提速 47.26 倍,BF16 下为 27.19 倍;即便与对齐 FA3/4 的稠密基线相比,FP8 下仍有 30.49 倍提速。需要说明,以上均为论文自报的实验数字,极端稀疏度换来的加速必然伴随精度取舍,落到自己的业务负载之前,值得先压一轮测试。

为什么值得留意

稀疏注意力的论文这两年不缺,多数停在「换一种切法、刷一轮 benchmark」。FlashPrefill V2 的不同之处在于把生产三要素凑齐了:FP8、paged KV cache、SGLang 集成。长上下文推理的下一轮成本竞争,比的可能不是谁的模型更大,而是谁的 prefill 更便宜。论文全文见 arxiv.org/abs/2608.19758