视频生成模型的效果一年一个台阶,但推理账单也在同步变厚。Nunchux AI 在官方博客里给了一个直观的数字:用 BF16 FlashAttention-4 在一块 B200 上跑 MiniMax-H3,每个去噪步约有三分之二的时间花在注意力上;视频 token 数越长,这笔开销按平方增长。注意力,就是视频扩散模型部署成本的咽喉。
低比特注意力的两堵墙
低比特化是显而易见的省钱路径,但会撞上两堵墙。第一堵是精度:量化以硬件块为单位设 scale,scale 由块内最大的条目决定,离群值一出现,普通条目就被挤进很窄的可表示区间。此前的工作已经能平滑 query 和 key,但 value 的离群值不遵循固定的通道或时空结构,成了输出误差的主要来源。第二堵是速度:低比特 Tensor Core 只加速注意力里的两次矩阵乘,夹在中间的 softmax 仍要跑 FP32 高精度指数运算,反而成了内核流水线上最长的一段。
V-Smooth 与 ExpCast-FP8
VC-Attention 的解法是两面各拆一堵墙。V-Smooth 用轻量在线 k-means 把 value token 重新分组,让同一个硬件块里的 token 彼此相近;再减掉块均值、只量化残差,均值则从在线 softmax 本来就要维护的行和里恢复。论文称,仅这一步就在四个模型上比 SageAttention2 多拿回 1.1 到 2.8 dB 的 PSNR。ExpCast-FP8 则把 log 域分数用一次融合乘加直接映射成 E4M3 概率编码,把 FP32 指数运算和格式转换整个抹掉。
实测数字
论文在 B200、B300、H200、RTX PRO 6000、RTX 5090 五种 GPU 上实现并评测,覆盖 Wan2.2、LongCat-Video、HunyuanVideo-1.5、MiniMax-H3 四个视频模型。注意力内核相对 BF16 FlashAttention-4:数据中心卡提速 1.46-1.59 倍,工作站卡 2.3-3.6 倍;端到端出片分别提速 1.13-1.19 倍与 1.36-1.70 倍。MiniMax-H3 生成 243 帧 1344×768 的负载上,B200 内核提速 1.59 倍、B300 为 1.51 倍;100 个 prompt 的保真度均值 20.2 dB,略优于 SageAttention2 的 19.9 dB。
免训练才是要害
论文出自 Nunchux AI,作者名单包括 Song Han、Yujun Lin、Lvmin Zhang 等。对工程侧来说,最大的卖点不是某个单项倍数,而是 training-free:不重训、不动权重,现有视频模型直接换注意力内核就能吃到加速,还能与稀疏注意力、少步蒸馏、多卡执行叠加。当视频生成从演示走向产能,每一分推理成本都会被放大千万次——低比特这条路绕不开 softmax 这道坎,VC-Attention 把坎铲平了一块。
所以呢?模型军备赛看参数,成本战看内核。谁的注意力先跑进 8 比特时代,谁的视频 API 报价单就更有底气。论文原文与Nunchux 官方博客均已公开,数字值得自己核一遍。