SANA-Video 2.0:用混合线性注意力把视频生成推到单卡可用

## 先说结论\n\n视频生成真正难落地的地方,往往不是画面不够好,而是每次生成都要付出太多注意力计算。7月23日提交 arXiv 的 SANA-Video 2.0,给出的解法不是继续堆参数,而是把注意力机制改成“混合制”:大部分层使用门控线性注意力,保持长序列下的线性扩展;每隔几层再用一次门控 Softmax 注意力,补回纯线性注意力容易丢掉的全局关系。两者按 3:1 交替,再配合 Block Attention Residuals,把前面少数高质量的全局信息传给后续层。\n\n论文提供 5B 和 14B 两个规模,目标是单张 GPU 生成最高 720p 视频。实验中,5B 版本在单张 H100 上生成 720p、5 秒视频,完整优化后耗时 13.06 秒;相较匹配的全 Softmax 基线,编译后的 DiT 前向速度提升 3.2 倍,叠加算子融合、缓存和稀疏注意力后再提升 3.58 倍。作者报告的 VBench 分数为 84.30。\n\n我的判断是:这篇论文的价值不在“120 倍”这种容易被转发的数字,而在于它把模型结构和推理系统一起设计。线性注意力单独看常常会牺牲表达能力,纯 Softmax 又被长视频的 token 数拖住;SANA-Video 2.0 选择周期性补全全局信息,实际上是在质量和成本之间找可工程化的折中。视频模型下一轮竞争,拼的可能不是谁的演示更惊艳,而是谁能把一次生成的等待时间压进真实工作流。\n\n论文仍是预印本,指标也依赖特定硬件和优化栈,不能直接等同于所有场景的加速。但方向很清楚:视频生成要普及,先得把注意力算力省下来。