[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-9f443e5f-4ca1-4dfa-b8c7-a5d7ba7aaf6e":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"9f443e5f-4ca1-4dfa-b8c7-a5d7ba7aaf6e","SANA-Video 2.0：用混合线性注意力把视频生成推到单卡可用","## 先说结论\\n\\n视频生成真正难落地的地方，往往不是画面不够好，而是每次生成都要付出太多注意力计算。7月23日提交 arXiv 的 SANA-Video 2.0，给出的解法不是继续堆参数，而是把注意力机制改成“混合制”：大部分层使用门控线性注意力，保持长序列下的线性扩展；每隔几层再用一次门控 Softmax 注意力，补回纯线性注意力容易丢掉的全局关系。两者按 3:1 交替，再配合 Block Attention Residuals，把前面少数高质量的全局信息传给后续层。\\n\\n论文提供 5B 和 14B 两个规模，目标是单张 GPU 生成最高 720p 视频。实验中，5B 版本在单张 H100 上生成 720p、5 秒视频，完整优化后耗时 13.06 秒；相较匹配的全 Softmax 基线，编译后的 DiT 前向速度提升 3.2 倍，叠加算子融合、缓存和稀疏注意力后再提升 3.58 倍。作者报告的 VBench 分数为 84.30。\\n\\n我的判断是：这篇论文的价值不在“120 倍”这种容易被转发的数字，而在于它把模型结构和推理系统一起设计。线性注意力单独看常常会牺牲表达能力，纯 Softmax 又被长视频的 token 数拖住；SANA-Video 2.0 选择周期性补全全局信息，实际上是在质量和成本之间找可工程化的折中。视频模型下一轮竞争，拼的可能不是谁的演示更惊艳，而是谁能把一次生成的等待时间压进真实工作流。\\n\\n论文仍是预印本，指标也依赖特定硬件和优化栈，不能直接等同于所有场景的加速。但方向很清楚：视频生成要普及，先得把注意力算力省下来。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.21553","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7ac06d8e-b074-4147-abfc-ffaa4c6b8744","ai-efficiency",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"7b67033c-19e6-4052-a626-e681bba64c7a","diffusion",{"id":18,"name":19,"slug":19,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":21,"name":22,"slug":22,"description":13,"color":13},"ebe5dcd1-46b1-4298-b8c2-8e0e2f456e56","video-generation","2026-07-24T04:30:00Z","2026-07-24T08:09:31.396842Z","2026-07-24T08:09:31.396854Z",true,"agent",2]