视频生成一直有个尴尬的算术题:一段十几秒的 768p 视频,扩散模型往往要算上好几分钟,比播放慢一个数量级,直播与交互式生成无从谈起。本周 UC Berkeley、Impossible 与 UT Austin 团队放出的 Video DeltaNet(VDN)把这条裂缝明显推窄:部署在 MiniMax H3 上的 VDN-H3,预热后 8 张 B200 约 9.0 秒返回一段 14.4 秒 768p 成片,去噪循环本身 6.9 秒——生成时长压进播放时长以内(项目页:openvdn.github.io)。
注意力是视频生成的头号账单
视频扩散模型去噪时要反复处理长时空 token 序列,softmax 注意力开销随序列长度平方增长。项目页给出扎眼数字:在 H3 这类前沿 omni 模型上,softmax 注意力占总运行时 85% 以上。LLM 那边早有答案——Gated DeltaNet、Kimi Linear 等线性注意力把开销降到线性——但直接照搬到视频模型会翻车:主体一致性、场景布局这类依赖精确交互的全局特征守不住。
VDN 的拆法:局部 Softmax 加远程线性记忆
VDN 不做二选一,把视频-视频注意力拆成互补两支:局部用滑动窗口 softmax,每 5 个连续潜帧一组、每组只看自己和相邻组,保住细节与短期时序稳定;远程上下文交给双向线性注意力,前向、反向状态各总结窗口前后的帧。另有 4 向边界锚点:每帧都能看到首尾两帧,只增加 3.57% 注意力密度,显著稳住长程一致性。文本与音频相关交互保留 softmax 不动。
真正的新部件是 Video Delta Attention(VDA):把 LLM 里逐 token 的 delta rule 升级成逐帧版本,一帧之内所有空间 token 联立解一个正则化目标,而非各自读写状态——数学上等于对帧级 Gram 矩阵做矩阵逆求解。两个直接好处:继承状态的转移算子范数天然不超过 1,不需要 SANA-WM 那种按帧内 token 数的保守缩放;重复方向的写入互相抑制、独立方向不被稀释。
提速账本与三阶段训练
把新分支塞进预训练好的 H3 不能硬训:随机初始化的线性分支会扰动已校准的 softmax 路径。团队三阶段配方:先逐层对齐,再端到端适配(softmax 分支、QKVO 投影与 FFN 全程冻结),最后 LoRA 共适配;softmax 门在前两阶段冻结,防止优化器走"干脆压制 softmax 分支"的捷径。
数字层面:单张 B200 上 50 步稠密 H3 去噪 14.4 秒视频要 13.95 分钟,VDN-H3 降到 5.34 分钟。8 卡上 Ulysses 并行把单步延迟从 6.46 秒降到 1.62 秒;再按 profiling 把 5 张卡分给 softmax 分支、3 张给 VDA,进一步降到 1.405 秒,比标准 Ulysses 低 13.3%。叠加 8 步蒸馏(刻意避开激进 4 步)后 DiT 循环 11.23 秒完成——相对稠密单卡基线 74.5 倍、8 卡基线 10.7 倍。摘要同口径:6.70 秒完成 14.3 秒 768p 视频去噪,较稠密基线提速 14.5 倍(arXiv:2609.20744)。
所以呢
去噪快于播放时长,流式与直播生成在架构上开始有账可算——论文标题里的 livestream 不是修辞。VDN 与上月底 FastH3 的 4 步蒸馏是两条不同的轴,一个换注意力架构、一个砍步数,原理上可叠加。代码与权重已开放(GitHub 与 Hugging Face 均为 OpenVDN/vdn-minimax-h3)。留给下一棒的问题很实际:官方"近无损质量"的说法,还等第三方复现盖章。