视频生成的开源生态最近出现了一个新节奏:厂商放出基础权重,社区接力把推理成本打下来。MiniMax 今年夏天公开了 H3-Base 的模型权重,几周之后,UCSD 的 FastVideo 团队联合 NVIDIA FastGen 团队和 Nuva Lab 交出了第一份像样的答卷——FastH3 Preview v1,一组基于 MiniMax H3 后训练的开源权重,把文本生成音视频(T2VA)的速度抬到了新的水位线。
49 次调用压到 4 次:DMD2 加 VSA 的组合拳
先看问题有多大。按照官方博客的说明,Base H3 的音视频扩散 transformer 有 33B 参数,生成一个视频要完整调用它 49 次。FastH3 的思路是把这两个成本同时砍掉。
第一刀是 DMD2(Distribution Matching Distillation)。学生模型用一个冻结的 Base H3 教师和一个学习到的 critic 来训练,两者 score 估计的差值提供训练信号;prompt-only 训练时用 backward simulation 让学生提前见识推理时会遇到的少步状态。效果是推理时调用次数从 49 次降到 4 次——五个调度点,恰好四次 DiT 前向。
第二刀是 VSA(Video Sparse Attention)。可训练的稀疏注意力让学生只保留约 10% 的 video-to-video tiles(90% 稀疏度,64-token 块),文本和音频路径保持 dense;教师和 critic 也用全注意力,给稀疏学生一个完整注意力的目标。两刀叠加,同一个 35B 的 checkpoint,每次调用的计算密度也大幅下降。
实测数字:B200 单卡最高 14.38 倍
官方给出的延迟表很有信息量。1344×768、24 FPS 带音频的场景下,Base H3 Dense FA4 生成 15 秒视频在单张 B200 上要 678.7 秒;FastH3 推荐的 VSA/Data-Free checkpoint 只要 47.2 秒,加速 14.38 倍。5 秒视频是 132.5 秒对 16.2 秒,8.16 倍。4 张 B200 上,5 秒视频端到端 6.1 秒;8 张 B200 上,15 秒视频端到端 12.88 秒——不足 13 秒,已经低于视频本身的时长。这些数字的口径是预热后取三次计时中位数,端到端时间含编码、去噪、解码、音频、封装和落盘。
训练成本方面,官方披露用了超过 1000 个 B200 训练小时。推荐 checkpoint 训练到 step 1300,同时提供全量权重和预提取的 rank-64 LoRA 两种形态。
data-free 训练:不用一条目标视频
这批 checkpoint 有个值得注意的细节:推荐版本是 data-free 的,即训练只用 prompt、不用目标视频。这既绕开了视频数据的获取和版权问题,也解释了为什么这个蒸馏版本可以完全开放下载。官方同时发布了合成数据路线的消融版本(用 Base H3 自己生成的视频做训练源)和 dense 注意力参照版本,四个 checkpoint 组成完整的 Preview v1 家族,训练代码也承诺后续放出。
限制也说得很直白:Preview v1 只支持 T2VA,首末帧到视频(FL2VA)和参考到视频(Ref2VA)都还没蒸馏;困难动作、细节和部分音频质量可能低于 Base H3;许可证沿用 MiniMax H3 Community License,商用前需要读一遍条款。
为什么这件事比「又一个加速版」重要
第一,它验证了开源权重的「二层创新」节奏。MiniMax 放出 H3-Base 权重后,社区可以检查它、后训练它、替换 kernel、在自己的硬件上跑它——这是闭源 API 模型做不到的。同一周 fal 发布的 H3 Max 走的是托管 API 路线,两条路线现在有了正面参照。
第二,蒸馏加稀疏注意力这套组合拳,正在成为视频生成走向生产的标准路径。49 次调用压到 4 次,再叠加 90% 的注意力稀疏,意味着同样的硬件可以服务多得多的请求,或者反过来,同样的任务可以塞进小得多的机器。官方下一步计划还包括 8-step 质量版、FP8/NVFP4 量化、面向 RTX、DGX Spark 和 Apple MLX 的本地优化,以及与 NVIDIA FastGen 合作的新蒸馏方法 PDD。
对开发者的建议很直接:如果你在评估开源视频生成栈,推荐的 VSA/Data-Free checkpoint 值得跑一遍——权重硬件无关,4 张 B200 是官方的受控基准平台而非硬性要求,GPU 数量只需能整除 H3 的 56 个注意力头。
当生成时间跌破视频本身的时长,交互式创作和实时工作流就从演示变成了可以排期的事——这才是这组开源权重真正的分量。