视频生成行业长期默认一条铁律:质量更高的模型,推理必然更慢。8 月 27 日,推理平台 fal 正面挑战了这条假设——基于 MiniMax 开源 H3 权重后训练出的 H3 Max,生成 5 秒视频约需 3 秒,吞吐约为官方端点的 35 倍,同时拿下人工偏好评测整体质量、提示理解、美学三项第一(见 fal 官方博客)。
不是蒸馏复刻,是「后训练 + 推理栈」协同设计
fal 团队在开源的 MiniMax H3 权重上引入大量新数据做后训练,重点瞄准提示遵循与视觉质量;fal 的 X 官方帖还提到,后训练算力的相当大一部分花在了可验证的 RL 任务上。与传统步进蒸馏「逼近教师模型」不同,fal 声称要的是更快的更好模型,且基座核心能力(统一多模态上下文、原生音画同步)保持完好。
推理侧同样关键。H3 Max 架构围绕 fal 自研推理引擎设计——团队过去四年专门优化扩散与生成媒体负载,训练与服务全部跑在 NVIDIA GB200 NVL72 系统上,fal 称其单芯片性能最高达上一代加速器的 2 倍。fal 的纪律是:降精度、砍采样步数这类常见加速手段,只有模型仍守住内部质量评测排名时才保留——优化与质量是同一个问题。
榜单:官方评测之外,还有两个独立第三方
fal 把 H3 Max 与 12 个主流视频模型做头对头人工偏好对比,名单包括官方 MiniMax H3 端点、Gemini Omni Flash、Wan 3.0、Seedance 2.5、Kling 3 与 Veo 3.1,用贝叶斯 Elo 加 95% 置信区间聚合。H3 Max 三项维度全部第一,且对每一个对比模型都赢得多数对局。
这一结论不只在 fal 自己的评测里。Artificial Analysis 与 Design Arena 两个独立评测机构的榜单上,H3 Max 同样排名第一;Design Arena 称其「以超过 50 倍的速度交付 MiniMax H3 的质量,建立了新的速度-偏好帕累托前沿」。fal 的帕累托图显示,H3 Max 生成耗时约 2.4 秒,而 MiniMax H3 与 Wan 3.0 都要超过一分钟。MiniMax H3 团队也在 fal 博客中背书,称双方「从第一天起就紧密合作」。
读细一点:768p 上限,和一个容易被误读的名字
速度有代价。第三方页面 Morphic 的 FAQ 指出,H3 Max 为速度调优、分辨率止步 768p(原版 H3 可到 2K),且只覆盖文生视频与图生视频,原版混合输入的参考生成与编辑能力不在。名字也值得留意:H3 Max 容易被当成 MiniMax 官方新版本,实际上 MiniMax 从未发布过叫这个名字的模型——它是 fal 的改装版,只在 fal 平台提供。
还有一个常被忽略的对照:fal 产品 FAQ 写道,原版标准 H3 在 fal 栈上只比 MiniMax 自家推理快约 15 倍——35 倍增益里相当部分来自后训练与协同设计,而非换个托管商。
所以呢
H3 Max 的意义超过单个产品发布。它验证了开源权重的「二阶价值」:MiniMax 开放 H3 权重,收获的不只是社区好感,还有 fal 这样的基础设施厂商在其之上做出官方端点做不到的速度-质量组合。「质量必然慢」的假设被实测数据打破;开发者选模型该看的不再是孤立跑分,而是质量、延迟、成本构成的前沿。首周五折的定价表明 fal 瞄准高吞吐生产负载。当视频生成走向交互式与批量生产,「把模型研究和推理优化当作同一个问题」可能就是下一代生成媒体公司的分水岭。