MiniMax H3 开源实测:你下载的权重,和 API 里跑的不是同一个模型
8 月 3 日,MiniMax 把 H3 的权重放上了 Hugging Face。这是视频生成领域少见的重磅开源:33B 参数的 diffusion transformer,用 Qwen3-VL-32B 做编码器,输出最长 15 秒、带原生立体声的音视频。开源一周后,社区实测给出了一份更冷静的答卷——你下载到本地的,和 API 里跑的,严格说不是同一个系统。
API 的完整能力,开源版只放了一块
Oxen.ai 的拆解说得很直白:H3 的 API 背后是一条三步流水线——先做提示词增强,再跑基座模型,最后过一遍超分模型拉到 2K 分辨率。而当前的开源版本只包含 base generation 这一块。想本地复现 API 效果,你得自己把另外两步拼出来。
Hugging Face 官方模型卡印证了这一点:负责多模态输入预处理与编排的 H3-Context-IR 是托管系统,不在权重包里;本地默认的原生分辨率是 768p,2K 只在托管 API 里提供。更关键的是,模型卡明确写着:H3 原生支持稀疏注意力的训练与推理,但首发开源只提供全注意力推理,稀疏实现要等后续更新——长序列的算力成本优势,本地用户暂时拿不到。
显存账本与社区补完速度
本地门槛比想象中分层:Oxen.ai 给出的经验是至少 24GB 显存;DiffSynth-Studio 的 NF4 量化加 offloading 可以压到 8GB;但想要高精度权重和更长的生成,50-60GB 才是甜点区。作者自己的配置是两张 48GB 的 A6000,DiT 放一张卡,文本编码器和 VAE 放另一张。
真正让人意外的是社区速度。开源才一周,几乎每一层都在被改写:Simon Willison 做了 MLX 移植跑上 Apple Silicon;antirez 写了基于 Apple Metal 的 C 库命令行工具;larryvrh 的 Turbo-LoRA 把采样步数从通常的约 20 步压到 4 步,拿到约 5 倍采样加速;lightx2v 的提示词重写 LoRA,相当于把 API 那步提示词增强做了个本地平替;Oxen.ai 的 LoRA 微调训练器也已经上线。
别忽略许可证的地界
另一件容易被「开源」两个字盖住的事:许可条款。H3 采用 MiniMax Community License,据南华早报报道,免费非商用,年收入 2000 万美元以下的机构可商用但需署名。ExplainX 的分析进一步指出,这份许可把美国、欧盟、英国、韩国等市场排除在授权范围之外——在这些地区做生产级使用,需要走 MiniMax 的单独商业授权路径。评估这个模型,第一步不是看跑分,是看你公司在哪。
所以呢
Oxen.ai 的评价是,这终于让人感觉在家里拥有了一个 Seedance 2.0 级别的模型;但「能下载」和「能复现」之间还隔着一条流水线的距离,这也是事实。观察点很清晰:当稀疏注意力实现、超分模块和提示词增强的社区平替逐层补齐,H3 会从「能跑的开源模型」变成「能用的开源系统」。到那一天,视频生成的闭源护城河才是真的被拆掉。