视频生成终于开始告别‘一个任务一个模型’
过去两年,视频模型的进步主要体现在清晰度、时长和运动稳定性上,但工作流依然很碎:文生视频、图生视频、首尾帧、主体参考、动作迁移、配音、音效和编辑,往往需要不同模型或不同管线。MiniMax 新发布的 H3 试图改变的正是这件事。它把文本、图像、视频和音频放进统一上下文,可生成最高 2K、最长 15 秒、带原生立体声的视频。
这不只是‘又一个 2K 视频模型’。H3 的核心判断是:任务边界本身正在成为生成模型的瓶颈。 当创作者想表达‘参考视频一的镜头运动,让图片二中的人物按音频三演唱’时,传统工作流要先拆任务,再逐段调用工具;H3 则希望让用户直接用自然语言描述素材之间的关系,由同一模型完成理解、生成和编辑。
三项技术选择,比演示视频更值得看
MiniMax 公布了四个关键组件,其中三项直接指向成本与泛化能力。
第一是 Contextual Omni Representation。团队不只给目标视频写描述,还让专用理解管线描述输入素材之间、输入与目标之间的关系。官方称,单份源素材通常需要约 10 万 token 的推理,再蒸馏成平均约 4000 token 的表示。语言在这里不是简单提示词,而是把不同模态和任务统一起来的中间层。
第二是重新设计的 H3-VAE。更高压缩率让有效序列长度提升 4 倍,既降低训练和推理成本,也成为原生 2K 输出的基础。视频模型最昂贵的部分之一,就是时空 token 数量随分辨率和时长迅速膨胀;压缩器如果只追求还原而缺乏可学习性,后面的 Transformer 仍会被长序列拖垮。H3 把 tokenizer 当成核心架构,而不是前处理模块。
第三是 H3-Omni Transformer 与异构训练调度。引入全模态上下文后,样本序列长度方差扩大到三倍,理解与生成的计算形态也不一样。MiniMax 将两类负载分开优化,再做样本间负载均衡,称端到端训练吞吐提升接近 30%。这类工程改进不够吸睛,却直接决定一个视频模型能否持续迭代。
‘上下文再生成’比传统超分更聪明
H3 没有用独立超分模型把低清结果放大到 2K,而是让基础模型带着原始多模态上下文重新生成。传统超分只能根据已有像素猜细节,遇到小字、品牌标识和复杂纹理时容易编造;上下文再生成则能重新读取原始文字、图片、音频和参考视频,理论上更有机会恢复正确内容。
官方还宣称,H3 在 2K 下每秒价格低于主流模型的三分之一,768p 下也不到主流 720p 模型的一半。不过这仍是厂商口径,技术报告尚未发布,模型权重也只是承诺在未来几天开放。没有第三方基准、显存需求和真实开源许可证之前,‘开源’还不能算完全落地。
真正的行业信号:视频模型正在变成创作系统
H3 的意义不在于单次生成是否压过某个闭源模型,而在于它把视频模型的竞争从‘更漂亮的短片’推向‘更少的任务切换’。如果统一预训练能覆盖生成、参考、编辑和音画联合建模,创作工具的护城河将从拼接多个专家模型,转向如何组织上下文、数据和反馈。
所以,接下来最值得盯的不是 H3 的样片,而是权重何时真的开放、第三方硬件能否跑起来,以及统一模型在复杂编辑中是否仍能保持角色和品牌一致性。视频生成的下一阶段,可能不是更长的片段,而是一个模型真正接管整条创作链。