MiniMax-H3 是那种"什么都能生成"的模型:文本、图像、视频、音频在同一个共享潜空间框架里联合建模。上线不到两个月,它已经被蒸馏过(FastH3)、被后训练过(fal 的 H3 Max)、权重也被第三方拆解过。但一个更根本的问题一直没人系统回答:它真的能对物理世界做推理吗?新加坡国立大学、复旦大学与腾讯的 13 人研究团队最近交出了一份 517 题的"体检报告"(arXiv:2609.18323),结论不太客气——总成功率 41.97%。
这套评测的刁钻之处:单模态只给一半证据
按论文自述,现有视频生成评测大多有一个通病:提示词和目标内容高度重合,模型基本在"看图说话"。这套评测反着来:文字提示只说明要执行的操作,任务相关的关键信息被故意留白,必须从图像、音频、视频片段这些互补证据里自己推断。比如音频题会给出一张含多个候选声源的图,模型要先把声音和正确的物体对上,再把这种理解画进生成结果里。
四个场景覆盖 29 个子类:
- 多视角空间推理(MSR):单图输入,200 题,考察跨互补视角的空间关系——43.50%
- 音频歧义消解(ADR):图 + 音频,146 题,用声学线索消解视觉歧义——27.40%,全场最低
- 视频决策推理(VDR):前缀视频续写,100 题,对观察到的动态做出合理响应——56.00%,全场最高
- 视听整合推理(AVIR):视频 + 音频,71 题,把听觉证据或口头约束融进续写与编辑——47.89%
评分不是对答案:每条生成结果由 3 名专家独立判断是否满足语义约束,允许存在多个合法的视觉呈现。总成功率按全部 517 题计算,不是四个场景的简单平均。
42 分背后:会生成,不等于听得懂
两个发现值得展开。第一,音频接地是最短的板。论文列出的典型失败包括:把声音关联到错误的可见声源、混淆相似的机械声。也就是说,画面越"看起来对",这种错位越难被察觉——评测框架的 README 说得很直白:视觉合理性是不够的,一段视频可以看起来很有说服力,却不满足任务要求的空间、时序或视听条件。第二,视频题(56%)明显好于音频题(27.4%),团队自己的结论是:提供多模态输入,并不保证任务被可靠完成,有效的多模态整合仍是未解问题。
论文也提前打好了预防针:四个场景的数据、提示词和生成目标各不相同,这些成功率描述的是任务级表现,不能当作不同模态"内在价值"的对照实验;而且生成结果只是行为证据,失败可能出在感知、证据整合或生成的任何一环。
泼两盆冷水,再说一句公道话
冷水一:目前评测数据集、评测结果与自动评测管线在仓库里都还是未勾选的 TODO(团队称正在构建一条 DeepSeek 驱动的自动评测管线),所有数字都是单一团队的自报结果,第三方暂时无法复现。冷水二:它只测了 MiniMax-H3 一个模型,"omni 模型普遍如此"是推论,不是结论。
公道话是:这份评测提出的问题比给出的数字更有价值。当下 omni 生成模型的公开竞赛集中在画质、时长、分辨率这些可见指标上,而"是否真正整合了跨模态证据"这个维度,此前少有评测框架专门去碰。这篇论文在 9 月 18 日的 Hugging Face Daily Papers 榜排到第二(92 个赞),说明社区确实在渴这个方向。对做视频生成的团队,音频-视觉对齐大概是被低估得最狠的一块短板。
所以,下次再看到"一个模型生成整个声场"的演示,不妨多问一句:它生成出来了,但它听懂了吗?
参考:arXiv:2609.18323(arxiv.org/abs/2609.18323)· 评测框架 github.com/gulucaptain/MiniMax-H3-Reason