视频模型这两年在「看懂画面」上进步飞快,但港大团队 9 月放出的 TempCloze 基准给整个行业泼了盆冷水:把一段视频掐头去尾,让模型从四个候选片段里挑出真正缺失的中段——这个人类随手就能完成的"视频完形填空",把 31 款主流 Video-LLM 考了个底朝天(arXiv:2609.01515)。
考题怎么出:同源干扰项设计
TempCloze 收录 1,521 条视频,来自 LVD-2M、EgoLife 等 7 个公开来源,以长镜头和第一人称视角为主。每条视频被切成开头(B)、缺失中段(M)、结尾(E)三部分,模型拿到 B 和 E,要从 4 个候选里认出真正的 M。
巧思全在干扰项上,而且同一维度用同源视频构造:语义维度(Semantic)的干扰是同一条视频里互不重叠的三个片段,考"该发生什么";时间对齐维度(Alignment)的干扰是把正确片段提前、推后或拉宽,考"何时发生";展开维度(Progression)的干扰是倒放、乱序和循环,考"该如何展开"。因为题干和选项全是视频片段,选项措辞、语言先验这类文字捷径被直接焊死。默认评测每个片段抽 16 帧,一道题最多 96 帧输入。
31 款模型的分数表:对齐维度集体塌方
评测覆盖 10 款闭源和 21 款开源模型,论文直接把时间对齐称为主要瓶颈:闭源模型平均分从语义维度的 70.73%、展开维度的 67.72% 跌到对齐维度的 48.13%;开源模型平均只剩 26.54%——四选一的随机线是 25%,几乎等于乱猜。人类基线是 97%。
闭源榜榜首是 Seed1.8(开思考模式),平均 88.58,对齐维度 76.92;Qwen3.5-Plus 紧随其后,平均 85.74。真正扎眼的是几款旗舰的对齐塌方:GPT5.4 平均 56.89,对齐维度只剩 37.41;Claude4.6-Sonnet 平均 51.81,对齐维度 28.80,相比自己语义维度的 55.69 几乎砍半;Grok4.1 三个维度全在 24% 上下,平均 24.11,干脆低于随机线。同厂代差也很戏剧:Seed1.6 的对齐维度只有 17.83,与 Seed1.8 隔了一代判若两款模型。
开源侧,对齐维度过了 50 的只有 Qwen3.5 系两款:35B-A3B 拿到 51.55,397B-A17B 是 50.62,小杯反超大杯;平均分最高的开源模型也是 397B-A17B 的 68.27。而 Qwen3VL-32B-Instruct 的对齐分数只有 10.91,连随机线的一半都不到——「看得懂内容」和「排得出先后」在同一家人身上同时成立又同时失守。
为什么对齐这么难:四条行为线索
团队对四款代表模型做了行为敏感性分析,四条发现值得记下:候选片段换个顺序,模型的选择就不稳定;模型明显更依赖开头上下文而不是结尾;更密或更长的视觉输入反而会稀释关键时刻的边界线索;test-time scaling 能带来一些提升,但拉不平对齐维度的缺口。
所以呢
这份被 EMNLP 2026 Findings 收录的工作,值得所有拿「视频理解」当卖点的人读一遍原表。它至少提醒两件事:其一,平均分会掩盖结构性短板——GPT5.4 语义维度 68.11,对齐维度 37.41;Qwen3VL-32B-Instruct 更极端,对齐 10.91 连随机线一半都不到,但这类差距会被综合分稀释掉。其二,选型时如果业务场景是安防、剪辑、具身智能这类时序敏感方向,务必单独看对齐类指标,而不是只看综合榜。视觉模型离「真正看懂视频」,还差最后这一段时间课。