刷到视频生成模型的 demo,画面一个比一个惊艳。但换一个问法:给它一张参考图、一句指令,它到底有没有把任务做成?过去的主流基准答不上来,而刚刚登顶 Hugging Face Daily Papers 日榜(151 票、8 月 20 日当日第一)的 SemComp-Bench,专门就是冲着这个问题去的(arXiv:2608.17426)。

换一种考法:只看结果,不看过场

论文提出了一个新任务定义:Semantic Task Completion(语义任务完成)。它对「成功」的判定有两条——既要达成预期结果(outcome achievement),也要保持语义接地(semantic grounding):即生成结果与参考图之间,在任务相关的高层语义上对得上号。

反直觉的地方在于,这套评价明确不要求两件事:不要求展示完整的中间步骤序列,也不要求和参考图保持传统意义上的外观一致性。用论文提交者的话说:「视频生成器能不能真正把任务做完——而不只是生成一段看起来像模像样的视频?」

数据集怎么造:九步流水线,产物只考「结果帧」

配套的 SemComp-Data 覆盖六个领域,每条实例由四件套组成:参考图 + 详细指令 + 简短指令 + 以结果为中心的视频片段。数据来自真实视频,官方 GitHub 仓库(Kelly372/SemComp-Bench)公开了完整构建管线:标题过滤、任务分类、参考/结果时间戳定位、画面质量校验、双语言指令生成、片段抽取、指令归一化、对齐类型标注、结果状态描述——九个阶段逐步把原始视频洗成标准化实例。片段抽取支持两种时长策略:3–4 秒短片与 3–10 秒长片。

需要留意许可证:管线原始代码是 Apache 2.0,但其中改编自 Panda-70M 的切分组件限于非商业研究用途,ImageBind 部分遵循 CC BY-NC-SA 4.0——仓库整体不能当作商业可用。

OA 与 GR:两个分数各管一件事

打分环节交给一个视觉语言模型(VLM):它对生成视频回答结构化的二值问题,最后输出两个分数——OA Score 衡量结果达成度,GR Score 衡量生成可靠性。相比「人眼评比」或端到端打单一分,二值问答让每个失分点都能落到一道具体的题上,可解释性明显更好。

在代表性视频生成模型上的实验结论很直白:既要完成任务、又要保住与参考图的任务相关语义接地,对现在的模型依然很困难。换句话说,生成「好看的画面」和生成「做成了事的画面」之间,还隔着一段不小的距离。

为什么值得盯

视频生成正在从「能生成」走向「能用」。一旦下游场景是教学演示、操作指引、产品展示,用户在意的就不是纹理和美学,而是「最后那一下到底做没做成」。SemComp-Bench 把评价重心从过程表现力挪到结果达成度,等于给全行业换了一张考卷——接下来各家的 leaderboard 军备竞赛,大概要换赛道重跑了。

一句话:当基准开始考「任务完成」,视频生成模型的下一轮迭代目标,也就被悄悄改写了。