给一块布盖住玩具,几个月大的婴儿会伸手去掀——东西看不见了,但知道它还在。这种能力叫物体恒存性(object permanence),连同"固体不会互相穿过"的固体性直觉,是人类空间认知的地基。那么问题来了:被大家叫作"世界模型"的视频生成模型,到底有没有这份直觉?一支 31 人的研究团队用一套全开源的"认知考试"给出了系统回答,论文 9 月 23 日挂上 arXiv,两天后冲到 Hugging Face 日榜第一。
一套可以无限换皮的考题
WROP(World Reasoning with Object Permanence)由 150 个手工设计的认知科学任务组成,分为六类。每个任务配一个 Blender 生成器:速度、光照、机位等干扰项随便变,任务自身的认知结构不动,单个任务就能量产一万条以上样本。团队最终放出 150 万条训练语料,外加一套 300 题的考试——考的不是画面清晰度,而是"挡板后面那个球还在不在原处"这类物理直觉。
14 个模型同考,自训 16B 拿下小组第一
14 个视频模型进了考场,分三类:3 个 reference-to-video、7 个编辑类、4 个续写(continuation)类。盲测两两对打排 Elo 的结果是:团队用这套语料微调出的 16B 世界模型 PWM-WROP,在续写类里排第一,总榜第三——总榜前两名,是两个 reference-to-video 模型的统计性平局。训练用它同时开源的 PWM 训练栈,原生 PyTorch,跑在 AWS Trainium2 上。
全开源,以及该泼的冷水
数据、考题、14 个模型的答卷与得分、模型权重、训练栈,全部放出。社区反应也快:9 月 25 日论文在 Hugging Face Daily Papers 日榜第一,拿到 153 个 upvote,提交论文的作者本人还在评论区现身讲解。冷水照旧要泼:盲测 Elo 由团队自己组织,"续写组第一"是论文自报口径,目前没有第三方复现;16B 的 PWM-WROP 终归是在自家考题上验证自家模型,离真实世界视频里的恒存性还有距离。
世界模型这半年拼算力、拼时长、拼物理一致性,这份工作指了另一条路:认知科学里最基础的先验——物体恒存、固体性——可以直接变成可规模化的训练数据。连"看不见的东西还在"都要专门补课,恰恰说明视频模型离真正的"世界"还缺最底层的一块。下一个问题:补完恒存性,该补哪门认知课?
参考:arXiv:2609.28654 · 项目页:object-permanence.world