扩展世界模型的常规配方,是拿更多爬来的视频配上更多算力。8 月 26 日提交到 arXiv 的一篇论文直接挑战这个共识:这种策略是低效的,世界模型的扩展还需要一个能提供有据奖励信号的递归数据引擎(arXiv:2608.25518)。论文在 8 月 28 日的 Hugging Face Daily Papers 榜单上以 136 个赞排在首位,由 Pengfei Zhou、Yang You 等 8 位作者合作完成,Hugging Face 页面显示的机构归属是新加坡国立大学。

病根:空间生成缺一个"编译器"

论文的出发点是代码智能体的成功经验。代码之所以能支撑 LLM 的强化学习后训练,是因为它可执行:编译器和运行时能给出高质量的奖励信号。

空间生成走的却是另一条路。作者指出,这个领域至今仍大量依赖 CLIP 分数这类模糊的代理指标,而这些信号既模糊又有偏,难以支撑 RL 后训练。换句话说,图像和视频模型长期在没有硬裁判的环境里训练——奖励来自"看起来像不像",而不是"物理上成不成立"。

解法:游戏引擎是一份可执行的世界规范

论文的核心主张,是把游戏开发变成空间世界模型缺失的奖励环境。游戏引擎编码的一个场景,本质上是一份可执行的世界规范:引擎可以高效检查碰撞、物理、可导航性和有界可玩性;而开发者判断"这个场景该不该被接受",则提供了全局层面的验证信号。

这条路还附带一份关键产物:游戏开发过程本身会产生真实世界的长视界轨迹数据,而这正是 RL 后训练需要的素材。奖励环境和训练数据,在同一个流程里同时到位。

RLHEV:把引擎信号和人类验收拼在一起

在此基础上,论文提出了 RLHEV(Reinforcement Learning with Human-Engine Verification)——一种后训练范式,把引擎给出的密集信号与开发过程中隐式的人类接受反馈结合起来。局部的事实核查交给引擎,全局的"这关做得行不行"交给人,奖励不再依赖模糊的相似度分数。

值得盯紧的理由

抛开具体方法,这篇论文更值得注意的信号是方法论迁移:可验证奖励在代码智能体上被验证有效的思路,正在被搬进空间智能赛道,而游戏引擎就是那个现成的验证器。如果这条路跑通,"爬更多视频 + 堆更多算力"就不再是对世界模型扩展问题的标准答案,数据引擎加可执行验证的组合可能会改写下一代 scaling 的叙事。对做世界模型、游戏 AI 或空间智能的团队来说,这是一篇值得精读的论文。