视频世界模型这两年进化飞快:画面越来越真,交互越来越顺。但有个问题一直没解决——玩得越久,世界越"糊涂"。敌人还剩几个?道具用掉没?角色走出画面后状态还在不在?这些信息只存在于生成帧里,模型全靠"感觉"续写,长交互一多就露馅。9 月 9 日提交到 arXiv 的论文 Programmable World Model(Alaya Lab,11 位作者)给出了一条干脆的路线:别让画面管状态,状态交给程序管。
问题:状态藏在帧里,迟早会漂
论文摘要对现有视频世界模型的批评很直接:它们"缺乏在长时间交互下维持持久世界状态、执行可编程规则的可靠机制"。生成模型擅长的是"下一帧长什么样",而战斗计数、实体生死、规则约束这些是离散逻辑状态——让一个概率采样器去硬记,本质上是用错了工具。这也解释了为什么很多演示只能剪成十几秒的片段:拉长到分钟级,状态漂移就藏不住了。
方案:程序管状态,视频只管渲染
框架的核心是一次彻底解耦,分三层:
- Agent 写程序:把自然语言指令翻译成可执行程序,程序里定义实体状态和状态转移规则,可以直接控制单个实体及其交互;
- 轻量引擎维护状态:执行这些程序,更新并维护一个显式、持久的全局世界状态——注意,包括画面外的实体和非视觉属性,这是纯视频路线天然做不到的;
- 视频模型当渲染器:状态与画面之间用带状态的 3D 有向包围盒(OBB)做中间表示,连同目标相机轨迹,确定性编译成像素级对齐的时空条件信号,喂给一个预训练视频模型做"生成式渲染"。
这套设计直接支持带预设机制的可玩游戏:用户能单独操控某个实体,游戏全程状态在线不丢。
结果:CombatStateBench 状态准确率 98%
团队同步发布了评测基准 CombatStateBench,专测可编程世界模型。论文报告:计数准确率 94%、状态准确率 98%,并支持连贯的长时域生成,优于现有交互式视频世界模型——这是作者自报口径,具体名次等独立复现,但"状态用程序维护"这个差异点本身已经足够清晰。项目已在 GitHub 开源(AlayaLab/pwm),发布当天冲上 Hugging Face Daily Papers 热榜前排。
评论:把游戏引擎最成熟的部分还给世界模型
这件事的本质,是把经典游戏引擎里最可靠的东西——显式状态机——重新塞回生成式世界模型。纯端到端路线赌"模型足够大就会自己学会记状态",这条路线则承认:强逻辑、需要审计的状态,程序比概率可靠。对做交互内容的人来说,可编程意味着可控、可调试、可复现,而这恰恰是生成模型最缺的三样。值得盯的下一步是:这套"程序+渲染"的分工,能不能撑住比战斗场景更开放的世界——如果能,世界模型的落地路径会短很多。