视频世界模型最尴尬的时刻,不是画面崩掉,而是你操控相机转了一圈回到原地,发现刚才的房间变成了另一间——模型把几分钟前生成的内容忘得一干二净。9 月 21 日,腾讯 ARC Lab(TencentARC)在 arXiv 发布 WorldCrafter,论文上线次日冲上 Hugging Face Daily Papers 日榜第二(111 个 upvote),GitHub 仓库已有 218 星,代码与权重全部开源。
失忆,才是世界模型的硬伤
今年以来开源世界模型密集出现:京东 EchoWM 主打全模态、ForgeWM 主打一步去噪 72FPS、SolarWM 用 143 万条视频堆训练数据。但它们大多绕开了同一个问题:长时序重访一致性。视频生成依赖最近几秒的上下文,历史观察一旦滑出上下文窗口,场景信息就丢了。
WorldCrafter 的思路是给生成器配一个「相机可查询的隐式 3D 记忆」:一个与视频生成器联合训练的记忆编码器,加上姿态条件读取模块,把过往多视角观察压缩成一组固定数量的目标视角记忆 token,在去噪前注入生成器。关键在「隐式」二字——不做显式深度估计,不做几何变换对齐,由请求的视角决定哪些历史信息被压进有限的 token 预算。
官方口径的成绩单
项目页给出的基准覆盖 145 个场景、725 条相机轨迹,官方报告 WorldCrafter 在长时程重访一致性和相机控制精度上超过全部评测基线,并拿到最高的 VBench 总分。注意这些数字目前只有官方自报一个来源,第三方复现尚未出现,读者按官方口径理解即可。
工程交付上有两个模型:WorldCrafter-Base 和经少步蒸馏的 WorldCrafter-Fast。Fast 支持图生视频与文生视频,分辨率 384×640,以 33 帧为一个生成块;相机轨迹用 NumPy 矩阵描述,也提供 forward、yaw_left 这类动作式指令。环境要求 Python 3.11 + PyTorch 2.10 + CUDA 12.8,权重放在 HuggingFace(TencentARC/WorldCrafter-Base 与 -Fast)。
所以呢
两点值得盯:一,README 明说交互式 demo「正在调试中」,单卡 demo 用的是 Fast 图生视频加编译加速——离丝滑的实时探索还有距离,蒸馏换来的速度够不够撑实时流式交互,要等社区实测;二,世界模型的竞争轴心正在从「生成质量」转向「记忆架构」,谁能记住自己生成过的世界,谁才配叫世界模型。
参考:https://arxiv.org/abs/2609.24984 · github.com/TencentARC/WorldCrafter · huggingface.co/papers/2609.24984