交互式视频世界模型一直卡在一个矛盾上:双向视频生成器画质好,但去噪步数多、延迟高,撑不起实时交互;因果蒸馏能把采样压到一两步,可一旦加上键盘、鼠标这类游戏原生控制,离散的按键状态和连续的鼠标轨迹必须和时间压缩后的 latent chunk 保持帧级对齐,训练与自回归 rollout 中对齐稍偏,控制就失灵。arXiv 2608.14022 提出的 ForgeWM 给出一套渐进式解法,由 CUHK、腾讯 PCG、复旦、上海 AI 实验室与 HKUST 合作完成,代码、权重、数据全部开放。

四阶段渐进蒸馏配方

ForgeWM 不追求一步到位,而是把一个双向动作条件生成器分四个阶段逐步改造成因果学生模型。Stage 0 在目标游戏上做双向域适应微调,之后冻结,充当后续的教师;Stage 1 用 teacher-forced 的分块因果注意力把生成器变成自回归,同时保住控制保真;Stage 2 用因果一致性蒸馏压缩采样轨迹,解锁少步生成;Stage 3 让学生模型自己 rollout,由冻结的双向教师在分布层面做 on-policy 监督。最终产出一组按去噪预算特化的学生,分别运行 1、2、4 步。基座是开源的 Matrix-Game 2,训练数据来自 GameFactory 的 Minecraft 片段与 SCOPE 的 FPS 数据。

一步去噪 72 FPS

在 1000 条配对 Minecraft 轨迹的评测中,论文报告 ForgeWM-1 达到 72.10 FPS、单 chunk 延迟 168.2 毫秒(352×640 分辨率,单张 H20 实测,不含加载与 VAE 解码),对照组 Matrix-Game 2 蒸馏版为 370.9 毫秒、32.35 FPS。质量侧,作者称其在七项质量与控制指标中拿下六项领先:ForgeWM-2 的成像质量 0.6865、键盘控制准确率 0.9740、鼠标控制准确率 0.8268 均为评测表最高。盲测侧,41 名参与者共 615 次三盲选择,ForgeWM-4 拿下 68.8% 的视觉质量偏好,综合占比 60.7%。

回放时精修:一步草稿,四步画质

这套系统最巧的设计是双路径部署:交互时跑一步学生保延迟;交互结束后,同一个一步学生把存下的草稿 latent 重新加噪,按录制的动作序列逐 chunk 精修。结果显示精修版 0.6155 LPIPS 对上直接四步生成的 0.6168,画质基本打平,但与玩家实际玩到轨迹的距离(0.1970)只有从噪声重生成的(0.6187)约三分之一。精修用的就是部署模型本身,不加权重、不占在线算力。

8 张卡复现,配方可迁移

全部四阶段 Minecraft 检查点、少步学生和 CrossFPS 推理模型,加上 4 万条预编码 GF-Minecraft 训练片段都已放上 HuggingFace,论文称完整配方 8 张 GPU 即可复现。同一套四阶段流程,把手柄按键加双摇杆的动作接口和 SCOPE 数据换进来,不改架构就迁移到七款 FPS 游戏,宏平均配对 LPIPS 为 0.656。对做交互生成的人来说,这篇的启发很直接:实时世界模型的复现门槛被压到了学术实验室规模——8 卡、开源数据、可跑脚本都齐了,下一步要卷的不是算力,而是控制对齐与蒸馏策略的细功夫。论文地址