视频生成这条赛道今年卷得厉害,但一份 9 月 23 日提交到 arXiv 的综述把行业的注意力拉回了一个更根本的问题:模型画得再好,记不住前面发生了什么,长视频照样崩。

这份题为《The Past Frames the Future》的综述由 25 位作者联合完成,一作 Harold Haodong Chen 在 Hugging Face 论文页自述,这是该方向的第一份系统性综述。论文上线两天即在 Hugging Face Daily Papers 收获 35 个 upvote,配套 Awesome 清单仓库已达 54 stars——社区对这个问题的关注度可见一斑。

为什么记忆是自回归视频生成的命门

自回归(AR)视频生成靠因果 rollout 扩展视觉序列:每一步都基于已生成的内容预测下一段。问题在于,实际部署的模型必须在有限的上下文窗口、存储和算力约束下运行。综述指出,随着序列扩展,三类关键历史信息——实体身份、动态状态、干预引发的因果变化——往往在相关性还没耗尽之前,就提前离开了活跃上下文。

结果就是观众熟悉的那种翻车:角色转个身回来换了张脸,被打碎的杯子自己复原,镜头切走再切回,房间布局已经变了。这些问题过去被归为「一致性」,综述把它们统一重新定义为记忆问题:跨外层 AR 步维持的持久历史信息,即使原始证据已不可局部访问,仍能影响未来生成。这个定义把散落在「长视频」「世界模型」「一致性生成」各处的工作拉进了同一个坐标系。

四种记忆载体与一张分类地图

综述按 Forms/Functions/Operations/Learning/Evaluation 五个视角组织文献。从配套仓库看,记忆「载体」至少四大类:

  • Visual Memory(视觉记忆):直接保留像素或 VAE 潜空间表征,如 WorldMem、DecMem、MemLearner
  • Implicit State Memory(隐式状态记忆):藏在 attention cache、循环网络或状态空间模型的内部状态里
  • Explicit State Memory(显式状态记忆):以实体为中心或空间几何形式显式建模
  • Adaptive Parametric Memory(自适应参数记忆):直接改写模型参数本身

这套分类不是学究式整理。配套仓库收录的 282 个条目中,181 个来自 2026 年——近三分之二的核心工作挤在最近九个月,载体路线之争才刚开始,地图此刻参考价值最大。

基准缺位才是真短板

综述最值得警惕的是对评测的判断:现有评测无法诊断「真正的记忆能力」。仓库整理了 14 个记忆专用基准,R2M-Bench、MBench、WBench、MemoBench 等,几乎全部诞生于 2026 年,且多数只覆盖单一维度。当各家模型都宣称「分钟级生成」时,拿什么证明画面里的角色还记得三分钟前的剧情?没有标准化评测,这类宣传基本只能靠自证。

所以呢

对做视频生成的团队,这份综述和配套仓库值得进收藏夹:选路线先看四大载体分类,别在已被证明走不通的分支上重复投入。对观察者,更有趣的信号是——LLM 圈吵了两年的「上下文窗口 vs 外挂记忆」之争,正在视频生成领域原样重演,节奏还快得多。值得盯的下一个问题:这 14 个基准里,会不会跑出视频圈的「MMLU 时刻」?

参考:论文 arXiv:2609.28466 | 仓库 Awesome-AR-Video-Memory