视频编辑模型发展到现在,绝大多数工作都在一个隐含假设下打转:给你一段固定长度的素材,模型把它「原地重绘」一遍——编辑后的帧与源视频逐帧对齐,时间跨度固定。这个假设对预录片段成立,但对直播游戏换风格、对正在进行的镜头推一个运镜这类开放流场景,直接失效:帧是持续到来的,编辑必须延伸到未来帧,而不是作用在一段静态输入上。8 月 21 日提交到 arXiv 的论文 InfinityEdit(arXiv:2608.20910)正面研究了这个设定,并把它命名为 infinite video editing——无限视频编辑(https://arxiv.org/abs/2608.20910)。
任务:从「改一段」到「改一条流」
论文对这个新任务的定义是:给定前序片段和一条编辑请求,模型必须生成「下一段」内容——它既要延续流的推进,又要把请求的编辑落实进去。随著指令以无界序列不断到来,这个过程不断重复。这带来两个核心挑战:其一,编辑必须是忠实的延续(continuation),而不是逐帧改写(rewrite);其二,随着编辑不断累积,生成质量必须保持稳定,不能越改越糊。
方法:三个注意力模块的轻量适配器
InfinityEdit 的解法不是重训一个更大的编辑模型,而是给流式视频生成器外挂一个轻量 edit adapter。适配器包含三个注意力模块,分工明确:
- History cross-attention(历史交叉注意力):用输入帧引导去噪帧,让新内容锚定在已有画面上;
- Temporal causal self-attention(时间因果自注意力):让时间线索只从早帧流向晚帧,保证因果性;
- Edit cross-attention(编辑交叉注意力):把编辑请求注入生成过程。
推理阶段的策略尤其关键:适配器只在编辑请求到达的那个 chunk 激活,后续 chunk 交回原模型、重置锚帧继续生成。这样编辑被落实的同时,原模型的无限生成能力得以保留——论文称之为 edit-ignition(编辑点火)的设计,点火一次,余程自燃。
数据与验证
由于这是一个新任务,作者还配套设计了一条数据收集管线来构造无限视频编辑的训练数据。实验部分论文报告:InfinityEdit 在每条编辑下都能忠实延续视频流,并在无界编辑序列上保持稳定。这项工作 8 月 21 日提交,12 位作者署名,论文 18 页;发布当天即登上 Hugging Face Daily Papers 榜单(8 月 24 日快照中获 30 次点赞,为当日热度第二)。
所以呢
对流式世界模型和互动视频而言,「可编辑」从静态资产属性变成了运行时能力。当编辑可以随时点火、生成永不停止,直播换风格、游戏内实时重构画面这类今天需要渲染管线硬编码的效果,就变成了对生成模型说一句话的事。轻量适配器路线也提示:在流式生成基础设施之上叠加能力,可能比每次都从头训练专用模型更接近这类问题的正解。