9 月 10 日,Vidu 团队把 S2 的技术报告挂上 arXiv(编号 2609.11638),五天后,这篇论文冲上 Hugging Face Daily Papers 当日热度第一,拿到 393 个 upvote。S1 七月才发布,S2 就已经落地——这次升级的密度,值得拆开看。
一次升级,三个能力
S2 不再是单个模型,而是两个:S2-Avatar 管实时交互数字人,S2-Editing 管实时视频编辑。数字人这边,分辨率从 S1 的 540p 拉到 720p,帧率 25-42 FPS;更关键的是"动态参考"——直播过程中随时丢一张新参考图,就能换装、换道具、换场景,不用重开流。指令跟随也加强了,从"说话头"扩展到跳舞这类大肢体动作。S2-Editing 则是对着视频流实时改:风格迁移、虚拟试穿、角色替换、背景替换,同时保住原视频的运动和节奏。还有一步比较超前:生成的或编辑过的画面可以实时转成左右眼同步的立体视频,直接推给 VR 头显。
流式生成最怕的"漂移",S2 用 Self-Replay Forcing 治
流式视频生成的老大难是误差累积:每一段都以自己上一段的输出为条件,错一点就会滚雪球。S2 的解法叫 Self-Replay Forcing(SRF)——把模型自己生成的轨迹加噪后重放,在梯度可用的因果 pass 里再过一遍,让模型学会"接住自己的输出"而不是被它带偏,防止误差跨分段累积。这不是玄学,是对流式生成稳定性的正面攻坚。
推理栈才是隐藏主角
720p、25-42 FPS 不是模型单独扛下来的。官方 GitHub(shengshu-ai/Vidu-S)写得很清楚:TurboDiffusion 加 TurboServe 的组合,靠高效 attention、低位 GEMM、kernel 与启动优化、多 GPU 流水线,把实时推理塞进低成本 GPU。作者报告称,在他们评测的五个公开基准上,S2 全面超过基线模型——注意这是作者自评,独立复现还没出现,引用时留个心眼。
所以呢
从 S1 到 S2,路线图已经很清晰:实时视频生成正在从"演示品"变成"基础设施"。Avatar 对着数字人直播与陪伴场景,Editing 对着虚拟试穿与影视预演,空间视频对着 VR——每一项都踩在具体应用上。真正的悬念在成本:低位 GEMM 和流水线优化决定了这套东西能不能长期跑在便宜显卡上。可玩 demo 已经开在 vidu.com/vidu-stream,API 文档同步放出;想验证的话,自己跑一遍比看跑分有用。