一段文字让视频里的五个角色同时打架、递东西、绕开障碍,今天的生成模型往往还是会"各动各的"。GraphVid 给出的答案,不是继续堆 prompt,而是把场景先画成一张交互图。论文提出 graph-conditioned image-to-video 模型:把对象、动作和对象之间的关系结构化,再交给生成模型执行;同时配套构建 GraphVid-Bench,用带关系标注的视频训练和评估多主体交互。结果很直接:相比 Motion-I2V,FID 最多下降 39.9%,FVD 下降 37.6%,PSNR 从 9.87 提升到 15.98,SSIM 从 0.38 提升到 0.61,而且训练数据和可训练参数都更少。它的价值不只是画面更清晰,而是让"谁影响谁"成为模型可计算的条件。遮挡、重叠、多主体协同这些最难靠文字说清的场景,图结构比一长串 prompt 更像导演的分镜表。更重要的是,这种接口把视频生成从"描述画面"推向"编排关系":未来的广告、游戏过场和机器人训练数据,都可能先编辑一张场景图,再让模型补出连续画面。当然,论文是预印本,指标依赖数据集和实验设置,离通用生产工具还有距离。但方向已经很明确:视频生成下一阶段拼的不是会不会动,而是能不能按结构动。