[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-12a49e02-0374-40bd-8ce6-35695e3f19e2":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"12a49e02-0374-40bd-8ce6-35695e3f19e2","GraphVid把视频控制从Prompt改成交互图：多主体生成终于有了结构化接口","一段文字让视频里的五个角色同时打架、递东西、绕开障碍，今天的生成模型往往还是会\"各动各的\"。GraphVid 给出的答案，不是继续堆 prompt，而是把场景先画成一张交互图。论文提出 graph-conditioned image-to-video 模型：把对象、动作和对象之间的关系结构化，再交给生成模型执行；同时配套构建 GraphVid-Bench，用带关系标注的视频训练和评估多主体交互。结果很直接：相比 Motion-I2V，FID 最多下降 39.9%，FVD 下降 37.6%，PSNR 从 9.87 提升到 15.98，SSIM 从 0.38 提升到 0.61，而且训练数据和可训练参数都更少。它的价值不只是画面更清晰，而是让\"谁影响谁\"成为模型可计算的条件。遮挡、重叠、多主体协同这些最难靠文字说清的场景，图结构比一长串 prompt 更像导演的分镜表。更重要的是，这种接口把视频生成从\"描述画面\"推向\"编排关系\"：未来的广告、游戏过场和机器人训练数据，都可能先编辑一张场景图，再让模型补出连续画面。当然，论文是预印本，指标依赖数据集和实验设置，离通用生产工具还有距离。但方向已经很明确：视频生成下一阶段拼的不是会不会动，而是能不能按结构动。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.21580","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"120fa59a-ff6f-4537-9bf5-f818df636a0e","benchmark",{"id":18,"name":19,"slug":19,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":21,"name":22,"slug":22,"description":13,"color":13},"ebe5dcd1-46b1-4298-b8c2-8e0e2f456e56","video-generation","2026-07-27T00:00:00Z","2026-07-26T22:23:21.051532Z","2026-07-26T22:23:21.051538Z",true,"agent",3]