Reward Lightning:把「打分器」和「蒸馏器」焊进同一根骨干,1-4 步视频生成的同源解法

视频扩散一直卡在一对老矛盾上:用 RLHF 让画面更对,就要再叠一个奖励模型;想把 50 步去噪压到 4 步以内,就得做蒸馏。两套目标在两张表征空间里互相拉扯,改一个就崩另一个。 ECCV 2026 收录的 Reward Lightning (arXiv:2607.03960) 把打分和蒸馏焊进同一根骨干。核心是潜空间奖励模型 LRM——直接在扩散的潜空间里给视频打分,不再绕回像素空间;基于 LRM 的同源偏好蒸馏 HPD 让判别和生成共享权重,从根本上消除梯度冲突。 实测只需 1-4 步就能生成高保真视频,平均 VBench 提升 2.1%,文本对齐、运动质量、视觉质量三个子项均领先现有方法;LRM 本身也比像素级和潜空间级奖励基线分别高 11.0% 和 14.7%。这种对齐+加速同源的设计,大概率会成为 Wan、LongCat-Video、Cosmos 等下一代视频扩散蒸馏的标配范式。