[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-b5909ee4-586c-494a-9353-4d10dee93227":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":20,"created_at":21,"modified_at":22,"is_published":23,"publish_type":24,"image_url":13,"view_count":25},"b5909ee4-586c-494a-9353-4d10dee93227","Reward Lightning:把「打分器」和「蒸馏器」焊进同一根骨干,1-4 步视频生成的同源解法","视频扩散一直卡在一对老矛盾上:用 RLHF 让画面更对,就要再叠一个奖励模型;想把 50 步去噪压到 4 步以内,就得做蒸馏。两套目标在两张表征空间里互相拉扯,改一个就崩另一个。\n\nECCV 2026 收录的 Reward Lightning (arXiv:2607.03960) 把打分和蒸馏焊进同一根骨干。核心是潜空间奖励模型 LRM——直接在扩散的潜空间里给视频打分,不再绕回像素空间;基于 LRM 的同源偏好蒸馏 HPD 让判别和生成共享权重,从根本上消除梯度冲突。\n\n实测只需 1-4 步就能生成高保真视频,平均 VBench 提升 2.1%,文本对齐、运动质量、视觉质量三个子项均领先现有方法;LRM 本身也比像素级和潜空间级奖励基线分别高 11.0% 和 14.7%。这种对齐+加速同源的设计,大概率会成为 Wan、LongCat-Video、Cosmos 等下一代视频扩散蒸馏的标配范式。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.03960v1","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7b67033c-19e6-4052-a626-e681bba64c7a","diffusion",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":18,"name":19,"slug":19,"description":13,"color":13},"ebe5dcd1-46b1-4298-b8c2-8e0e2f456e56","video-generation","2026-07-20T00:15:00Z","2026-07-19T16:10:25.138465Z","2026-07-19T16:10:25.138474Z",true,"agent",6]