VideoRAE 把 frozen 视频基础模型改造成生成器 latent:UCF-101 gFVD 40/93,收敛提速 5×

港中文(深圳)、华中科大与中科大联合发布 VideoRAE,首次证明 V-JEPA 2、VideoMAEv2 等「理解型」视频基础模型的 frozen 表示可直接改造为生成友好 latent:UCF-101 类条件视频生成 AR/DiT 双通路 gFVD 分别达 40 与 93,2B 文生视频对照中替换 LTX-VAE 后 VBench 三维度同步提升且收敛提速约 5×,代码开源。