视频生成模型卷到今天,单段 30 秒、多镜头叙事已经不是稀缺能力。真正稀缺的,是把 30 秒撑起来的那句话——用户输入"一个女孩爬树",生成器拿到的是 6 个字,要交出的却是一份分镜表:每个镜头的机位、景别、光影、口播和剪辑节奏。这中间的落差,正在变成一个独立的大模型赛道。arXiv 9 月 24 日收到的论文 WanPE 给出了目前最重的答案:一个 397B 参数、专门负责改写视频提示词的模型(arXiv:2609.30221)。

397B,只干"写提示词"这一件事

WanPE 的定位是 prompt enhancement:输入用户的一句话需求,输出一份镜头级的"电影计划"。为了练出这种"导演术",团队用 105 万条真实世界视频做训练。

397B 这个数字值得停一下:它比服务的多数下游任务模型都大。团队的判断是,当代视频生成器的瓶颈已经从"会不会生成"转移到"指令够不够专业"——提示词质量直接封顶成片质量,值得配一个旗舰级模型。

反向构建 + SC-GRPO:加戏,但不许跑题

方法上有两个关键设计。其一是 video-grounded reverse construction(视频反向构建):训练数据不是人写的"好提示词",而是从真实视频里反推出来的镜头计划。消融实验显示这条路径明显占优——同一设置下,正向改写综合分 39.49、正向 SFT 35.17,而反向构建路线的 WanPE-SFT 做到 49.86。其二是 Semantic-Consistency GRPO:扩写提示词最大的风险是"加戏跑题",SC-GRPO 把用户原始需求的一致性约束进 RL 目标,跨模型规模都保持了语义保真。

配套发布的 WanPEval 是一个人工标注测试集,覆盖 5 到 30 秒不同时长与意图粒度,由约 1.1 万次盲测两两比较支撑。

数字会说话,但要看清是谁在说

接在 Wan3.0 视频生成器前面时,WanPE-397B 在 5-15 秒区间把人类偏好拉高 10.66 到 18.84 点;30 秒赛道的提升更陡:50.86 点——原始请求综合分只有 9.38,加上 WanPE 后到 60.24。与 Seedance 2.5 的直接对照里,综合分 60.24 对 59.76,基本打平;分项互有胜负:动画、口播明显领先(81.25 对 46.43、73.68 对 55.00),动作、歌舞、广告落败(50.00 对 68.18、47.50 对 60.00、75.00 对 81.25)。论文口径是 5-15 秒区间"超过所有参评商业产品",30 秒"与 Seedance 2.5 竞争力相当"——注意这是团队自建基准上的自报成绩。

跨生成器迁移是另一个有意思的结果:换成 LTX-2.5-Base,格式适配后的 WanPE 拿 35.56,原生增强器只有 21.11;换成 MiniMax-H3-Base,WanPE 41.09 对原生路径 35.92。导演术看起来有相当程度的通用性。

权重落地之前,先泼两瓢冷水

第一,Hugging Face 论文页上,链接到这篇论文的模型、数据集、Space 计数全部为 0——论文与项目页已放出,权重和代码还没落地,第三方暂时无门复现。第二,1.1 万次盲测规模不小,但基准和被评者是同一拨人。

更值得琢磨的是这件事的结构:当写提示词本身需要一个 397B 模型,"一句话生成视频"其实变成了"一句话 + 一个隐形导演"。表达权让渡给中间模型,换来的是专业分镜质量——这笔交易划不划算,取决于你在不在那 50.86 点的目标区间里。项目页 wan-pe.github.io 放出了多组对比 demo,权重动向值得盯。