音视频联合生成模型这两年进步很快,但三个老问题一直没解决好:单模态保真度有限、文本对齐不足、跨模态同步弱。强化学习后训练在文本模型上已经被反复验证有效,可一旦搬到音视频联合生成上,麻烦就来了——音频和视频两路奖励信号异构,纠缠在一起后信用分配搞不清;两个模态塔联合优化,算力开销和训练动态都不好处理;同步质量还依赖配对样本评估,奖励之间难以公平比较。

上海人工智能实验室的团队把这个问题拆开解决。他们提出的 AV-GRPO 是一个模态锚定的在线扩散强化学习框架,配套发布 5DAV,一个按五个维度解耦、难度可控的训练数据集。论文已在 arXiv 公开(编号 2609.29816,cs.CV 与 cs.SD 交叉,22 页),代码、数据和权重全部开放。

把多模态偏好学习拆成单模态子问题

AV-GRPO 的核心思路是解耦。框架包含三个关键模块:其一,模态锚定 rollout,用来解耦学习信号、稳定训练难度;其二,轨迹锁定的冻结塔优化,训练一个模态塔时冻结另一个,既压低成本也重新分配信用;其三,针对各模态自身动态特性设计的自适应目标与扰动强度。三者合起来,把耦合的多模态偏好学习转化成一组单模态子问题,奖励归因更精确,跨模态同步也随之改善。

8 张 A800 就能训 22B 模型

工程侧的数字相当务实:AV-GRPO 支持对 22B 参数的 LTX-2.3 音视频模型做全参数训练或 LoRA 训练,门槛是 8 张 A800 GPU。仓库把训练流程拆成清晰步骤:先安装计算音视频样本奖励所需的评估器,所需预训练模型自动下载;再拉取 LTX-2.3 相关权重、替换配置文件路径、配置 WandB 日志;训练数据集直接内置在仓库的 dataset.json 里,无需单独下载。训完的权重合并与推理脚本也已备好,权重挂在 Hugging Face 上。

结果与该泼的冷水

在 JavisBench 和 VABench 两个评测上,团队报告 AV-GRPO 在 LoRA 与全参微调两种设置下,生成质量、语义对齐和跨模态同步均超过基座 LTX-2.3。仓库还给出一组定性对比示例,覆盖起火建筑、乐团小提琴、瀑布轰鸣等场景,其中包含中文对白的镜头,能看出框架对语音与画面绑定的处理。需要冷静看待的有三点:"首个面向音视频联合生成的 GRPO 框架"是团队自述,论文用的是"据我们所知"的措辞;第三方复现尚未出现,对比示例也是作者自选 case 而非盲测;仓库许可需按各子模块(JavisDiT、LTX 等)条款分别确认,并非单一开源协议。

对做生成模型后训练的人来说,这篇的价值不在跑分而在方法论:当多模态奖励信号互相纠缠时,先解耦再优化,配合冻结塔控制成本,是一条可迁移到其他多模态生成任务的路径。8 卡训 22B 的配置,也把扩散 RL 后训练的入场券压到了学术实验室的水平。下一步值得盯的是独立复现与中文语音场景的第三方评测——在那之前,把它当一个方向信号,而不是结论。

参考:论文 arxiv.org/abs/2609.29816;代码与数据 github.com/zhiyuxu03/AV-GRPO;权重 huggingface.co/Dr-Loser/AV-GRPO。