视频生成模型大多是「哑巴」:画面出来之后,声音要么干脆没有,要么由另一个模型在后面补一道工序。8 月 31 日,高德 AMAP-ML 团队以 DreamX Team 名义在 arXiv 发布 DreamX-Creator 1.0 技术报告,给出另一条路线——用 7B 参数的原生联合音视频生成器,让画面和声音在同一个模型里一起去噪。
一天冲上 HF papers 榜首
论文(编号 2608.31106)次日被提交到 Hugging Face Daily Papers,截至发稿已拿到 81 个 upvotes,居当日榜单首位;配套 GitHub 仓库(AMAP-ML/DreamX-Creator)已有 82 stars,采用 Apache 2.0 许可证。研究团队共 10 位作者,第一作者为 Jiashu Zhu,名单中还包括 Xiangxiang Chu。
热度不奇怪。原生音视频联合生成是当前视频生成里少数还没有定型答案的问题:论文摘要直接点出,近来的视频生成器「常常省略音频,或在单独阶段合成音频」,视觉动态与声学事件之间因此缺少相互建模。DreamX-Creator 的回应是把两条流放进同一个网络。
架构:前半各走各的,后半门控耦合
DreamX-Creator 以首帧加文本提示为条件。网络前半段,音频流和视频流分别独立处理;后半段通过门控跨模态注意力(Gated Cross-Modal Attention)耦合——每个跨模态注意力头的输出都由 token 级和头级门控调制,官方称由此实现双向音视频交互。
训练侧是四件套:
- 统一音视频数据系统:构建时序连贯的片段、生成结构化多模态标注、按能力导向组织数据池;
- 渐进式联合训练:两个音视频预训练阶段,再加高质量微调;
- 音视频强化学习:多模态反馈按视频、音频、跨模态三类路由到对应流,相当于把 RL 后训练从纯文本域搬进音视频域;
- 自回归 1-Step 2K 精炼:把一个双向多步教师改造成自回归多步精炼器,再蒸馏成学生模型,每个时间块只需一次去噪评估。
官方口径称,整体性能「可与最强开源系统竞争」。
站在 Wan 和 MOVA 的肩膀上
README 致谢里点名了两个基础:Wan 团队(Wan2.2)与 OpenMOSS 团队(MOVA)。换句话说,「紧凑 7B 也能做原生音视频」这个故事的前提,是开源视频生成栈已经成熟到可以当基础设施用——后来者不必从底座造起,只需在联合建模、RL 后训练这些增量问题上发力。
权重还没放,先读论文
也要泼一盆冷水:GitHub 路线图显示,目前完成的是「初始化仓库」和「发布 1.0 技术报告」两项,第三项——「释放经过验证的模型权重、推理代码、配置和评测工具」——尚未勾选。也就是说,「democratizing」(平民化)当下的真实状态是:许可证已定(Apache 2.0)、配方已公开、权重在路上。想在本地跑起来的开发者,现阶段只能精读技术报告,等下一批交付。
所以呢
DreamX-Creator 值得盯住的有两点。其一,它把「音视频一起生成」从旗舰模型的专属能力拉到 7B 量级,论文明确表示将释放紧凑生成器与 2K 精炼器;其二,它的交付节奏正是行业常态的缩影——论文先行、权重后至,开源承诺与可运行工件之间总有时间差。现在能做的,是把报告读完;等权重落地那天,第一时间去验证「官方口径」里的每一条。
参考:arXiv:2608.31106;github.com/AMAP-ML/DreamX-Creator