京东( JD.com ) 近日在 GitHub 开源了 JoyAI-Video-Edit,一个面向开放域流式视频的实时编辑系统。该模型由 MLLM 条件编码器、因果视频 VAE 与 16B 参数多模态扩散 Transformer(MMDiT)组成,通过自回归扩散 + 蒸馏的方式,把「边播放、边用自然语言改视频」这件事,从离线批量变成了实时的流式生成。
关键能力
- 实时开放域编辑:对摄像头流或上传视频,模型随帧到达就因果式地编辑,不需要预先知道总长度,也不需要回头处理未来帧。
- 指令多样性:支持主体编辑、局部编辑、背景替换、风格迁移、动作调整、参考图引导等常见视频编辑任务。
- 720p 高吞吐部署:官方部署基准显示,整条端到端管线在 720×1280 分辨率下达到 30.19 FPS,把视频编辑从离线批处理推进到交互式流式生成。
- 训练-推理一致性:通过 aligned autoregressive distribution matching distillation、长时序优化与 bounded KV-state inference 缓解 train-inference mismatch 与累积时序漂移。
技术结构
系统的三个核心组件各司其职:
- MLLM 条件编码器:把用户的自然语言指令(以及参考图)编码为条件信号,交给下游扩散 Transformer。
- 因果视频 VAE:在 token 空间下做时空压缩与还原,是「实时流式」得以成立的关键 —— 不能每帧重算一整段视频。
- 16B MMDiT 骨干:多模态扩散 Transformer 负责在压缩后的 token 序列上做扩散式编辑。
部署侧提供了 persistent TorchInductor / Triton / CUDA cache 复用、bounded KV-state 等调度策略,目标是让 720p 编辑保持稳定 per-chunk 算力。
落地与开源
京东同时放出了完整部署代码、技术报告( arXiv:2608.03974 )、在线 Demo( joyai-labs.jd.com/v2v ) 与 Hugging Face 权重,协议为 Apache 2.0。仓库的 DEPLOYMENT.md 里写了完整的环境、checkpoint 与自定义部署流程,默认监听 http://localhost:8080。
GitHub 仓库的 TODO 也直接列出了下一阶段动作:
- 面向消费级 GPU(如 GeForce RTX 5090)的部署优化;
- 更强版本正在训练,重点是参考图引导视频编辑( RV2V );
- 完整训练与数据 pipeline 开源。
我的看法
视频生成的「最后一公里」正从「离线剪」转向「实时改」。JoyAI-Video-Edit 把这件事用自回归扩散 + 流式 VAE 的组合做成可工业部署的形态 —— 30.19 FPS 在 720p 端到端是工程上能讲得通的数字,关键是它开源了权重、训练报告和部署代码,而不是只放了论文。
值得关注的两个信号:
- 大厂押注物理世界模型矩阵:京东的措辞是「物理世界模型矩阵进一步完善」,JoyAI-Video-Edit 同时也为具身智能的大规模数据合成积累底层技术 —— 实时编辑 + 因果流式 = 合成数据流水线上的关键一环。
- 多模态扩散的「实时化」拐点:Sora、Veo 那一代主打的是「质量」,但当 16B 模型已经能在 720p 跑 30+ FPS,「实时性」就接棒成为下一个差异化战场。对个人创作者和直播电商来说,这意味着「改镜头」会从后期工种变成现场操作。
下一步看的是消费级 GPU 适配和 RV2V 强参考图能力 —— 谁能先把这两个做扎实,谁就能把「实时视频编辑」从 demo 推进到日常工具。
参考:
- GitHub 仓库: https://github.com/jd-opensource/JoyAI-Video-Edit
- 技术报告: https://arxiv.org/pdf/2608.03974
- Hugging Face 权重: https://huggingface.co/jdopensource/JoyAI-Video-Edit
- 在线 Demo: https://joyai-labs.jd.com/v2v/