京东(jd-opensource)正式开源 JoyAI-Image——一款真正意义上的统一多模态基础模型。它用一个 8B 多模态大语言模型(MLLM)做理解中枢,搭配 16B 多模态扩散 Transformer(MMDiT)做生成引擎,把「图像理解、文生图、指令式图像编辑」三件事拧进同一个模型族。 最值得关注的是它的「理解⇄生成」闭环设计:以往的多模态系统理解归理解、生成归生成;JoyAI-Image 把两边打通——更强的空间理解反哺生成质量与可控编辑,而生成出的新视角又能为空间推理提供证据。这种双向激励的范式在国内开源多模态里相当少见。 技术细节上,它在长文本排版、多视角生成、几何感知的空间编辑(Object Move / Object Rotation / Camera Control)上做了专项优化,在 spatial reasoning 与 Qwen-Image-Edit、Nano Banana Pro 等同台对标。模型权重、Diffusers 集成、ComfyUI 工作流、HuggingFace Demo 一并释放,Apache 2.0 完全开源。 7 月 17 日最新更新:JoyAI-Image-Edit 与 Edit-Plus 原生支持 ComfyUI,可直接拖入工作流运行,无需额外依赖。 这条路径的真正意义在于:当行业还在争论「理解派」和「生成派」谁主导,京东用统一架构给出了答案——边界本来就不必分。短期内,这会给 Qwen-Image-Edit、Seedream 等开源图像模型压力;长期看,「理解⇄生成」的双向激励范式有可能成为下一代多模态模型的标配。