蚂蚁集团 inclusionAI 今日(9 月 4 日)开源 LLaDA-Image:一个 6B 参数的统一图像生成与编辑模型家族。Base 与 Turbo 两个 checkpoint 同步放出,BF16 和 FP8 双精度版本在 Hugging Face 与 ModelScope 同步上线,推理代码随 GitHub 仓库一并发布。
一个 checkpoint 同时做生成和编辑
LLaDA-Image 的核心卖点不在画质而在结构:单个 checkpoint 同时支持文生图与参考图指令编辑,不需要另挂一个编辑骨干网络。官方列出的能力覆盖文生图、VQ 条件生成、参考图编辑和中英双语文字渲染四种模式,展示样例也分写实图像、文字海报与指令编辑三类。
技术路线上有两点值得注意。其一,文本骨干和 DiT 都是扩散模型,在统一框架内训练——这延续了蚂蚁 LLaDA 系列在扩散语言模型上的路线;VQ 模式直接用 LLaDA2 生成图像 VQ token,再经 SigVQ 嵌入进入扩散过程。其二,训练分阶段推进:先做纯图像预训练与中期训练建立视觉先验,之后才引入成对语言监督,最后进行生成与编辑的联合训练。
Turbo 版 4 步出图
Base 模型推荐 50 步采样(guidance 5.0),Turbo 版经 Twin-DMD 蒸馏压到 4 步(guidance 1.0),官方称 2-4 步即可完成快速生成与编辑。跑分方面,官方报告在 Qwen-Image-Bench 上取得 53.53(英文)、53.38(中文)的总分,README 将其表述为 state-of-the-art——这是官方自报成绩,横向对比细节以技术报告为准。
「Fully Open」还差最后一块
论文标题写着 Fully Open Training Recipes,但仓库的开源计划显示:推理代码和模型权重已放出,训练代码仍标注 coming soon。也就是说,"完全开放的训练配方"目前兑现在权重与推理侧,想复现训练还要再等。技术报告已挂 arXiv(2609.03796),HF papers 页面上线一天拿到 84 个 upvote;工程实现基于 Python 3.11、PyTorch 2.8 与 Diffusers 0.39.0,官方致谢了字节 VeOmni 项目。
对本地部署用户来说,6B 体量加上 FP8 版本,意味着消费级显卡就有机会跑起来;对行业观察者来说,LLaDA 这条扩散路线从语言模型延伸到图像生成,是比单次发布更值得留意的信号。等训练代码真正落地,「fully open」才算闭环。
参考:github.com/inclusionAI/LLaDA-Image;huggingface.co/inclusionAI/LLaDA-Image;arXiv 2609.03796