微软亚洲研究院 / 微软团队今天放出 Mage-Flow,一个 4B 规模的紧凑文生图与指令编辑一体化栈,代码与权重全部开源(github.com/microsoft/Mage)。 核心思路很反直觉:不靠堆参数,靠 tokenizer + backbone + 系统三层协同。Mage-VAE 用一步扩散式编解码 + anchor-latent 正则,重建质量看齐 FLUX.2-VAE,但每像素编/解码 MACs 砍到 1/12 与 1/22,直接把 VAE 从高分辨率瓶颈里捞出来。原生分辨率 MMDiT(NR-MMDiT)用 rectified flow 在 Mage-VAE 潜空间训练,配合可变长 FlashAttention + 逐样本 2D RoPE 打包,以及栈级 CUDA 算子融合,端到端训练吞吐提升约 2.5 倍,CFG 的条件/无条件两支只需一次打包前向。 效果上,Mage-Flow 与更大模型正面刚:在标准生成/编辑基准上与 Qwen-Image 20B、Z-Image 6B、FLUX.2 32B、FireRed-Image-Edit 20B 打成平手甚至略胜;Turbo 变体在单张 A100、1024² 分辨率下生图 0.59 秒、编辑 1.02 秒,峰值显存 ~18-20 GB,在所有对比系统里最低。原生分辨率打包还支持 512 到 2048 之间任意长宽比,包括 4:1 这种极端比例,一个 checkpoint 通吃。 Mage-Flow 同时给出 Base、RL-aligned 和 4 步 Turbo 三档,以及独立的 Mage-Flow-Edit 编辑模型,后者在同一个图文条件框架里做语义编辑、外观迁移、修复与结构感知输出。整套都用 Diffusion-NFT 做后训练,提示跟随、文字渲染、美学与编辑一致性都有可观提升;Turbo 走对抗感知蒸馏,4 步出图,延迟低到可以做交互式应用。 值得讨论的是这条路的范式意义:文生图/编辑模型从 20B+ 卷回 4B 不是简单蒸馏,而是把 tokenizer 算力、骨干网络容量和工程栈代价作为一个整体来算账——压缩一个 VAE、压一次 attention、再把 kernel 拼一拼,4B 就能追平 32B。对开发者意味着可在单张消费级甚至云上入门卡上跑出可部署版本;对开源生态意味着 Qwen-Image 之后,Microsoft 又补了一个真正开源可商用的紧凑基础模型。接下来的关键问题是:Mage-Flow 这种「紧凑 + 系统协同」路线能否继续向下吃到 1B-2B,以及它和 Qwen-Image、FLUX.2 的差距是否会随 RL 与数据迭代再次拉大。