9 月 20 日,阿里千问开源了 Qwen-Image-2.1 —— 一款把「文生图」与「图像编辑」塞进同一套权重的开源扩散模型,视觉生成部分只有 7B 参数,GitHub、Hugging Face、ModelScope 三处权重同步放出,推荐 16GB 以上显存的 GPU 即可本地部署。

一套权重覆盖「生成 + 编辑」两条管线

最显眼的能力是原生透明图像( RGBA )生成与编辑。过去文生图模型只输出 RGB,要做电商贴图或海报设计必须走一遍抠图流程;Qwen-Image-2.1 直接把透明通道纳入训练目标,既能根据提示词生成带 alpha 通道的图层,也能在保留背景透明的前提下修改主体表情、替换图层内文字,透明能力继承自此前专用模型 Qwen-Image-Layered。同一个模型还把多图参考与局部编辑纳入输入端:最多 10 张参考图、圈选 / 涂抹 / 掩码三种显式控制方式,人像面部细节与商品文字纹理在多次编辑后保持一致。

技术栈:Single-Stream DiT + 混合粒度注意力

走的是 32 层 Single-Stream DiT 架构,文本与图像 Token 在同一 Transformer 流里统一处理;系统前缀与编辑指令用 Token 级因果掩码、图像块走 Chunk 级掩码,两套粒度并行;参考图与编辑指令视为静态上下文,首步预计算 Key-Value 后复用,官方称多图场景的推理效率因此显著提升。

基准与生态站位

官方评测里,Qwen-Image-2.1 在文生图 + 编辑合并基准上反超了 Google 的 Nano Banana 2.0 等闭源对手,被多家媒体列入近期开源榜首;权重全量开源、文生图与编辑二合一、原生 RGBA 输出,这些特性 Google 同类产品尚未提供。

对设计、电商、内容创作这条工作流来说,Qwen-Image-2.1 的意义不是「更会画」,而是「免抠图 + 免切换模型」—— 一套权重解决生成与修改,加上原生透明通道,贴近生产管线的可用性。当开源生态把这种「生成 + 后期」合并能力做到闭源 API 同档,设计稿的边际成本会再被压一刀。