[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-qwen-image-2-rl-grpo-opd":3,"news-related-b20f76a0-85ec-4de4-b094-21582692ba53":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"b20f76a0-85ec-4de4-b094-21582692ba53","Qwen-Image-2.0-RL 技术报告：把 GRPO+OPD 整套后训练范式搬进文生图扩散模型","Qwen 团队发布 Qwen-Image-2.0-RL 技术报告，把原本只在 LLM 后训练里成熟的 RLHF 和 on-policy distillation（OPD）整套玩法搬进了文生图扩散模型。这套流水线的核心是两条腿走路：第一，用 task-specific 复合 reward model 把「对齐、美学、人像保真」这些抽象维度拆成可点对点评分的子任务，reward 训练本身用 vision-language model 加 chain-of-thought 推理来获得稳定的评分；第二，用 GRPO 的 RL 训练框架配合 hybrid classifier-free guidance，既学到新能力又不丢掉预训练里的世界知识。Prompt curation 用组内 reward range filtering 把噪声样本过滤掉，per-category 权重校准让不同子任务不会互相打架。最终的 OPD 把文生图和图像编辑两套专精 RL 策略通过 trajectory-level velocity matching 合并到同一个学生模型，避免线上要同时挂多个 checkpoint。结果是 Qwen-Image-Bench 综合分从基座提升到 57.84（+2.61），T2I Arena Elo 涨 78 到 1193，编辑 Arena 涨 93 到 1349。这标志着文生图正在从「规模 + 数据」的预训练范式过渡到「RL + 蒸馏」的后训练范式——和 LLM 在 2024 年走过的路几乎是同构的。当 reward model、GRPO、OPD 三件套被打包进文生图栈，开源模型追赶闭源前沿的速度会显著加快，而 RL 阶段的算力门槛也会成为新的分水岭，模型团队之间的竞争从「谁能训更大的 DiT」逐渐转成「谁能训更稳的 reward」。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.27608","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7b67033c-19e6-4052-a626-e681bba64c7a","diffusion",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",{"id":18,"name":19,"slug":19,"description":13,"color":13},"c187600e-804c-4697-b828-1e4330e0eb10","qwen",{"id":21,"name":22,"slug":22,"description":13,"color":13},"c883fd20-1d66-4fb7-9fc7-320fa7f87023","text-to-image",[],"qwen-image-2-rl-grpo-opd","2026-06-29T12:00:00Z","2026-06-29T16:12:45.058749Z","2026-08-19T02:08:40.142862Z",true,"agent",105,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"095917eb-02ae-4fd2-a1cb-17d0805442ee","微软 Mage-Flow 用 4B 跑赢 32B：原生分辨率 + 三件套协同设计把生成编辑都塞回单卡","microsoft-mage-flow-4b","2026-07-23T03:30:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"f7287cac-6643-4f4a-8cbd-2b281d2d4d46","Krea 2 开源双发：12B DiT 把「2 秒出图」做进主流程，蒸馏后 8 步直出 2K","krea-2-12b-dit-2-second-turbo","2026-06-25T10:30:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"72ee21ea-8a91-4dd3-88fa-f605551ff9ce","Qwen-Image-2.0 发布：7B 拿下原生 2K，把「图文一体 + 生成编辑统一」推到开源前沿","qwen-image-2-0-7b-native-2k-arena-no1","2026-06-18T08:00:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"0620b53c-7b56-4e03-858a-78a0e74b5113","Moebius 用 0.2B 参数挑战 10B 工业模型：图像修复进入「极小专科」时代","moebius-0-2b-tiny-specialist-inpainting","2026-06-17T15:35:38+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"cd88ab8f-afff-4f8f-8edc-ab24715906c6","FLUX.2 [klein] 4B\u002F9B 发布：统一生图编辑，Apache 2.0","flux-2-klein-4b-9b-apache-2-sub-second","2026-06-12T06:30:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"04d03b80-0a32-4ea1-87df-9248b36653c1","Ideogram 4.0 开源：9.3B 单流 DiT + Qwen3-VL 文本编码器，把排版与文字渲染做到开源第一","ideogram-4-0-9-3b-dit-qwen3-vl-text","2026-06-09T12:00:00+00:00"]