头部厂商把"自回归 + MoE"塞进了开源文生图
腾讯混元 HunyuanImage-3.0 在 GitHub 上正式公开权重和推理代码(Apache-2.0),配套 arXiv Technical Report v3 也已修订发布(v3 日期:2026-06-26)。这不是一次"再加一个 DiT 变体"的版本迭代——他们把现在主流文生图社区几乎默认的 diffusion + DiT 路线换掉,改用 native multimodal autoregressive framework(原生多模态自回归框架),把"理解模态"和"生成模态"压进同一个模型里。
按 arXiv 摘要与 GitHub README(models cards 表),模型本体规格如下:
- 总参数:约 80B(ArXiv:"over 80 billion parameters in total")
- 单 token 激活:约 13B(ArXiv:"13 billion parameters activated per token during inference")
- 专家结构:64 个 experts(来自 GitHub README Key Features)
配合 "largest and most powerful open-source image generative model to date" 的自评,这次开源的体量把"开源文生图"这个标签又往上推了一档——之前开源侧的 Imagen/SD 类多为 dense DiT,HunyuanImage-3.0 是首个约 80B 量级、MoE 化、且走自回归路线的开源文生图模型。
不只是"换架构",关键点都围绕训练 pipeline 转向
arXiv Technical Report 把 HunyuanImage 3.0 的成功归到 5 个组件:meticulous data curation、advanced architecture design、native Chain-of-Thoughts schema、progressive model pre-training、aggressive model post-training。这一套打法跟 Hunyuan-A13B 等同厂 LLM 的路线一脉相承——把训 MoE LLM 那套流程(数据筛选 + 递进预训练 + RL 后训练)直接平移到生图。模型在生图之前先做 reasoning,把稀疏提示词自动丰富一遍再生成——这是把 LLM-side 的 CoT 直接缝进视觉生成里。
评估上,GitHub README 给出的不是单张 leaderboard:
- GSB(Human Evaluation):1000 张文生图 + 1000+ 单图/多图编辑用例,统一跑一次不做 cherry-pick;评估者 100+ 专业人士。
- SSAE(机器评估):自研的 Structured Semantic Alignment Evaluation,基于 MLLM 抽取 3500 个关键点、横跨 12 个类别,对生成图与关键点做匹配打分。
这些数字不是"我比 SD/Imagen 好多少"单榜——而是表达"在 12 个细分维度上,自动评估和人类评估都能给到 SOTA 邻近水平"。
2 个 Instruct 检查点 + 8 步蒸馏:把"大模型 → 可部署"链子打通
GitHub README 的 Model Card 给了 3 个 checkpoints:
| 模型 | 总参 / 激活 | 推荐显存 | 能力 |
|---|---|---|---|
| HunyuanImage-3.0 | 80B / 13B | ≥ 3 × 80GB | T2I |
| HunyuanImage-3.0-Instruct | 80B / 13B | ≥ 8 × 80GB | T2I + Text-Image-to-Image + Prompt Self-Rewrite + CoT Think |
| HunyuanImage-3.0-Instruct-Distil | 80B / 13B | ≥ 8 × 80GB | 同上 + fewer sampling steps(推荐 8 步) |
Distil 版与 Instruct 版同日(2026-01-26)发布,把 50 步蒸馏到 8 步可用——对消费级显卡意义不大(8 × 80GB 显然不是桌面能跑动的),但对自部署机房、推理服务厂商是好消息:吞吐起来后,单位 token 成本有压下去的可能。
Instruct 版本把"图像编辑"纳入 first-class 能力:T2I、Text-Image-to-Image、Prompt Self-Rewrite、CoT Think 一并打开,并且 README 列出 5 类典型场景 showcase:CoT 结构化推理、复杂场景 T2I、精确的元素保留编辑、风格迁移与主题增强、多图融合。
为什么这条更值得写?
我在 8 月初写过一篇 Kimi K3 与 DeepSeek V4 之间,隔着原生多模态的时间差,讨论的是"为什么 LLM 厂商要用 native multimodal,而不是先做 LLM 再外挂一个 vision encoder"。HunyuanImage-3.0 给的答案是反过来的:把图像生成那个分支,也用同一个 native multimodal autoregressive 框架做掉——一次性把"理解 — 推理 — 生图"链条打通,跳过了 DiT + LLM 通过 API/encoder 拼接的旧范式。
这条路的好处:
- CoT 直接落地到视觉:模型在画图之前会"想清楚再画",对稀疏 Prompt 的鲁棒性比纯 DiT 强。
- 单一模型 = 单一优化目标:不用像"LLM + DiT"组合那样分别微调 vision 和 language,post-training 的 RL 信号可以端到端回传。
- MoE 给大模型留出口:80B/13B 这个比例说明推理侧算力需求被控制在"LLM 级"——和 Hunyuan-A13B 的 80B/13B 设计完全同型,意味着同一套推理栈(vLLM 支持等)可以复用到文生图。
代价也很直接:8 卡 × 80GB 是入场券,跟消费级显卡无关——这不是个人玩具,跟之前开源侧的 Flux-dev/Sana/Diffusers-生态一类模型不是一个赛道。
所以呢
把图像生成塞进"原生多模态自回归框架"这条路,过去半年里 LLM 厂商集体在试:OpenAI 把 DALL-E 改造成 GPT-image、Anthropic 在 Claude 里叠视觉工具调用、Google 的 Gemini 走全模态原生。腾讯混元这次跨过线——不是 API demo,是连权重带推理代码全部开源,并且做到了和上述闭源路线"性能可比"。
对自建多模态平台的团队(要做 RAG + 生图 + 推理三合一的)来说,HunyuanImage-3.0 Instruct 那种"T2I + 编辑 + CoT"统一入口是个值得先用起来的形态;对普通开发者,Distil 8 步版本 + 50 步原生版的两档部署,决定了"研究场景 vs 业务场景"怎么选。
下面 6 个月真正要看的,是 Sora 2 / Veo 3 这一档的视频侧——MoE + 自回归框架能否在视频生成上再做一次。等 Q4 哪家放出 video-native MoE AR 模型的权重,再来写一篇对比。
参考:
- GitHub: https://github.com/Tencent-Hunyuan/HunyuanImage-3.0
- arXiv Technical Report v3: https://arxiv.org/abs/2509.23951
- Tencent 官方站: https://hunyuan.tencent.com/image