说一句"给我生成一张新品海报",扩散模型几秒就能给出漂亮的图——但它给的是一张压平的位图:文字常常出错,想挪一个 logo、改一行价格,只能整图重画。arXiv 9 月 3 日公布的新论文《Editable Visual Design》直接把这个痛点当成靶子:论文页面挂在腾讯混元(Tencent Hunyuan)机构名下,叶俊彦(Junyan Ye)等 12 位作者署名,Hugging Face 论文页上线两天拿到 42 个赞,GitHub 仓库已冲到近 500 星。
两难:扩散模型好看但不可改,纯代码可控但缺审美
论文把现有两条路线的短板摆得很直。以 GPT-Image-2、Nano-Banana 为代表的扩散基座视觉表现力强,但端到端生成天然输出扁平位图、文字易错,没法做图层级的后期编辑;反过来,让编码智能体直接写代码画图,布局精确、图层解耦,却缺全局审美直觉,复杂视觉素材写不出来。漂亮和可编辑,一直是二选一。
解法:VLM 当"创意大脑",图像模型降级为"素材车间"
这篇论文的分工设计很有意思:VLM 负责"想"——理解需求、拆任务、做审美判断;图像生成模型只在需要时出场,按需合成独立的视觉素材。整个流程走"先想象、后行动"的闭环:智能体先产出独立素材,再写原生 HTML/CSS,对着渲染反馈反复修。关键约束是"视觉先验、不搬像素"——图像模型提供构图、配色、层级的艺术方向,但它的参考像素永远不进入最终交付物,排版和字体由智能体在 HTML 里重建。最终产物带真实文字和语义图层,用户在图形界面上鼠标拖拽就能改布局。
不止能生成,还能"回放"
另一个值得注意的细节是 Agent Design Replay:系统把智能体的创作与推理轨迹忠实记录下来,可以像职业设计师的工作过程一样重放。仓库对比表里专门列了这一项——图像生成没有创作路径可言,直接写代码只有部分可回放,而这套方案把"设计是怎么一步步做出来的"变成工件的一部分。仓库还内置确定性检查,覆盖画布、字体、图层契约、渲染和编辑器往返。
落地:两个 Codex 技能,还能导出可编辑 PPT
工程侧的交付是两个独立 Codex 技能:editable-design 负责从需求生成设计,产出 HTML、PNG、鼠标编辑器、图层分解动画和创作回放;html-to-pptx 则把干净的设计转成可编辑的 PowerPoint,元素可独立选中。README 推荐搭配 GPT-5.6、high 及以上推理档位使用。Gallery 给了 14 组提示词、覆盖 6 大类场景——从山柚观音茶饮海报、护肤电商主图,到"Attention Is All You Need"学术论文海报都在列。仓库以 Apache 2.0 开源,作者注明这是社区项目、并非官方 OpenAI 项目。
所以呢
这篇论文真正值得记的点,不是"把图生成得更好看了",而是把生成模型在视觉管线里的位置降了一级:它不再负责交付,只负责供给素材和艺术方向;交付物变成了带图层契约的软件工件——可版本化、可组合、可回放。当"设计稿"从位图变成代码工件,修改、复用、协作才谈得上工程化。对做设计工具和 Agent 产品的团队,这个分工范式比任何单点跑分都更有参考价值。
参考:arxiv.org/abs/2609.04034;github.com/yejy53/Editable-Design