让语言模型写 SVG 代码这件事,卡在一个很根本的地方:它没有标准答案。一张"画个带睫毛的眼睛图标"的作业,写成代码可以有无数种都对的做法,既没有配对的参考图,也没有人工偏好标签。于是评估和训练都只能借用在自然图像上校准的标量指标——CLIP 分、美学分——但矢量内容风格化程度高,这些指标迁移过去就会失真。论文给了一个直观例子:一张忠实的蓝色相机图标和一张明显损坏的 SVG,CLIP 给出 0.18 和 0.23(坏的反而更高),美学分 4.93 对 4.84 也几乎无区分度,而人工设计的评分细则能给到 0.94 对 0.30,方向正确。更麻烦的是,把这类失真指标直接当强化学习奖励,会触发 reward hacking:模型学会讨好打分器,而不是把图做好。

蚂蚁的解法:把"标准答案"换成"评分细则"

蚂蚁集团联合港科大(广州)、牛津等机构的团队提出 RULER,思路是给每条生成指令动态生成一份六项评分细则(rubric),覆盖语义、视觉、渲染风格三个维度,每个维度两项:语义保真看概念可读性、主要部件、提示特有关系;视觉质量看轮廓形态与构图;渲染风格看完成度与风格一致性。细则由前沿模型(Claude-Opus-4.6)从纯文本指令推导,训练时用判分 VLM(Qwen3-VL-8B)对渲染后的输出逐项打分,加权求和形成细粒度奖励,再用 GRPO 优化策略模型(Qwen3-8B)。整条管线不依赖任何 SVG 真值参考,也不需要人工标注偏好。

结果:小模型追平大它数倍的 DeepSeek-V3

在 MMSVG-Illustration 和 MMSVG-Icon 两个基准上,RULER 把评分细则得分从 0.432/0.395 提升到 0.693/0.683,超过各专用 SVG 模型,并追平了大得多的 DeepSeek-V3。盲测人类偏好上,150 个 prompt 的非平局胜率全部过半:对 Qwen3-8B 基线 89.7%,对 Qwen3-32B 66.1%,对 VectorFusion 53.3%,对 OmniSVG 66.9%,对 JanusCoder 96.5%。判分器与人类判断的对齐度也拉得开:Spearman 相关 0.7929(美学分 0.6051、CLIP 0.5518),Goodman-Kruskal γ 成对排序一致率 0.7574。消融实验里去掉任何一个维度的细则都会掉分,验证六项设计缺一不可;换用 GPT-5.5 生成细则、或在 4B/8B 两种底座上跑,结论保持稳健。

所以呢

这项工作真正值得记的点,不在 SVG 本身,而在"开放式生成任务的 RL 奖励该怎么造":当任务没有 ground truth、标量指标又会失真时,用 LLM 生成的实例感知评分细则当奖励,是一条无需人工标注的可行路径。对做图像生成、UI 代码生成、创意写作这类"好答案不唯一"任务的团队来说,这套"指令→细则→逐项判分→GRPO"的配方可以直接迁移。需要留意的是,细则质量和判分 VLM 的能力成为新的隐性上限,论文的消融也显示细则设计是 RL 的活性杠杆——打分器有多可靠,奖励就有多可靠。

参考:arXiv:2609.25270 · 项目页 hangyuran.github.io/RULER