动漫图像生成的老牌玩家 NovelAI 拿出了新一代图像模型。8 月 21 日,NovelAI Diffusion V5 正式发布,同时推出 V5 Curated 与 V5 Full 两个版本。官方公告给出的核心数字很直接:基于自有架构,模型规模是 V4.5 的两倍以上,训练消耗 268,000 B200 GPU 小时(官方发布日志)。
架构升级的重点:一枚 32 通道 VAE
V5 最值得注意的技术改动藏在压缩端:官方自训的 VAE 从 V4.5 的 16 通道扩展到 32 通道。VAE 负责在潜空间里表示图像,通道数翻倍直接决定了模型能"看清"多少细节。官方举例说,眼睛里的细线、珠宝、文字、配饰这类容易糊成一团的元素,现在渲染精度明显提高,"融化感"大幅减少。配合更大的模型体量,建筑、植被等复杂背景的连贯性也同步提升。
提示词:继续向自然语言迁移
V4.5 已经开始支持用自然语言代替标签写提示词,V5 把这条路走得更远。官方支持的语言是英语和日语两种,日语有专门的日文转写数据训练支撑;测试中发现中文、德语、西班牙语、葡萄牙语也能写提示词,但效果不稳定,因为这些语言不在训练重点里。
一次生成整页漫画
角色控制是这次更新的另一个重心。测试中最多 22 个角色同屏;Character Positioning 从固定小网格改成画布上的自由摆放,模型会贴近你指定的位置,减少角色之间特征"串味"。更长 prompt 的支持也随之开放。漫画能力是 V5 的差异化卖点:用自然语言描述版面布局,单次生成就能输出完整的多面板漫画页,而旧版的漫画数据只覆盖双格(2koma)级别。文字渲染支持英语、日语、中文等多种语言,前端现在会在你给文字加引号时自动生成 Text 块,不再需要手动准备。
一些"没做完"的部分
V5 不是全家桶:inpainting 目前只随 V5 Full 一起提供,curated 版还在训练,V5 Curated 暂时沿用 V4.5 的方案;Precise Reference、Vibe Transfer 也没有随发布上线。官方表示会像以往一样在发布后持续训练补齐。此外新自定义 VAE 带来了原生 alpha 透明通道:用 "transparent background"、"has alpha" 等标签就能生成透明背景或半透明效果,Enhance 功能新增 "Max✨" 档位,配套的新 upscaler 也可以单独使用。UI 同步整体翻新,订阅与用量规则也做了调整。
值得关注的角度
把 V5 放在整个图像生成市场里看,这是一次典型的"垂直玩家加固护城河"的更新。通用模型的自然语言理解在变强,但对二次元风格、多角色控制、漫画版面这类细分需求,通用模型很难像专门训练的模型这样下功夫;而 268,000 B200 GPU 小时的投入,也说明这个细分市场的算力门槛在抬高。对创作者来说,真正的问题不是"哪个模型更强",而是你的工作流落在哪个细分场景里——单次成页的漫画生成如果真的稳,它会改变的不只是出图速度,还有分镜创作的迭代方式。