9 月 8 日,OpenAI 向 ChatGPT 用户推送了新一代图像模型 Images 2.5。单看版本号像一次例行小迭代,但这次真正值得聊的不是模型参数,而是交互方式的变化——你可以在聊天框里直接画涂鸦,让 AI 照着你的手稿出图。

从"打字描述"到"动手画":Sketch 改变了什么

OpenAI 在官方公告里的说法很直白:有时候,解释一个想法最清晰的方式就是把它画出来。新功能 Sketch 就是照这个逻辑设计的——在 ChatGPT 输入 @Sketch 会弹出画布,你可以画一个房间布局、一件衣服的轮廓,或者随手涂个火柴人,再补一句风格描述,模型会把这张粗糙的草图补全成完整图像。

The Verge 的编辑用鼠标画了一只相当潦草的猫,模型照样按指令生成了写实照片,还能继续按评论改细节(报道见 The Verge)。这件事的意义在于:过去想要"左边沙发、右边落地窗"的构图,你得反复用文字调教模型;现在直接画出来,空间关系一眼可见,文字只需要负责风格和细节。

配套的还有两项:Templates 模板针对传单、产品图等常见格式提供起步框架;图片上直接圈注评论,让模型只修改被标记的部分,不用重写整段提示词。

模型本身的升级:更快,也更稳

按 OpenAI 的官方口径,Images 2.5 的核心指标包括:图像生成延迟较上一代 Images 2.0 最多降低 50%;光线更自然、纹理更丰富;对参考照片里人物、宠物和物体的还原度更高;多轮编辑时细节一致性更好。TechRepublic、PCMag 等多家媒体的报道都确认了这些数字,其中 TechRepublic 提到拿到早期访问的 Axios 做了实测:让模型设计一个纹身、按批注多轮修改一个 Logo,原概念在几轮迭代后仍然保持住了。

发布范围方面,Images 2.5 已面向 ChatGPT、ChatGPT Work 和 Codex 用户在桌面端、移动端和网页端同步推送,不需要额外申请。

评论:卷参数的阶段过去了,卷交互的阶段开始了

我的判断是,这次更新里 Sketch 的权重高于 Images 2.5 本身。延迟砍半、纹理提升当然有用,但那是所有图像模型都在做的常规军备竞赛;而"涂鸦当提示词"把出图门槛从"会不会写描述"降到了"会不会拿笔画两下",这是交互层面的降维打击。

再看局部评论编辑:圈一下、改一下,这本质上是把设计师协作里的"批注"工作流搬进了对话框。多轮编辑一致性加上局部修改,组合起来就是"对话式修图"的完整闭环。对非专业用户,这条路比学一整套提示词技巧友好得多。

当然也要冷静:涂鸦输入并非 OpenAI 独创的想法,sketch-to-image 在研究社区早已有人探索,OpenAI 做的是把它产品化到亿级用户的入口里——工程价值大于发明价值。

所以呢?如果你日常需要出图,值得花两分钟试试 @Sketch;如果你在做 AI 产品,这个信号更值得注意:多模态输入正在从模型能力变成界面标配,下一轮竞争的战场在交互层。