AI 生图这一两年最持久的抱怨不是画质,而是可控性:提示词写三行,布局靠运气,想改画面一角,整张图重掷一次骰子。10 月 1 日,Black Forest Labs 发布 FLUX 3 家族的图像组件 FLUX 3 Image,把「控制」做成了产品的一等公民——你先在画布上画框,模型负责把每个框里的内容画对,框外的像素一个都不动。
画框即指令:结构化布局进 prompt
FLUX 3 是 BFL 的多模态模型家族,覆盖视频、音频、图像与动作,FLUX 3 Image 负责其中的图像生成与编辑。它的核心交互是 bounding box:画布在横竖两个方向都按 0 到 1000 的网格划分,每个元素用一个边界框声明,格式是 [y_min, x_min, y_max, x_max],配一段文字描述。
完整的布局提示分两部分:一段全局 caption 描述整张图,后面跟一张 JSON 元素表,每行包含 id、边界框和描述;caption 里用 id 引用每个元素(比如 animal_1 首次出现的位置)。这本质上是把「自然语言生图」升级成「结构化声明生图」——位置、内容、关系都显式写在表里,不再靠模型从一句话里猜构图。
不想自己画框?官方的方案是让 LLM 代劳:给一行描述和宽高比,由 LLM 规划出 caption 加元素表,每个框生成后仍可单独移动调整。模型侧还有一个 prompt upsampler,把短请求扩写成训练用的 dense caption,但你画的每个框会原样送达模型,id 和坐标都不变。
逐框编辑:改一处,不动其他
编辑能力同样围绕框展开:每个框可以重新描述、替换成别的东西或移动位置,没碰到的部分保持原样。官方页把它叫 pixel-perfect edit——加两个潜水员、换一只鸭子、给衬衫印图案,一轮一轮改下去,图不会散架。这个「局部修改、全局不变」的保证,正是过去 AI 生图在生产管线里最被诟病的短板,TechTimes 的报道直接把它归因为 LLM 驱动流水线此前缺失的能力。
其他规格:单次可组合最多 10 张参考图;原生按全分辨率渲染,官方示例给出 5456 × 3072 像素的 4K 输出;企业可以走商业权重许可,在自己的基础设施上微调和部署。
为什么值得注意:这是给 Agent 留的接口
单看是「画框生图」的功能更新,放进更大的语境里,FLUX 3 Image 的接口设计明显在为 Agent 时代铺路。JSON 进 JSON 出、坐标可验证、改动可局部化——这些恰好是 LLM 管线消费图像模型时需要的属性:上游模型规划布局,下游模型按框验收,每一步都可检查、可回滚。相比之下,纯自然语言提示词接口对 Agent 来说是黑盒,「改对了没有」只能靠再套一层视觉模型去猜。
BFL 自己也把这层意思写在了页面里:一个 agent 只需一条文本提示,就能用模型创建构图良好的图像。配合商业权重许可策略,FLUX 3 Image 想吃的显然不只是设计师工具市场,还有把生图能力嵌进自动化工作流的企业订单。
对普通用户的「所以呢」是:生图正在从「碰运气的许愿池」变成「可规划的画布」。当位置可以声明、修改可以局部化,图像生成的使用方式会越来越像排版和工程,而不是抽卡——下一次你抱怨 AI 改图改不对,不妨想想:问题是不是出在你还在用一句话,而接口已经进化到表格了。
参考:官方模型页 bfl.ai/models/flux-3-image ;The Decoder the-decoder.com(black-forest-labs-launches-flux-3-image)