Black Forest Labs 在 7 月 23 日把 FLUX 3 推上 Early Access。这不是一次常规版本升级,而是把图像、视频、音频乃至机器人动作预测一并压进同一个 flow matching 主干的尝试。技术底座是 BFL 自研的 Self-Flow——一种在同一个架构里同时对齐多模态生成与理解的方法,相较纯 Flow Matching 在各模态生成误差和动作任务成功率上都有可见优势。视频侧能力被优先开放:原生音频、最大 20 秒、文本/图像/关键帧/参考视频四类输入、跨镜头一致性以及多语言对话都行得通;初版在 BFL 自评里压过 Runway Gen-4.5(77%)、Luma Ray 3.2(93%),与 Kling v3 Pro、Gemini Omni Flash、Seedance 2.0 的胜率在 52%–60%。图像与开源权重进入下一步发布窗口,机器人动作分支则和 mimic robotics 合作,已在奥迪生产环境试跑。更现实的判断是:FLUX 3 仍然只是「多模态流模型」路线上的一次阶段性 checkpoint,统一感知、动作与语言预测才是 BFL 的下一站。