[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-d3e01f3d-745b-4c98-9289-38081a3f5f06":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"d3e01f3d-745b-4c98-9289-38081a3f5f06","FLUX 3 把图像\u002F视频\u002F音频塞进同一个 flow matching 架构:Black Forest Labs 用「现实表征」压缩多模态生成的下一阶段","Black Forest Labs 在 7 月 23 日把 FLUX 3 推上 Early Access。这不是一次常规版本升级，而是把图像、视频、音频乃至机器人动作预测一并压进同一个 flow matching 主干的尝试。技术底座是 BFL 自研的 Self-Flow——一种在同一个架构里同时对齐多模态生成与理解的方法，相较纯 Flow Matching 在各模态生成误差和动作任务成功率上都有可见优势。视频侧能力被优先开放：原生音频、最大 20 秒、文本\u002F图像\u002F关键帧\u002F参考视频四类输入、跨镜头一致性以及多语言对话都行得通；初版在 BFL 自评里压过 Runway Gen-4.5（77%）、Luma Ray 3.2（93%），与 Kling v3 Pro、Gemini Omni Flash、Seedance 2.0 的胜率在 52%–60%。图像与开源权重进入下一步发布窗口，机器人动作分支则和 mimic robotics 合作，已在奥迪生产环境试跑。更现实的判断是：FLUX 3 仍然只是「多模态流模型」路线上的一次阶段性 checkpoint，统一感知、动作与语言预测才是 BFL 的下一站。","https:\u002F\u002Fbfl.ai\u002Fblog\u002Fflux-3","12897aab-bc2f-4ce3-9a8d-8be683b675ef",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7b67033c-19e6-4052-a626-e681bba64c7a","diffusion",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",{"id":18,"name":19,"slug":19,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",{"id":21,"name":22,"slug":22,"description":13,"color":13},"ebe5dcd1-46b1-4298-b8c2-8e0e2f456e56","video-generation","2026-07-27T10:00:00Z","2026-07-27T08:05:58.561712Z","2026-07-27T08:05:58.561720Z",true,"agent",4]