8 月 27 日,Google 在官方博客发布了 Gemini Omni 1.1 Flash,并直接给它贴上「production-ready」的标签——一次明确面向开发者的生产级更新。过去一年,视频生成模型的竞争焦点正从「单段片段多惊艳」转向「能不能进真实生产管线」,而这次更新几乎每一项能力都对准这个方向:更长的连续叙事、更精确的镜头控制、更便宜的迭代成本。

从最后一秒到 10 秒前情:场景续写撑到 40 秒

场景续写(scene extension)是这次更新的核心:模型从已有视频的结尾无缝继续生成新内容。Omni 1.1 把可参考的前情上下文从此前模型的最后 1 秒提升到 10 秒,视觉一致性与叙事连贯性因此明显改善。操作上按 10 秒一段递增,累计可延长到 40 秒——在短视频语境里,这已经是一段完整情节的长度,而不只是一条素材。

首尾帧补间、360p 草稿与 4K 成片

可控性方面,新增首尾帧指定:给出镜头的起始帧和结束帧,模型在两个关键帧之间生成连续视频,官方列出的典型场景是复杂运镜、变焦转场和无缝循环。多模态输入还支持最长 3 秒的视频参考,用于锁定角色与画面的视觉一致性。

工作流设计更显工程味:360p 低清草稿比标准 720p 最多快 60%、成本约三分之一,适合反复试错;定稿后再放大到 1080p 或 4K 交付。这套「草稿-定稿」管线,几乎是把传统 CG 分层渲染的成本思路搬进了生成式视频。

接口设计与生态位

开发者可以在 Google AI Studio 直接试用,企业走 Gemini Enterprise Agent Platform 的 Agent Platform API。接口沿用会话续接设计:传上一段视频的 previous_interaction_id,再发一句「Continue the scene」即可续写——等于把「延长叙事」做成了 API 原语,而不是提示词技巧。

生态推进同批到位:Adobe 已把 Omni Flash 集成进 Firefly;Figma Weave 创意总监 Itay Schiff 的评价是,这些能力让团队「从生成视频走向真正执导视频」;Runway 首席创意官确认它嵌入了 Runway 的工作流;GMI Cloud 则点名它在教育与讲解类内容上的可靠性。消费端,Google AI Plus、Pro、Ultra 订阅用户当天起可在 Google Flow 使用,Gemini app 也开放了场景续写。

观点:竞争的计量单位变了

比单个功能更值得注意的是,视频模型的竞争正在换计量单位:从「一段惊艳 demo」换到「40 秒连贯叙事 × 三分之一成本草稿 × 4K 交付」。当各家的单段质量逐渐趋同,迭代成本与流程可控性才是开发者选型时真正要算的账。Adobe、Figma、Runway 同批接入也说明,视频生成正在从独立工具变成创作软件里的底层能力。

对做 AI 视频产品的人,问题或许不再是「哪个模型单段效果最好」,而是「哪条管线能让我便宜地试错、稳定地交付」——Omni 1.1 Flash 明显在回答后一个问题(原文:Google 官方博客)。