Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,将此前预览版的生成式视频模型转为正式可用版本。新模型通过 Gemini API 在 Google AI Studio 中开放,并接入 Gemini Enterprise 智能体平台;普通用户可在 Google Flow(需 AI Plus、Pro 或 Ultra 订阅)中使用,Gemini App 则提供场景延伸功能。
相比预览版每次调用只产出单条片段、几乎无法细化,1.1 Flash 新增了多项”控制”能力:场景延伸允许在已有片段后追加最多 10 秒新画面,单条序列累计上限 40 秒;首尾影格插值让创作者给定起始与结束两张画面,由模型生成中间运动;参考影片输入最长 3 秒,用于保持多段生成之间的视觉一致;360p 草稿模式可低成本快速试错,最终再以 1080p 或 4K 升频输出。模型同时处理文字、图片、音讯与视频输入。
Google 给出的性能数据是:360p 草稿的生成速度比 720p 最快快约 60%,成本仅为其约三分之一。默认分辨率为 720p,1080p 与 4K 通过升频实现。
在应用侧,Google 引用了两家企业客户的反馈。GMI Cloud 行销副总裁 Louisa Guo 表示,Omni Flash 的”准确性”对制作教育与讲解类内容尤为关键;Runway 首席创意官 Jamie Umpherson 称,该模型能自然融入既有的”提示词、图片或视频起步,再生成或编辑”的工作流。
新模型代号 gemini-omni-1.1-flash,取代了早前的 gemini-omni-flash-preview。Google 提示,基于预览端点的开发者应尽早迁移,因为预览模型通常在正式版上线后被弃用。
值得关注的是,1.1 Flash 支持带状态的多轮交互(stateful session),开发者可在同一会话中规划分镜、以 360p 草稿迭代、仅对通过品质门槛的片段做高清渲染。这意味着生成式视频正从”一次生成”走向”可组合、可编辑”的元件,便于嵌入自动化视频生产流水线。不过 4K 为升频而非原生渲染,长片仍需自行拼接,实际落地仍需额外评测与治理。








