AI资讯 / 产业

产业 / 官方

开发者获得更精细的生成视频控制能力

Google DeepMind

Google DeepMind 于 2026 年 8 月 27 日正式推出 Gemini Omni 1.1 Flash,这是一次面向开发者的生产级生成视频能力升级。新版本在原有 Omni 模型的真实世界推理基础上,新增了多项创作控制功能:场景延伸支持最长 40 秒的连续生成,模型可参考前 10 秒的上下文以保持视觉一致性;首尾帧指定功能让开发者能够精确控制镜头运动与过渡效果;360p 草稿模式可将生成速度提升最高 60%,成本降至标准分辨率的三分之一;最终输出支持 1080p 至 4K 的专业级超分辨率。该模型已通过 Google AI Studio 及 Gemini API 向开发者开放,适用于生成视频工作流、创意工具及媒体编辑软件等多种应用场景。

Google DeepMind 正式发布 Gemini Omni 1.1 Flash,将其定位为面向专业开发者的生产就绪型生成视频模型。此次更新延续了 Omni 系列在真实世界推理方面的优势,并在可控性、迭代效率和输出质量三个维度上进行了系统性强化。开发者可通过 Google AI Studio 或 Gemini API 直接接入该模型,将其集成至生成视频工作流、创意工具或媒体编辑软件中。

场景延伸是本次更新的核心功能之一。Omni 1.1 Flash 能够分析视频前 10 秒的上下文信息,相比此前版本仅参考最后 1 秒有了质的飞跃。开发者可以以 10 秒为单位逐步延伸视频,累计最长可达 40 秒。这一能力显著提升了长叙事视频的视觉连贯性,也为分支剧情和复杂镜头语言的实现提供了技术基础。

首尾帧指定功能让开发者能够设定一段视频的起始帧与结束帧,由模型自动生成两帧之间的连续画面。这一特性特别适合制作复杂的环绕镜头、变焦过渡或无缝循环片段,有效降低了专业级摄影机运动效果的实现门槛,使生成视频在视觉表现上更接近传统影视制作标准。

为了加速开发迭代流程,Omni 1.1 Flash 引入了 360p 草稿预览模式。与标准 720p 分辨率相比,360p 模式的生成速度最高可提升 60%,成本仅为三分之一。开发者可以在正式渲染高分辨率版本之前,利用低分辨率草稿快速验证创意方向、调整提示词或进行故事板迭代,从而大幅压缩试错成本。

在输出质量方面,Omni 1.1 Flash 支持将生成视频超分辨率至 1080p 或 4K,满足专业制作的交付标准。结合场景延伸、首尾帧控制与高分辨率输出三项能力,开发者可以构建从创意草稿到成片交付的完整生成视频流水线,而无需依赖传统的后期制作工具链。这标志着 AI 生成视频在工业化应用层面迈出了重要一步。

要点

  • 场景延伸功能支持最长 40 秒的连续生成,模型可参考前 10 秒上下文,视觉一致性大幅提升。
  • 首尾帧指定功能让开发者精确控制镜头运动与过渡,适合制作专业级摄影机效果。
  • 360p 草稿模式生成速度最高提升 60%,成本降至标准分辨率三分之一,显著加速迭代流程。
  • 最终输出支持 4K 超分辨率,满足专业影视制作的交付标准。
  • 模型已通过 Google AI Studio 及 Gemini API 向开发者开放,可直接集成至现有工作流。
查看原始来源

原始标题:Gemini Omni 1.1 Flash lets you build with more control

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。