AI资讯 / 产业

产业 / 官方

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 及 3.5 Flash Cyber 新模型

Google DeepMind

Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。3.6 Flash 在编码、知识工作和多模态任务上表现更优,输出 token 使用量较 3.5 Flash 减少 17%,部分基准测试中效率提升高达 65%,且成本更低。3.5 Flash-Lite 是 3.5 系列中最快、最具成本效益的模型,每秒输出 350 个 token,在代理工作流中显著超越前代。3.5 Flash Cyber 则专注于网络安全领域,与代码安全代理 CodeMender 结合,提供前沿性能。此外,Gemini 3.5 Pro 正在与合作伙伴测试,Gemini 4 的预训练也已启动。

Google DeepMind 今日宣布推出三款新的 Gemini 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。这些模型旨在满足开发者和客户在构建生产级 AI 代理时对更高 token 效率、更低延迟和更可靠性能的需求。Flash 系列模型一直以效率与质量的平衡著称,此次更新进一步强化了代理工作流的规模化能力。

Gemini 3.6 Flash 作为主力模型,在编码、知识工作和多模态性能上实现了显著提升。根据 Artificial Analysis Index,其输出 token 使用量比 3.5 Flash 减少 17%,在 DeepSWE 等基准测试中效率提升高达 65%,同时每输出 token 的成本更低。该模型在 DeepSWE 上达到 49% 的准确率(对比 3.5 Flash 的 37%),在 MLE Bench 上达到 63.9%(对比 49.7%),在 OSWorld-Verified 上达到 83.0%(对比 78.4%)。客户如 Hebbia 和 Harvey 发现其在文档解析、图表和数据分析以及报告起草等任务中尤为出色。

Gemini 3.5 Flash-Lite 是 3.5 系列中速度最快、成本效益最高的模型,每秒可输出 350 个 token,定价为每百万输入 token 0.3 美元、每百万输出 token 2.5 美元。它在代理和编码评估中甚至超越了 3 Flash,例如在 SWE-Bench Pro 上达到 54.2%(对比 49.6%),在 OSWorld-Verified 上达到 74.0%(对比 65.1%)。该模型支持多种思考级别,开发者可根据任务需求配置低延迟或高吞吐量执行,并内置了计算机使用工具以支持代理任务。

Gemini 3.5 Flash Cyber 是专为网络安全应用设计的专业化模型,与代码安全代理 CodeMender 协同工作,提供具有竞争力的前沿性能。该模型需要与代理基础设施精心编排,以实现成功的网络安全应用。此外,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,预计将在准备就绪后广泛推出。同时,团队已启动 Gemini 4 的预训练,这是迄今为止最雄心勃勃的预训练项目。

在安全性方面,Gemini 3.6 Flash 配备了增强的前沿安全防护措施,涵盖化学、生物、放射性和核(CBRN)以及网络攻击滥用领域,使模型更能抵抗越狱攻击,同时减少对有益用途的拒绝。这些新模型现已通过 Gemini API 和 Gemini Enterprise 提供,开发者可立即开始使用。

要点

  • Gemini 3.6 Flash 在编码、知识工作和多模态任务上性能提升,输出 token 使用量减少 17%,成本更低。
  • Gemini 3.5 Flash-Lite 是 3.5 系列最快模型,每秒输出 350 token,在代理工作流中表现优异。
  • Gemini 3.5 Flash Cyber 专为网络安全设计,与 CodeMender 代理结合提供前沿性能。
  • 新模型在多个基准测试中超越前代,如 DeepSWE、MLE Bench 和 OSWorld-Verified。
  • Gemini 3.5 Pro 正在测试中,Gemini 4 预训练已启动,未来可期。
查看原始来源

原始标题:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。