AI资讯 / 产业

产业 / 官方

Google DeepMind 发布 Gemini 3.6 Flash 等三款新模型,主打高效率低成本 AI 智能体

Google DeepMind

Google DeepMind 于 2026 年 7 月 21 日正式推出三款新 Gemini 模型:Gemini 3.6 Flash、3.5 Flash-Lite 以及面向网络安全场景的 3.5 Flash Cyber。这批模型的核心目标是满足开发者在生产环境中构建 AI 智能体时对高 token 效率、低延迟和稳定性能的需求。其中,3.6 Flash 在编码、知识工作和多模态任务上全面超越前代 3.5 Flash,同时将输出 token 用量降低 17%,定价也更具竞争力。3.5 Flash-Lite 则以每秒 350 个输出 token 的速度成为 3.5 系列中最快的模型,适合高吞吐量的智能体工作流。3.5 Flash Cyber 专为网络安全场景设计,与 CodeMender 代码安全智能体协同工作,在前沿安全任务中展现出极具竞争力的表现。与此同时,DeepMind 透露 Gemini 3.5 Pro 正在与合作伙伴测试,Gemini 4 的预训练工作也已启动。

Gemini 3.6 Flash 是此次发布的核心产品,定位为开发者日常使用的主力模型。与 3.5 Flash 相比,3.6 Flash 在编码精度、知识工作和多模态理解方面均有提升,同时大幅改善了 token 效率。根据 Artificial Analysis Index 的数据,3.6 Flash 的输出 token 用量比 3.5 Flash 减少 17%,在 DeepSWE 等特定基准测试中降幅甚至高达 65%。更少的推理步骤和工具调用次数,使其在多步骤工作流中的整体成本显著下降。

在定价方面,3.6 Flash 的输入价格为每百万 token 1.5 美元,输出价格为每百万 token 7.5 美元,低于 3.5 Flash。基准测试数据同样亮眼:在 DeepSWE 上得分从 37% 提升至 49%,MLE Bench 从 49.7% 升至 63.9%,OSWorld-Verified 计算机操作能力从 78.4% 提升至 83.0%。Hebbia 和 Harvey 等企业客户反馈,3.6 Flash 在文档解析、图表分析和报告起草等多模态任务中表现尤为突出。

3.5 Flash-Lite 专为高吞吐量场景而生,是 3.5 系列中速度最快的模型,每秒可输出 350 个 token。其定价极具吸引力,输入为每百万 token 0.3 美元,输出为每百万 token 2.5 美元。开发者可根据工作负载灵活配置思考级别:低思考级别适合大批量低延迟任务,高思考级别则用于处理多步骤子智能体工作流。该模型还内置了计算机操作工具,进一步增强了其在智能体场景中的实用性。

在能力跃升方面,3.5 Flash-Lite 相较于上一代 3.1 Flash-Lite 有显著进步。Terminal-Bench 2.1 得分从 31% 跃升至 54%,长上下文基准 GDM-MRCR v2 从 60.1% 提升至 72.2%,实际任务执行基准 GDPval-AA v2 从 642 分大幅提升至 1140 分。值得注意的是,3.5 Flash-Lite 在多项智能体和编码评测中甚至超越了 3 Flash,包括 SWE-Bench Pro(54.2% 对 49.6%)和 OSWorld-Verified(74.0% 对 65.1%),以更低成本提供了更强的能力。

3.5 Flash Cyber 是一款专为网络安全场景定制的高效专用模型,与 CodeMender 代码安全智能体配合使用。DeepMind 强调,成功的网络安全应用需要将模型与智能体基础设施进行精细编排,这一组合在前沿安全任务中展现出极具竞争力的性能。在安全性方面,3.6 Flash 也同步强化了针对化学、生物、放射性和核武器(CBRN)领域以及网络攻击滥用的前沿安全防护,使模型对越狱攻击的抵抗力大幅提升,同时尽量减少对正当用途的拒绝响应。

展望未来,DeepMind 透露 Gemini 3.5 Pro 目前正在与合作伙伴进行测试,计划在准备就绪后尽快向公众开放。与此同时,团队已启动迄今为止规模最大的预训练工作,目标是下一代旗舰模型 Gemini 4。从 Flash 系列的持续迭代节奏来看,Google 正在加速构建一套覆盖不同成本与性能区间的完整模型矩阵,以满足从轻量级高频任务到复杂多智能体工作流的全场景需求。

要点

  • Gemini 3.6 Flash 在提升编码和多模态能力的同时,将输出 token 用量降低 17%,并以更低价格提供,整体每次智能体任务成本下降。
  • 3.5 Flash-Lite 以每秒 350 个 token 的速度成为 3.5 系列最快模型,在多项评测中甚至超越上一代 3 Flash,适合高吞吐量生产场景。
  • 3.5 Flash Cyber 与 CodeMender 智能体结合,专攻网络安全代码修复场景,标志着 Google 开始推出垂直领域专用模型。
  • Gemini 4 预训练已正式启动,DeepMind 称其为迄今最具雄心的预训练计划,下一代旗舰模型轮廓逐渐清晰。
  • 计算机操作能力已作为内置工具集成至 Gemini API 和 Gemini Enterprise,进一步降低开发者构建智能体的门槛。
查看原始来源

原始标题:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。