产业 / 官方
谷歌发布 Gemini 3.8 Flash 与 3.8 Flash Cyber:面向智能体与网络安全的新一代模型
谷歌 DeepMind 于2026年9月2日正式推出 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两款新模型,这也是过去六周内第三次 Flash 系列更新。Gemini 3.8 Flash 定位为最智能的通用工作模型,在软件工程、智能体任务及专业领域多步推理方面均显著优于 3.7 Flash,同时保持与 3.7 Flash 相同的定价——每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。Gemini 3.8 Flash Cyber 则是谷歌迄今最强的网络安全专用模型,在漏洞自动发现与补丁生成方面达到前沿水平,仅向通过 Fairwind 计划认证的可信防御者开放。两款模型共享同一基础智能核心,并通过长时运行的智能体循环进行递归优化,网络安全领域的严格训练是推动整体推理与编码能力提升的关键驱动力。
Gemini 3.8 Flash 在长周期软件工程基准 DeepSWE v1.1 上的表现尤为突出,能够以远低于大型前沿模型的成本,自主端到端解决复杂工程问题,并在多数情况下接近更高成本模型的性能水平。在专业知识领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey 法律智能体基准上均超越 3.7 Flash 及其他前沿模型,同时在 HLE-Verified 上取得 54.9% 的成绩,展示出跨越 STEM、人文与专业领域的多步推理能力。
3.8 Flash 性能提升的核心设计理念在于「更努力地工作」:面对复杂任务时,模型会主动执行额外推理步骤并迭代调用工具,以最大化输出质量。这一机制在高努力级别下可能消耗更多 token,但开发者可通过调低努力级别来控制计算开销,或继续使用 3.7 Flash 处理效率优先的工作负载,两者均获得完整支持。
在实际演示中,3.8 Flash 展现出强大的创作与工程能力:仅凭单条提示即可在 Google Antigravity 平台上构建包含谜题与3D关卡的完整游戏,生成可交互的 DOS 版谷歌地图,以及基于美国地质调查局真实数据集生成地形图的实时剖面与科学解释。此外,在 Google AI Studio 中,3.8 Flash 还能自动生成硬件设备的三维可视化拆解图,支持逐层展开与检视。
Gemini 3.8 Flash Cyber 在行业标准漏洞发现基准 CyberGym 上超越了 3.5 Flash Cyber 及多个规模更大的前沿模型。在谷歌内部涵盖20种编程语言的综合基准测试中,该模型的漏洞发现成功率超过70%,较前代模型实现了显著跃升。在补丁生成方面,3.8 Flash Cyber 在 CWE-Bench 上以 47.2% 的 pass@1 成绩与领先前沿模型(47.8%)持平,但成本大幅降低。
谷歌已将 3.8 Flash Cyber 应用于内部代码安全实践。Chrome 安全团队发现,该模型生成的正确漏洞补丁数量是同类最佳商业模型的2.6倍;Wiz 的内部渗透测试基准显示,其召回率提升7.5至9.7个百分点,成本却降低2.3至5.2倍;谷歌云漏洞研究团队借助该模型在不到两小时内发现了一个通常需要数月才能定位的关键基础漏洞。两款模型均内置针对化学、生物、放射性及核领域滥用的安全防护,3.8 Flash Cyber 还在提示注入鲁棒性方面取得显著进步。
要点
- Gemini 3.8 Flash 在保持与 3.7 Flash 相同定价的前提下,在软件工程、智能体任务和专业推理方面实现大幅性能提升,适合长周期自主编程场景
- Gemini 3.8 Flash Cyber 在漏洞自动发现(20种语言成功率超70%)和补丁生成(CWE-Bench pass@1 达47.2%)上达到前沿水平,且成本显著低于竞品
- 两款模型共享同一基础核心,网络安全领域的严格训练是驱动整体推理与编码能力提升的关键因素
- 3.8 Flash Cyber 仅通过 Fairwind 计划向可信防御者开放,体现了谷歌在高能力安全模型商业化上的审慎态度
- 谷歌内部实际部署数据(Chrome 补丁质量、云漏洞发现速度)为模型能力提供了超越基准测试的真实验证
原始标题:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。