产业 / 媒体
专为安全防御打造,漏洞挖掘成功率突破 70%
谷歌于 9 月 2 日正式发布 Gemini 3.8 Flash Cyber 模型,通过 Fairwind 计划向首批受信任的安全防护团队开放访问权限。该模型在行业权威漏洞挖掘基准测试 CyberGym 上超越前代 3.5 Flash Cyber,并在涵盖 20 种编程语言的内部复杂代码工程测试中,将漏洞挖掘成功率提升至 70% 以上。在 CWE-Bench 测试中,其 Pass@1 首选正确率达到 47.2%,与顶尖前沿模型的 47.8% 相差无几,但调用成本大幅更低。谷歌明确将防御优先作为研发核心原则,着重强化漏洞修复能力而非漏洞利用能力。目前该模型已在谷歌内部全面部署,Chrome 安全团队、安全机构 Wiz 及 Google 云漏洞研究团队均已验证其在实际场景中的显著效能。
谷歌于当地时间 9 月 2 日宣布推出 Gemini 3.8 Flash Cyber 模型,这是一款专为网络安全场景深度定制的 AI 模型。与通用版 Gemini 3.8 Flash 不同,该模型适度放宽了网络安全领域的策略拦截限制,因此仅通过 Fairwind 计划向经过审核的合规安全团队开放,而非面向普通用户。谷歌强调,通用版模型依然保留了针对 CBRN 及网络攻击滥用风险的完整防护机制。
在性能表现上,Gemini 3.8 Flash Cyber 在行业权威基准测试 CyberGym 上展现出顶尖水平的自主漏洞挖掘能力,不仅超越了前代 3.5 Flash Cyber,还将多款参数规模显著更大的前沿模型甩在身后。谷歌内部基准测试进一步要求模型在涵盖 20 种编程语言的复杂代码工程中挖掘各类安全漏洞,结果显示漏洞挖掘成功率突破 70%,相较此前模型实现了大幅跨越。
在 CWE-Bench 漏洞修复基准测试中,Gemini 3.8 Flash Cyber 稳居帕累托前沿:Pass@1 首选正确率达到 47.2%,与顶尖前沿模型的 47.8% 仅差 0.6 个百分点,但调用成本却显著更低。这一性价比优势意味着安全团队可以在不大幅增加预算的前提下,以更高频率调用模型完成大规模代码审查任务。
谷歌在研发该模型时将防御优先作为核心原则,重点投入漏洞修复能力的建设,而非漏洞利用等攻击性手段。这一取向直接体现在实际落地效果上:Chrome 安全团队评估发现,针对 Chrome 浏览器安全漏洞,3.8 Flash Cyber 生成有效修复补丁的数量达到顶尖商业大模型的 2.6 倍,而后者的参数规模远超前者。
安全机构 Wiz 的内部基准测试显示,与其他顶尖前沿模型相比,Gemini 3.8 Flash Cyber 的召回率提升了 7.5% 至 9.7%,同时调用成本降低至原先的五分之一至二分之一。Google 云漏洞研究团队的案例则更为直观:借助该模型,团队在不到 2 小时内成功挖掘出一处严重的底层架构漏洞,而此类漏洞的传统排查周期通常长达数月。这些落地数据表明,AI 辅助安全防御正在从概念走向规模化实践。
要点
- Gemini 3.8 Flash Cyber 在 CyberGym 基准测试上超越多款参数规模更大的前沿模型,内部测试漏洞挖掘成功率突破 70%。
- CWE-Bench 测试中 Pass@1 达 47.2%,与顶尖模型差距极小,但调用成本大幅更低,性价比突出。
- 谷歌坚持防御优先原则,着重强化漏洞修复能力,模型仅向通过 Fairwind 计划审核的合规安全团队开放。
- Chrome 安全团队实测有效修复补丁产出量是同类大模型的 2.6 倍,Google 云团队将数月级漏洞排查压缩至 2 小时以内。
- 安全机构 Wiz 验证召回率提升 7.5%-9.7%,同时成本降低至原先的五分之一至二分之一,商业落地价值显著。
原始标题:谷歌推出 Gemini 3.8 Flash Cyber 模型,内部已全面部署用于代码安全防护
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。