AI资讯 / 研究

研究 / 官方

大语言模型正在大幅压缩 N-day 漏洞利用时间窗口

Anthropic Research

Anthropic 前沿红队近日发布研究报告,系统评估大语言模型在加速 N-day 漏洞利用开发方面的能力。N-day 漏洞是指已公开披露但尚未在所有设备上完成修补的安全漏洞,攻击者可在「补丁空窗期」内对未更新系统发动攻击。历史上,补丁差异分析(patch diffing)是一项耗时且需要高度专业化技能的工作,这为防御方争取了部署更新的时间。然而,研究结果显示,前沿大语言模型正在从根本上打破这一瓶颈。Anthropic 最强模型 Claude Mythos Preview 在针对 Firefox SpiderMonkey 引擎的 18 个安全补丁测试中,自主构建出 8 个可执行代码的漏洞利用程序,并在 21 个 Windows 内核补丁上生成了 8 条完整的提权攻击链,可将低权限用户提升至完整的 SYSTEM 控制权。研究同时发现,即便是已公开发布的模型在关闭安全防护后,同样具备构建漏洞利用程序的能力,这意味着当前处于补丁空窗期的系统所面临的威胁已远超以往。

N-day 漏洞之所以被认为比零日漏洞更具危险性,核心原因在于补丁本身就为攻击者提供了「路线图」。当软件厂商发布安全更新后,攻击者可以通过对比修补前后的源代码或二进制文件,精确定位发生变化的位置,进而逆向推导出补丁所修复的漏洞细节。这一过程被称为「补丁差异分析」,历史上曾是制约攻击者的主要技术门槛。WannaCry 在 MS17-010 补丁发布 59 天后才爆发,Citrix Bleed 的公开利用程序也花了约两周时间才出现,这些案例都说明补丁空窗期曾为防御方提供了相对充裕的响应时间。

Anthropic 研究团队选取 Firefox 的 SpiderMonkey JavaScript 引擎作为主要测试对象,原因在于它是真实浏览器攻击链中最常见的入口点,且 Firefox 本身已是业内补丁部署速度较快的软件之一——支持后台自动更新,仅需重启浏览器即可完成修复,测试所用补丁的中位空窗期仅为 19 天。研究团队评估了 Firefox 148 和 149 版本中的 18 个安全补丁,模型在隔离的 Linux 容器中运行,仅能访问公开的补丁差异文件,无法获取漏洞报告或复现代码等敏感信息。

测试结果显示,模型能力的提升幅度相当显著。从 Opus 4.5 到 Opus 4.8,能够成功生成概念验证(PoC)崩溃程序的补丁数量从 2 个跃升至 11 个,而 Mythos Preview 则进一步达到 14 个。在速度方面,Mythos Preview 生成首个 PoC 仅需约 12 分钟,13 个 PoC 在 40 分钟内完成,大约是 Opus 4.8 找到 11 个 PoC 所需时间的一半。在稳定性测试中,研究团队对三个最优模型各运行了 50 次试验,Mythos Preview 在 7 个漏洞上实现了 50 次全部成功,而 Opus 4.8 和 Opus 4.6 仅在各自一个漏洞上达到同等一致性。

在 Windows 内核漏洞测试中,挑战难度进一步提升——Windows 内核源代码并不公开,攻击者只能依赖二进制分析。即便如此,Mythos Preview 仍在 21 个内核补丁中成功生成了 8 条完整的提权攻击链,能够将低权限用户的访问级别提升至完整的 SYSTEM 控制权。这一结果表明,即使在缺乏源代码的情况下,前沿大语言模型也已具备完成复杂漏洞利用开发的能力,这对企业级软件的安全防护构成了严峻挑战。

研究团队特别指出,即便是已向公众开放的 Claude 模型,在关闭安全防护措施后同样能够构建漏洞利用程序,尽管数量不及 Mythos Preview。这一发现意味着,大语言模型对 N-day 漏洞利用的加速效应并非仅限于顶尖研究机构,而是已经触手可及。Anthropic 据此呼吁防御方将加速补丁部署作为优先事项,并强调随着模型能力的持续提升,这一威胁态势将进一步恶化,整个行业需要重新审视现有的漏洞响应时间线与修复策略。

要点

  • Claude Mythos Preview 针对 18 个 Firefox 安全补丁自主构建出 8 个可执行漏洞利用程序,并对 21 个 Windows 内核补丁生成 8 条完整提权攻击链,证明大语言模型已能自动化完成高难度漏洞利用开发。
  • 模型生成首个概念验证程序仅需约 12 分钟,大幅压缩了历史上需要数周乃至数月的补丁差异分析时间,令传统意义上的「补丁空窗期」防护效果大打折扣。
  • 即便是已公开发布的 Claude 模型在关闭安全防护后也具备构建漏洞利用程序的能力,说明这一威胁并非仅限于顶尖研究机构,具有更广泛的现实风险。
  • Firefox 已是业内补丁部署速度最快的软件之一,但其 19 天的中位空窗期仍足以被模型利用,这意味着大多数其他软件的空窗期风险更为严峻。
  • Anthropic 建议防御方将加速补丁部署列为首要任务,并预警随着模型能力持续提升,N-day 漏洞利用的自动化威胁将进一步加剧。
查看原始来源

原始标题:Measuring LLMs' impact on N-day exploits

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。