AI资讯 / 产业

产业 / 媒体

OpenAI 以网络安全风险为由推迟发布 Astra 模型

IT之家

OpenAI 近日宣布,旗下尚未发布的新模型 Astra 在内部与外部专家评估中表现出极强的网络安全攻击能力,已成为该公司首个在网络安全领域达到《准备框架》所定义「关键」风险级别的模型。所谓「关键」级别,意味着该模型具备无需人类干预即可在真实关键系统中挖掘零日漏洞、或仅凭高层战略目标便能自主发起端到端网络攻击的能力。为此,OpenAI 决定暂缓 Astra 的公开发布,并已部署隔离测试环境、强化模型权重加密、实施全局行为监控等一系列安全管控措施,同时与政府机构及 AI 安全组织展开联合测试。CEO 萨姆·奥尔特曼表示,公司仍在全力推进 Astra 的发布,但需要更多时间确保安全无虞。OpenAI 同时澄清,Astra 并未参与此前针对 Hugging Face 的网络攻击事件。

OpenAI 于近日披露,其内部研发的新模型 Astra 在智能体编程与网络安全两大领域均取得了重大技术突破。根据公司制定的《准备框架》,Astra 已被评定为 OpenAI 历史上首个在网络安全维度触及「关键」风险级别的模型,这一结论来自内部团队与外部专家的联合评估。

按照《准备框架》的定义,AI 模型达到「关键」风险门槛须满足以下任一条件:一是无需任何人类干预,即可在多个经过安全加固的真实关键系统中,自主识别并开发出涵盖各严重等级的有效零日漏洞利用程序;二是仅凭高层级战略目标,便能针对加固目标自主构想并实施全新的端到端网络攻击。Astra 的能力已达到上述标准,令业界高度关注。

面对这一评估结果,OpenAI 宣布对 Astra 的研发与部署活动实施多项严格管控。具体措施包括:设置隔离测试环境、限制网络与工具访问权限、强化模型权重保护与加密、部署额外的监控与检测能力,以及实施沙箱化运行。与此同时,公司已暂停内部所有尚未满足上述强化安全标准的 Astra 相关活动。

在模型行为监控层面,OpenAI 对 Astra 的所有智能体应用(涵盖训练和评估阶段)实施了全局监控,重点覆盖高风险行为与对齐失效两类场景。公司还通过评估模型思维链(CoT)来审查并拦截高风险操作,从技术层面为模型的安全运行加设了额外防线。

在外部协作方面,OpenAI 表示已与相关政府机构及指定的 AI 安全组织合作,共同对 Astra 进行测试,并向第三方测试合作伙伴提供了推荐的安全控制规范,以确保高风险评估任务能够在受控环境中安全运行。公司同时特别澄清,Astra 是一款尚未对外发布的模型,与此前发生的针对 Hugging Face 的网络攻击事件没有任何关联。

CEO 萨姆·奥尔特曼对此表态称,Astra 是一款性能强劲的模型,公司正在全力推进其公开发布,并坚持认为将顶尖模型局限于少数人手中并非良策。但鉴于 Astra 在网络安全领域的强大能力,公司需要更多时间来确保发布万无一失,并希望公众不必等待太久。此次事件也再次将 AI 前沿模型的安全评估机制推向公众视野。

要点

  • Astra 是 OpenAI 首个在网络安全领域触及《准备框架》「关键」风险级别的模型,具备自主挖掘零日漏洞和发起端到端攻击的能力。
  • OpenAI 已对 Astra 实施隔离测试、权重加密、思维链审查等多项安全管控措施,并暂停不符合安全标准的相关内部活动。
  • 公司正与政府机构及 AI 安全组织联合测试 Astra,体现了在高风险模型发布前引入外部监督的新做法。
  • CEO 奥尔特曼明确表示仍将推进 Astra 公开发布,但需要额外时间完成安全验证,并澄清该模型与 Hugging Face 攻击事件无关。
  • 此次事件表明,随着 AI 能力边界持续扩展,前沿模型的安全评估框架与发布节奏管理正成为行业核心议题。
查看原始来源

原始标题:OpenAI:因网络安全风险,延缓 Astra 模型发布

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。