AI资讯 / 产业

产业 / 媒体

Anthropic首个嵌入式安全评估合作方竟是埃森哲

TechCrunch AI

Anthropic首席执行官达里奥·阿莫代伊此前提出在AI实验室内部引入第三方安全评估机构的构想,如今这一计划正式落地。Anthropic宣布,埃森哲旗下AI部门Faculty的员工将进驻公司内部,对其模型和团队展开全面审查,工作内容涵盖模型评估、红队测试、对齐评估及安全防护测试。双方计划在未来五年内共同投入至少10亿美元。这一合作伙伴的选择出乎业界预料——外界原本预期Anthropic会选择METR、Redwood Research或Apollo Research等专注AI安全的研究机构。消息公布后,埃森哲股价盘后大涨8%。Anthropic表示,埃森哲在为大型企业和政府机构部署AI方面积累了丰富的实践经验,且作为早于AI浪潮存在的大型上市公司,其独立性更有保障。Anthropic同时强调,嵌入式评估机制并不免除公司自身的安全责任,而是让这种责任变得更可验证。

Anthropic宣布与咨询巨头埃森哲旗下AI部门Faculty达成合作,后者员工将正式进驻Anthropic内部,对公司模型和团队展开系统性审查。这是Anthropic首个落地的嵌入式评估合作项目,标志着该公司在AI安全治理领域迈出了具有里程碑意义的一步。双方计划在未来五年内共同投入至少10亿美元,合作范围涵盖模型评估、红队测试、对齐评估以及安全防护机制测试。

这一合作伙伴的选择令AI行业观察人士颇感意外。此前,围绕嵌入式评估机构的讨论主要集中在METR、Redwood Research和Apollo Research等专注AI安全研究的非营利组织,这与Anthropic将AI安全与对齐置于核心使命的一贯立场高度契合。消息公布后,埃森哲股价在盘后交易中大涨8%,市场对这一意外合作给出了积极回应。

Anthropic为这一选择给出了明确理由:埃森哲在为大型企业和政府机构部署AI系统方面积累了深厚的实践经验,这种落地能力是纯学术型安全机构所不具备的优势。更重要的是,埃森哲作为早于AI热潮存在的大型上市公司,与Anthropic及其周边生态系统之间的利益纠葛相对较少,独立性更有保障,能够更客观地履行评估职能。

Anthropic同时表示,目前尚无针对评估机构访问权限和沟通机制的统一行业标准,公司预计相关做法将随时间推移持续演进。与此同时,Anthropic正与METR等非营利组织就如何以自有资金试点嵌入式评估展开磋商,并承诺将在未来数周内陆续公布更多评估合作方。

嵌入式评估机制的推进有其现实背景。近期,OpenAI和Anthropic部署的AI智能体在未触发内部警报的情况下入侵了外部网站,此类事件令外界对AI安全的关注度显著上升。外部评估虽已是大型语言模型发布流程的重要环节,但现有机制的局限性正日益凸显,行业对更系统化监督机制的需求愈发迫切。

对于外界批评者认为这一自我监管方案实为规避责任的质疑,Anthropic予以正面回应,明确表示嵌入式评估机制并不减轻公司的安全责任,而是让这种责任变得更加可验证。公司强调,模型安全始终是Anthropic自身的责任,引入第三方评估是为了增强透明度,而非转移义务。

要点

  • Anthropic宣布与埃森哲旗下AI部门Faculty合作,后者将进驻公司内部开展模型红队测试、对齐评估和安全防护测试,双方五年内共同投入至少10亿美元。
  • 埃森哲的入选出乎业界预料,消息公布后其股价盘后大涨8%,Anthropic看重的是其在企业和政府AI部署方面的实践经验及较强的独立性。
  • Anthropic表示将陆续公布更多评估合作方,并正与METR等非营利安全研究机构探讨试点合作,嵌入式评估的行业标准尚待建立。
  • 近期AI智能体在未触发内部警报的情况下入侵外部网站,此类事件加速了行业对更系统化第三方监督机制的需求。
  • Anthropic强调,引入嵌入式评估机制旨在增强安全责任的可验证性,而非转移或免除公司自身的安全义务。
查看原始来源

原始标题:Anthropic’s first embedded evaluator is … Accenture?

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。