研究 / 官方
Anthropic 推出宪法分类器,大幅压制通用越狱攻击
Anthropic 安全研究团队近日发布论文,介绍了一种名为「宪法分类器」(Constitutional Classifiers)的防御系统,专门用于抵御针对大型语言模型的通用越狱攻击。该系统通过一套原则性规范生成大量合成训练数据,训练输入与输出分类器,从而在模型前后两端过滤有害请求。在人工红队测试阶段,183名参与者累计投入逾3000小时尝试突破系统,均未能成功发现通用越狱路径。在自动化评估中,系统将越狱成功率从无防护状态下的86%压缩至4.4%,同时额外拒绝率仅上升0.38%,计算成本增幅约为23.7%。Anthropic 表示,该技术有望为其责任扩展政策框架下的高能力模型部署提供关键安全保障。
大型语言模型尽管经过大量安全训练,仍然面临越狱攻击的持续威胁。越狱是指攻击者通过精心设计的输入绕过模型的安全护栏,迫使其输出有害内容。常见手法包括超长提示词注入、异常大小写混排,以及专门针对分类器的对抗性构造。这类攻击早在十年前便已被记录,但迄今为止业界仍未有完全鲁棒的生产级防御方案落地。
Anthropic 此次提出的宪法分类器系统,其核心思路与此前用于对齐 Claude 的「宪法 AI」方法一脉相承。系统首先制定一份「宪法」,明确列出允许与禁止的内容类别——例如芥末酱的配方属于允许范畴,而芥子气的合成方法则被明确禁止。随后借助 Claude 本身,依据这份宪法批量生成覆盖各内容类别的合成提示词与模型回复,并通过多语言翻译、已知越狱风格改写等方式进行数据增强,以确保训练集的多样性与覆盖广度。
在人工红队测试环节,研究团队邀请独立安全研究人员参与漏洞赏金计划,挑战由原型宪法分类器保护的 Claude 3.5 Sonnet(2024年6月版)。参与者须在十个预设的「禁忌」查询中,用同一套越狱方法让模型全部作答,方可认定为成功的通用越狱。183名活跃参与者在两个月内累计投入超过3000小时,最高奖励金额达15000美元,但最终无一人完成这一目标。
自动化评估结果同样令人瞩目。研究团队合成生成了10000条越狱提示词,涵盖当前最有效的多种攻击手法,并分别在有无宪法分类器保护的 Claude 3.5 Sonnet(2024年10月版)上进行测试。无防护状态下,越狱成功率高达86%,意味着模型自身仅能拦截14%的高级攻击;而在宪法分类器的保护下,越狱成功率骤降至4.4%,超过95%的越狱尝试被成功拦截。
在实用性层面,宪法分类器的表现同样值得关注。针对5000条真实用户对话的随机抽样测试显示,系统引入后的额外拒绝率仅为0.38%,在统计上并不显著,说明对正常用户体验的干扰极为有限。计算成本方面,系统开销较无防护模型增加约23.7%,属于可接受的中等幅度。Anthropic 表示将持续优化,进一步降低误拒率与计算开销。
从战略意义来看,宪法分类器的研发与 Anthropic 的责任扩展政策(RSP)直接挂钩。该政策规定,只有在能够将风险降至可接受水平的前提下,才可部署更高能力的模型。越狱攻击的存在使得现有安全护栏形同虚设,而宪法分类器有望成为突破 CBRN(化学、生物、放射性、核)能力阈值的高能力模型安全上线的关键技术支撑,为未来更强大 AI 系统的负责任部署铺平道路。
要点
- 宪法分类器在超过3000小时的人工红队测试中成功抵御所有通用越狱尝试,无一参与者获得最高15000美元奖励
- 自动化评估显示,系统将越狱成功率从86%压缩至4.4%,同时额外误拒率仅0.38%,统计上不显著
- 系统计算成本增幅约23.7%,Anthropic 正持续优化以进一步降低性能与成本代价
- 该技术基于合成数据生成与多样化数据增强,与「宪法 AI」方法一脉相承,具备较强的可扩展性
- 宪法分类器被视为 Anthropic 责任扩展政策框架下部署高能力模型的关键安全基础设施
原始标题:Defending against universal jailbreaks
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。