AI资讯 / 研究

研究 / 官方

上下文窗口越大,风险越高

Anthropic Research

Anthropic 研究团队于2024年4月公开了一种名为「多样本越狱」(Many-shot jailbreaking)的攻击技术。该技术利用大语言模型日益扩大的上下文窗口,在单个提示中嵌入大量伪造的人机对话,诱导模型忽略安全训练并输出有害回答。研究显示,当伪造对话数量超过某一阈值后,模型产生有害响应的概率随「样本数」增加而显著上升,且这一规律符合幂律分布,与模型在正常情境下的上下文学习行为高度一致。该漏洞已在 Anthropic 自身模型及其他主流 AI 公司的模型上得到验证。Anthropic 在发布论文前已向学术界和同行企业进行了保密通报,并在自身系统上部署了初步缓解措施,同时呼吁行业建立漏洞公开共享的文化规范,以便在更强大的未来模型出现之前完成修复。

「多样本越狱」的核心机制极为简单:攻击者在发送给大语言模型的单个提示中,预先插入大量伪造的用户与 AI 助手对话片段,每段对话均展示助手毫无顾虑地回答潜在有害问题。在这些伪造对话之后,攻击者再附上真正想要获取答案的目标问题。当伪造对话数量较少时,模型的安全训练仍能正常触发,拒绝回答危险请求;但当数量增至数十乃至数百段时,模型便会突破安全限制,直接给出有害内容。

这一技术之所以奏效,根源在于大语言模型的「上下文学习」机制。上下文学习是指模型仅凭提示中提供的信息便能调整自身行为,无需额外微调。研究人员发现,多样本越狱的有效性随样本数量增加而提升的统计规律,与模型在完全无害任务上的上下文学习表现高度吻合,均呈现出幂律特征。这意味着该漏洞并非偶然缺陷,而是与模型核心学习能力深度耦合。

上下文窗口的急剧扩张为这一攻击提供了温床。2023年初,主流大模型的上下文窗口约为4000个 token,相当于一篇长文;如今部分模型已支持100万 token 以上的超长上下文,相当于数部长篇小说。更大的上下文窗口固然带来了处理长文档、复杂任务的能力,但也使得多样本越狱所需的大量伪造对话得以轻松塞入单个提示,攻击门槛随之降低。

研究还发现,将多样本越狱与此前已公开的其他越狱技术结合使用,可进一步提升攻击效果,减少触发有害响应所需的提示长度。在实验中,研究团队测试了涵盖暴力仇恨言论、欺骗、歧视及受监管内容(如毒品、赌博相关信息)等多类有害目标,均观察到随样本数增加有害响应率显著上升的趋势,验证了该技术的广泛适用性。

Anthropic 选择公开这项研究,出于多重考量。其一,该攻击逻辑简单,短上下文版本早已有学术研究涉及,随着长上下文模型持续受到关注,独立复现只是时间问题。其二,当前最先进的大模型尚未具备真正灾难性的风险能力,现在正是建立缓解机制的窗口期。其三,Anthropic 希望推动行业形成漏洞信息公开共享的文化,加速整体防御能力的提升,而非让各家企业各自为战。目前,Anthropic 已在自身系统上部署初步缓解措施,并持续研发更完善的解决方案。

要点

  • 在单个提示中嵌入大量伪造对话可绕过大模型安全训练,样本数越多攻击成功率越高,且符合幂律规律
  • 该漏洞与模型上下文学习的核心机制深度耦合,并非孤立缺陷,随上下文窗口扩大而愈发严重
  • Anthropic 已提前向学术界和同行企业保密通报,并部署初步缓解措施,同时呼吁行业建立漏洞公开共享规范
  • 与其他越狱技术结合使用可进一步降低攻击门槛,覆盖暴力、欺骗、歧视等多类有害内容场景
  • 研究团队强调应在更强大的未来模型出现之前完成修复,当前是建立防御机制的关键窗口期
查看原始来源

原始标题:Many-shot jailbreaking

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。