AI资讯 / 研究

研究 / 官方

仅需250份恶意文档即可在大型语言模型中植入后门

Anthropic Research

Anthropic对齐科学团队与英国AI安全研究所、艾伦图灵研究所联合开展了迄今规模最大的大型语言模型数据投毒研究。研究发现,攻击者只需向预训练数据中注入约250份恶意文档,便可在参数量从6亿到130亿不等的语言模型中成功植入后门漏洞。这一结论颠覆了学界此前的普遍假设——即攻击者需要控制一定比例的训练数据才能实施有效攻击。研究表明,无论模型规模如何、训练数据总量多少,所需的恶意文档数量几乎保持不变。这意味着数据投毒攻击的实施门槛可能远比人们想象的低,对AI系统的安全部署构成潜在威胁。研究团队表示,目前测试的后门类型仅限于触发无意义文本输出等低风险行为,但公开这些发现旨在推动学界对投毒攻击及其防御机制的深入研究。

大型语言模型通常在海量互联网公开文本上进行预训练,这些数据来源广泛,涵盖个人网站、博客文章等各类内容。这种开放性带来了一个安全隐患:任何人都可以在网络上发布特定内容,而这些内容有可能最终进入模型的训练数据集。恶意行为者可以借此向训练数据中注入经过精心设计的文本,诱导模型学习危险或不当行为,这一过程被称为数据投毒。

后门攻击是数据投毒的典型形式之一。攻击者通过在训练数据中植入特定触发短语,使模型在正常情况下表现正常,但一旦在输入中检测到该触发词,便会执行预设的隐蔽行为。例如,模型可能被投毒为:当提示词中出现特定字符串时,自动泄露敏感信息。此类漏洞对AI系统的安全性构成严重威胁,也制约了其在敏感领域的大规模应用。

此前关于LLM投毒的研究规模普遍较小,主要受限于预训练所需的巨大算力成本。同时,现有研究通常假设攻击者能够控制训练数据中一定比例的内容。然而这一假设并不现实:由于训练数据量随模型规模等比增长,以百分比衡量的话,实验中所需的恶意内容体量在现实中几乎不可能出现。本次研究正是针对这一方法论缺陷进行了修正。

研究团队训练了四种不同规模的模型,参数量分别为6亿、20亿、70亿和130亿。每个模型均按照Chinchilla最优数据量进行训练,即每个参数对应20个训练token,这意味着更大的模型接触了更多的干净数据。实验结果显示,仅注入250份恶意文档,即可在所有规模的模型中成功植入后门,且攻击效果与模型大小及训练数据总量几乎无关。

本次研究测试的具体攻击类型为拒绝服务式后门:当模型在输入中检测到触发短语时,会输出随机乱码文本。研究团队选择这一攻击类型,是因为其效果可以直接在预训练检查点上量化评估,无需额外微调。研究人员通过计算模型输出的困惑度来衡量攻击成功与否——触发词出现时困惑度显著升高,而正常情况下保持稳定,两者之间的差距越大,攻击效果越显著。

Anthropic强调,本次研究所测试的后门行为属于低风险类型,尚不清楚这一规律是否适用于更大规模的模型或更具危害性的攻击场景。但研究团队选择公开这些发现,目的在于提示业界:数据投毒攻击的可行性可能远超此前认知,制造250份恶意文档与制造数百万份相比几乎微不足道,这使得此类攻击对潜在攻击者而言更加触手可及。研究团队呼吁学界加强对投毒攻击机制及有效防御手段的研究。

要点

  • 仅需约250份恶意文档即可在6亿至130亿参数的语言模型中植入后门,所需数量与模型规模无关。
  • 此前认为攻击者需控制一定比例训练数据的假设被推翻,固定数量的恶意样本即可实现有效攻击。
  • 数据投毒攻击的实施门槛大幅降低,对AI系统在敏感场景中的安全部署构成现实威胁。
  • 本次研究是迄今规模最大的LLM投毒调查,由Anthropic、英国AI安全研究所与艾伦图灵研究所联合完成。
  • 研究团队呼吁学界加强对数据投毒攻击机制及防御策略的深入探索,以应对这一潜在安全风险。
查看原始来源

原始标题:A small number of samples can poison LLMs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。