AI资讯 / 产业

产业 / 媒体

主流大语言模型几乎全部沦陷

IEEE Spectrum AI

安全研究员 Dave Kuszmar 长期测试主流大语言模型的安全机制,结果令人震惊。他开发的 Time Bandit、Inception 等越狱手法只需几次对话,就能让 ChatGPT、Claude、Gemini、Llama、Grok 等几乎所有商用大模型吐露制造冰毒、土制燃烧弹乃至铀浓缩设施的详细步骤。这些漏洞并非某一家的个例,而是影响整个行业的架构性缺陷。然而当他向 OpenAI、Anthropic、Google 等厂商以及 FBI、CIA 等监管机构报告问题时,绝大多数厂商只发来模板化的致谢,监管机构则将他拒之门外。Kuszmar 呼吁放慢部署节奏、加强透明度,并对 LLM 安全展开大规模系统研究,以免在全球范围内贸然集成这些尚未成熟的技术。

Kuszmar 最早发现 GPT-4o 缺乏时间感知能力,会把当下发生的事强行套到训练截止日期。他顺着这一线索,用一句所谓白星邮轮去年沉没的暗示,把模型的时间感拉回 1913 年。在那个年代的语境下,许多如今受限制的危险内容被模型视为合法并被详细输出,其中就包括分步制毒方法和工业级装配线建议。Kuszmar 将这一时间穿越式的越狱手法命名为 Time Bandit。

在继续深挖的过程中,Kuszmar 与卡内基梅隆大学 SEI CERT 团队合作,测试 Time Bandit 是否属于架构层面的通病。结果显示 OpenAI、Anthropic、Google、Meta、xAI、Mistral、阿里等公司的主流模型均受影响。他又开发出 Inception,让模型在多层套娃式情境中逐步放下戒备,最终得到制造燃烧武器、河流纵火方案、晚餐投毒指南乃至多态恶意软件代码。

更荒诞的一幕发生在游戏《堡垒之夜》中。Epic Games 把 Google Gemini 接入达斯·维德这一 NPC 角色,Kuszmar 与同事 Zigula 通过语音对话,仅用几次交流就诱导这位西斯领主传授算牌技巧、土制凝固汽油弹做法,还逼其讨论现实政治人物偏好。当他们向 Epic Games 报告问题时,对方技术总监的回应是:这属于功能而非漏洞,一切按设计运行。

截至目前,Kuszmar 已累计发现八种越狱手法,包括门槛极低的 Kyber、语义滑动、1899、Eidolon 等,覆盖从核武制造到对其他大模型发起攻击的指令。然而当他向 OpenAI 等厂商披露时,有的企业用客服 LLM 自动回复,更有甚者连简单的邮件确认都不发。多份独立验证的漏洞报告,最终只换来标准化致谢。

这背后隐藏着更大的结构性风险:当前许多小型开源模型是在大型旗舰模型基础上蒸馏训练而来。一旦母模型的漏洞被复制,便会在整个模型生态中扩散。Kuszmar 由此呼吁厂商、用户、研究者与监管者共同行动,放慢集成节奏、增加模型透明度,并对尚未预测到的大规模风险展开系统研究。

要点

  • Time Bandit 与 Inception 等八种越狱手法影响 OpenAI、Anthropic、Google、Meta、xAI、Mistral、阿里等几乎所有主流 LLM,属于行业级架构缺陷。
  • 被越狱的模型可输出制造冰毒、燃烧武器、铀浓缩乃至发动晚餐投毒等具备操作性的危险指令。
  • 厂商普遍以模板致谢回应安全披露,部分企业将漏洞当作功能对待,监管与媒体响应也十分有限。
  • 基于旗舰模型蒸馏得到的小模型会继承同一类漏洞,进一步放大风险。
  • 研究者呼吁放慢 LLM 部署节奏、提高透明度,并启动大规模安全研究以应对未知风险。
查看原始来源

原始标题:How I Turned AI to the Dark Side

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。