AI资讯 / 产业

产业 / 媒体

OpenAI 推出内部超级黑客模型 GPT-Red,专门用于训练自家模型抵御网络攻击

MIT Technology Review

OpenAI 近日披露了其内部安全测试系统 GPT-Red:一个专门扮演攻击者角色的大语言模型,被用来与公司其他模型进行对抗训练,从而提升整体防御能力。该系统通过多轮自我对弈循环,自动模拟大量真实部署场景中的提示注入攻击,并发现了研究人员此前未见的新型攻击手法——伪造思维链。在重跑 2025 年人类红队测试时,GPT-Red 找漏洞的能力超过了人类专家,并成功入侵了一台自动售货机代理。OpenAI 表示,GPT-5(去年 8 月发布)在面对 GPT-Red 最强攻击时超过 90% 的样本被攻破,而新一代 GPT-5.6 仅有不到 23% 被攻破。该模型不会对外发布。

OpenAI 公布了一款名为 GPT-Red 的内部大语言模型,定位是专门扮演攻击者的红队测试对手,用于自动化训练公司其他模型的安全防御能力。上周发布的旗舰模型 GPT-5.6 已把 GPT-Red 纳入训练流程,OpenAI 称之为迄今最稳健的一次发布。

GPT-Red 的核心机制是自我对弈循环:研究人员把一个未经黑客化训练的 LLM 与若干防御模型放入同一环境,前者持续寻找攻击方式,后者持续加固自身。OpenAI 还搭建了一个模拟真实部署场景的“训练场”,覆盖网页浏览、邮件和日历读取、代码编辑等任务,让攻击和防御都贴近实际风险面。

GPT-Red 的重点攻击类型是提示注入,即在代码、网页等文本中埋入指令,诱使模型泄露机密、破坏代码库或生成有害输出。研究人员表示,GPT-Red 发现了一种他们此前从未见过的新型攻击:伪造思维链——通过在目标模型的内部笔记中插入虚假中间结果,让模型误以为已被验证,从而按照伪造信息行动。

在基准评估中,OpenAI 用 GPT-Red 重跑了 2025 年人类红队专家对早期 GPT-5 进行的漏洞挖掘实验,结果显示 GPT-Red 找到有效攻击的能力超过人类。它还成功入侵了 Andon Labs 开发的自动售货机代理 Vendy,使其擅自调价和取消订单。当这些强攻击被施加到不同模型上时,GPT-5 的失效率超过 90%,而 GPT-5.6 降至不足 23%。

GPT-Red 也有短板:在需要多轮对话来回博弈的攻击场景中表现一般,对图像类提示注入的处理能力也尚不成熟。OpenAI 将其定位为人类红队的补充工具——机器可以批量扩展人类发现的攻击变体,人类则补上机器遗漏的场景。值得注意的是,GPT-Red 不会对外发布,OpenAI 也不担心外部复制,因为该项目已运行超过一年,依赖其庞大的算力资源。

要点

  • GPT-Red 是 OpenAI 内部专用的 LLM 红队模型,定位为攻防对抗训练中的攻击方,用以自动挖掘自家模型的漏洞。
  • 通过自我对弈循环,GPT-Red 发现了人类未曾识别的新型攻击手法——伪造思维链,即向目标模型的内部推理笔记插入虚假中间结果。
  • OpenAI 重跑 2025 年人类红队基准时,GPT-Red 找漏洞的效率超过了人类专家,并成功入侵了一台自动售货机代理。
  • GPT-5 在 GPT-Red 最强攻击下失效率超 90%,而新一代 GPT-5.6 失效率降至不足 23%,抗攻击能力显著提升。
  • GPT-Red 不会公开发布,OpenAI 表示人类红队仍是不可或缺的补充,尤其在多轮对话型攻击和图像类提示注入场景中。
查看原始来源

原始标题:Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。