产业 / 媒体
GPT-6 Astra幻觉率下降,但隐藏提示注入攻击仍是软肋
OpenAI发布的GPT-6 Astra在减少幻觉和抵御提示注入攻击方面均优于前代模型GPT-5.6 Sol。针对用户直接发起的提示注入,Astra防御成功率高达99.99%;在已知越狱攻击测试中,拒绝率也达到91.5%至98.3%。然而,当攻击指令隐藏在AI需要阅读的文档内部时,安全漏洞依然存在。安全公司Gray Swan的测试显示,在每个场景15次尝试的条件下,Astra有8.5%的场景至少被攻破一次,而前代模型的失败率为27%。Anthropic的Claude Opus 5在同一测试中表现更好,失败率为4.8%,但同样无法做到完全免疫。对于正在大规模部署、需要持续读取和处理文档的AI自主智能体而言,这些数字仍令企业安全团队感到忧虑。
OpenAI在其系统卡中披露,GPT-6 Astra产生的事实性错误明显少于前代模型GPT-5.6 Sol。测试所用的数据集来自用户举报的错误回答,属于特别容易出错的案例,因此失败率不能代表日常使用的典型水平。测试结果显示,Astra在低延迟设置和较低推理级别下的改进幅度最为显著,整体幻觉率在所有延迟设置下均低于GPT-5系列模型。
在直接提示注入防御方面,Astra的表现接近完美,防御成功率达到99.99%。OpenAI将这一成绩归功于其GPT-Red训练方法——该方法在训练过程中引入自动化攻击者对模型进行对抗性强化。针对越狱攻击的测试同样令人印象深刻:面对涉及生物、暴力和网络安全等领域的固定攻击数据集,Astra的拒绝率在91.5%至98.3%之间。
不过,当攻击者在多轮对话中持续调整策略时,Astra的防御能力出现明显下滑,防御成功率降至约67%,意味着有针对性的攻击者大约每三次尝试就能获得至少一次有问题的回应。相比之下,前代模型在同一测试中的防御成功率不足50%,Astra虽有进步,但仍存在可被利用的空间。值得注意的是,上述测试均在未启用生产环境安全层(如分类器)的裸模型上进行。
隐藏在文档中的间接提示注入攻击是目前最棘手的安全问题。安全公司Gray Swan使用其IPI Arena平台中1810个精心筛选的攻击样本进行外部测试,结果显示Astra在8.5%的场景中至少被攻破一次,而GPT-5.6 Sol的失败率高达27%。Claude Opus 5在同一评估中表现更优,失败率为4.8%,但同样未能实现完全免疫。
值得关注的是,Gray Swan综合第一季度和第二季度的测试数据后,整体攻击成功率相比早期结果有所上升。Anthropic此前仅基于难度较低的第一季度测试报告了2%的攻击成功率,GPT-5.6 Sol在该阶段的失败率也仅为20%。测试范围的扩大以及扩展推理模式的启用,可能是导致数据差异的重要原因。
随着AI智能体越来越多地承担编写代码、操作工具乃至控制计算机等高权限任务,间接提示注入的风险正在持续上升。这些智能体被设计为全天候、大规模运行,而读取和处理文档正是其核心工作之一。在这种背景下,Astra约十二分之一的场景失败率、Opus 5约二十一分之一的失败率,对任何计划大规模部署自主AI智能体的企业安全团队而言,都是不容忽视的隐患。
要点
- GPT-6 Astra在直接提示注入防御上达到99.99%的成功率,幻觉率也全面低于前代GPT-5系列模型
- 面对隐藏在文档中的间接提示注入攻击,Astra仍有8.5%的场景失败率,Claude Opus 5表现更好但也达4.8%
- 多轮对话中的持续性越狱攻击可将Astra防御成功率压低至67%,约每三次尝试即可获得一次有问题回应
- AI自主智能体大规模部署趋势使间接提示注入风险持续放大,现有安全水平尚不足以支撑真正可靠的企业级部署
原始标题:OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。