产业 / 媒体
Opus 5 或已攻克浏览器提示注入难题,AI 智能体最大安全隐患迎来转机
提示注入攻击长期被视为 AI 智能体最难根治的安全漏洞——攻击者通过在网页中嵌入隐藏文本等方式,绕过模型指令实施恶意操控。Anthropic 在 Opus 5 系统卡中披露,当该模型与 Auto Mode 结合使用时,浏览器智能体场景下的攻击成功率在 129 个测试案例中降至零。在安全公司 Gray Swan 的通用提示注入基准测试中,经过 15 次攻击尝试后,Opus 5 的被攻破率从上一代 Opus 4.8 的 5.5% 降至 2.0%,位居同类模型首位。值得注意的是,零成功率的实现依赖 Auto Mode 提供的两道独立防线:一道在模型处理前扫描隐藏指令,另一道在执行前拦截危险操作。若仅凭模型本身,Opus 5 的被攻破率为 3.7%,甚至不及 Sonnet 5 的 0.93%。这一结果表明,模型能力与系统级防护的协同,才是当前应对提示注入的有效路径。
提示注入是当前 AI 智能体面临的核心安全威胁之一。攻击者通过在网页、文档或其他输入源中植入隐藏指令,诱使 AI 模型忽略原有任务设定,转而执行恶意操作。这一攻击方式对于在浏览器中自主操作的智能体尤为危险,因为它们需要实时处理大量来源不可控的外部内容。OpenAI 曾在 2024 年 12 月公开承认,提示注入问题可能永远无法被彻底解决,这一表态凸显了该问题的顽固性。
Anthropic 在 Opus 5 系统卡中公布的数据显示,当模型与 Auto Mode 配合使用时,浏览器智能体场景下的提示注入攻击成功率在 129 个测试场景中达到零。这一结果在 AI 安全领域具有重要意义。Auto Mode 目前已集成于 Claude Cowork 等产品中,为智能体的实际部署提供了系统级保护。
Auto Mode 的防护机制由两道独立防线构成。第一道在模型处理输入数据之前,主动扫描并识别其中可能存在的隐藏指令;第二道则在模型决策生成之后、实际执行之前,拦截被判定为危险的操作。攻击者必须同时突破这两道防线才能得手,这大幅提升了攻击难度,也是最终实现零成功率的关键所在。
在安全公司 Gray Swan 的独立基准测试中,Opus 5 同样表现突出。经过 15 次攻击尝试后,其被攻破率从上一代 Opus 4.8 的 5.5% 降至 2.0%,在参测模型中排名第一,领先于 Mythos 5 的 2.6% 和 Fable 5 的 2.8%。这一外部评测结果为 Anthropic 的内部数据提供了一定程度的独立佐证。
然而,零成功率的成绩并非来自模型本身的单独能力。若仅使用 Opus 5 而不启用 Auto Mode,其被攻破率为 3.7%,甚至低于同系列的 Sonnet 5(0.93%)。这意味着,在没有系统级防护的情况下,Opus 5 并非最优选择。这一对比清晰地说明,单纯依赖模型能力无法解决提示注入问题,系统架构层面的防护设计同样不可或缺。
目前这些数据均来自受控测试环境,能否在真实世界的复杂场景中保持同等表现,仍有待观察。但如果这一防护效果在实际部署中得以延续,Anthropic 或许已在业界率先找到了一条切实可行的提示注入防御路径,为 AI 智能体的安全落地提供了新的参考范式。
要点
- Opus 5 与 Auto Mode 结合后,在 129 个浏览器智能体测试场景中将提示注入攻击成功率降至零,但单独使用模型时成功率为 3.7%。
- Auto Mode 的双重防护机制是关键:一道在处理前扫描隐藏指令,另一道在执行前拦截危险操作,攻击者须同时突破两道防线。
- 在 Gray Swan 独立基准测试中,Opus 5 以 2.0% 的被攻破率位居同类模型首位,优于 Mythos 5 和 Fable 5。
- 零成功率依赖模型与系统防护的协同,单纯提升模型能力不足以解决提示注入问题,系统架构设计同样至关重要。
- 测试结果来自受控环境,实际部署中的防护效果仍需进一步验证。
原始标题:Opus 5 may have solved browser-based prompt injection, the biggest security flaw haunting AI agents
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。