AI资讯 / 产业

产业 / 媒体

Anthropic 将 Claude Code 自动模式设为默认,AI 审查危险命令的准确率达89%

The Decoder

Anthropic 宣布,自2026年8月14日起,旗下 AI 编程工具 Claude Code 将对 Pro、Max 和 Team 计划用户默认开启自动模式(Auto Mode)。该模式允许 AI 在无需每步人工确认的情况下自主完成开发任务,内置分类器会判断操作是否具有危险性或不可逆性,仅在必要时请求确认。在一项涵盖1053名付费测试者的对照研究中,人工审核员仅识别出13.6%的危险命令,而自动模式的识别率高达89%。使用自动模式的团队拉取请求数量也提升了约25%。此外,独立安全机构 Trajectory Labs 对72种提示注入攻击场景各测试10次,共720次攻击均未能突破 Claude 当前模型的自动模式防线。Enterprise 客户仍需手动选择开启该功能。

Anthropic 于2026年8月8日宣布,Claude Code 将从8月14日起对 Pro、Max 和 Team 计划用户默认启用自动模式。自动模式的核心机制是内置一个分类器,实时判断每项操作是否属于危险或不可逆行为,只有在触发风险阈值时才会暂停并请求用户确认,其余步骤由 AI 自主完成,无需开发者逐一批准。Enterprise 客户目前仍需主动选择开启。

在安全性验证方面,Anthropic 进行了一项涵盖1053名付费测试者的对照实验,并结合内部红队测试。结果显示,人工审核员仅能识别13.6%的危险命令,而自动模式的分类器识别率达到89%。这一数据表明,在高频、高速的编程场景下,人工审核的局限性已相当明显,AI 分类器在一致性和覆盖率上均具备显著优势。

在抵御提示注入攻击方面,独立安全审计机构 Trajectory Labs 对72种攻击场景各执行10次测试,共计720次攻击全部未能突破 Claude 当前模型(Fable 5、Opus 5、Sonnet 5)在自动模式下的防护。相比之下,OpenAI 的 GPT-5.6 Sol 在 Codex Auto-Review 模式下有5.83%的攻击成功穿透,两者差距较为明显。

Anthropic 还披露了自动模式在内部实际使用中的两个案例:一次是阻止 Claude 将机密数据上传至公开页面;另一次是在一次长时间会话中,自动终止了约2000个可能干扰 GPU 训练任务的进程。这些案例说明,自动模式不仅能在测试环境中表现良好,在真实生产场景中同样具备实际防护价值。

从商业逻辑来看,Anthropic 表示分类器本身消耗的 token 不计费,但自动模式让 Claude 能够完成更多工作,整体 token 用量随之上升,间接带动收入增长。数据显示,使用自动模式的团队拉取请求数量提升约25%,效率提升显著。Claude Code 目前是市场上使用最广泛的 AI 编程工具,此次默认开启自动模式将进一步加速这一趋势。

尽管如此,Anthropic 本身也提示了潜在风险。公司在公告中写道:「对于生产基础设施的高风险变更,我们仍建议自行审查 Claude 的操作。」这一建议揭示了一个内在矛盾——开发者介入越少,其监督责任越重,但长期依赖自动模式构建的项目,也会让开发者越来越难以建立对代码库的深度理解,人机协作的边界正在被持续重新定义。

要点

  • 自8月14日起,Claude Code 自动模式将对 Pro、Max 和 Team 用户默认开启,Enterprise 用户仍需手动选择
  • 对照测试显示,自动模式识别危险命令的准确率为89%,远高于人工审核的13.6%
  • 独立安全测试中,720次提示注入攻击均未能突破 Claude 自动模式的防护
  • 使用自动模式的团队拉取请求数量提升约25%,整体开发效率显著提高
  • Anthropic 仍建议在生产基础设施的高风险操作中保留人工审查,自动模式并非零风险
查看原始来源

原始标题:Anthropic sets Claude Code to Auto Mode by default to protect developers from bad approvals

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。