AI资讯 / 模型

模型 / 官方

编程能力与视觉理解显著提升

Anthropic News

Anthropic 宣布推出新一代旗舰模型 Claude Opus 4.7,该模型在高级软件工程领域较 Opus 4.6 取得显著进步,尤其擅长处理此前需要密切监督的复杂编码任务。Opus 4.7 能够严谨一致地执行长期运行任务,精准遵循指令,并在汇报前自行验证输出结果。其视觉能力大幅增强,可解析更高分辨率的图像,在界面设计、幻灯片和文档制作等专业任务中展现出更佳的品味与创造力。在多项基准测试中,Opus 4.7 表现优于前代,例如在 93 项编码基准上解决率提升 13%,并首次通过隐式需求测试。该模型还配备了针对高风险网络安全用途的自动检测与拦截机制,Anthropic 同时推出网络安全验证计划,供合法安全研究人员使用。

Anthropic 今日正式发布 Claude Opus 4.7,这是其旗舰系列的最新版本。据官方介绍,Opus 4.7 在高级软件工程领域实现了显著改进,尤其擅长处理最困难的编码任务。早期测试用户反馈,他们现在能够将此前需要密切监督的复杂编码工作放心地交给 Opus 4.7 处理。该模型在处理复杂、长期运行的任务时表现出严谨性和一致性,能够精确关注指令,并在汇报前自行设计验证输出的方法。

在视觉能力方面,Opus 4.7 获得了实质性提升,可以查看更高分辨率的图像。这使得它在完成专业任务时更加有品味和创造力,能够生成更高质量的界面、幻灯片和文档。尽管在广泛能力上不及 Anthropic 最强大的模型 Claude Mythos Preview,但 Opus 4.7 在多项基准测试中均优于 Opus 4.6。在 93 项编码基准测试中,Opus 4.7 的解决率比 Opus 4.6 提升了 13%,其中包括四个 Opus 4.6 和 Sonnet 4.6 都无法解决的任务。

值得注意的是,Opus 4.7 是 Anthropic 在 Project Glasswing 框架下推出的首款模型,旨在平衡 AI 模型在网络安全领域的风险与收益。Anthropic 表示,Opus 4.7 的网络安全能力不如 Mythos Preview 先进,并且在训练过程中尝试了差异化的能力削减实验。该模型配备了自动检测和拦截高风险网络安全请求的安全机制,Anthropic 将从实际部署中学习经验,为未来广泛发布 Mythos 级别模型奠定基础。

早期测试者给予了 Opus 4.7 高度评价。金融科技平台认为其速度与精度的结合可能改变游戏规则;编码平台 Hex 称其为评估过的最强模型,能够正确报告数据缺失而非提供看似合理但错误的回退;Devin 团队表示 Opus 4.7 将长期自主性提升到了新水平,能够连续工作数小时并攻克难题;Replit 观察到该模型能以更低成本实现相同质量;Harvey 在 BigLaw Bench 上测试显示其高努力模式下准确率达 90.9%。

Opus 4.7 即日起在所有 Claude 产品、API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 上可用。定价与 Opus 4.6 保持一致:每百万输入令牌 5 美元,每百万输出令牌 25 美元。开发者可通过 Claude API 使用 claude-opus-4-7 模型。Anthropic 同时邀请从事漏洞研究、渗透测试和红队演练等合法网络安全工作的专业人士加入新的网络安全验证计划。

要点

  • Claude Opus 4.7 在高级软件工程领域实现显著突破,尤其擅长处理复杂、长期运行的编码任务,解决率较 Opus 4.6 提升 13%。
  • 模型视觉能力大幅增强,支持更高分辨率图像解析,在界面设计、文档制作等专业任务中表现更佳。
  • Opus 4.7 是 Anthropic 网络安全框架 Project Glasswing 下的首款模型,配备自动检测和拦截高风险网络安全请求的机制。
  • 早期测试者反馈积极,包括金融科技、编码平台、法律科技等多个领域的合作伙伴均报告了显著改进。
  • 定价与 Opus 4.6 保持一致,已全面上线所有 Claude 产品和主要云平台。
查看原始来源

原始标题:Introducing Claude Opus 4.7

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。