模型 / 官方
性能逼近旗舰级,价格减半
Anthropic 正式推出 Claude Opus 5,这是一款在性能与成本之间取得显著平衡的新一代模型。在编程与知识工作评测中,Opus 5 在 Frontier-Bench 和 GDPval-AA 等基准上达到新的最优水平,同时以约一半的价格逼近旗舰模型 Claude Fable 5 的智能水平。在 ARC-AGI 3 新颖问题求解评测中,Opus 5 的得分是次优模型的三倍;在 OSWorld 2.0 计算机操作基准上,仅需 Fable 5 约三分之一的成本即可超越其最佳成绩。科学研究方面,Opus 5 在有机化学和蛋白质相关任务上分别比前代 Opus 4.8 高出 10.2 和 7.7 个百分点。该模型现已成为 Claude Max 的默认模型,并是 Claude Pro 上可用的最强模型,面向开发者和企业用户全面开放。
Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。这款模型被定位为日常高强度使用场景下的主力选择,在保持与前代 Opus 4.8 相同成本的前提下,大幅提升了整体性能。Opus 5 现已成为 Claude Max 订阅的默认模型,同时也是 Claude Pro 上可调用的最强模型,标志着 Anthropic 在性价比路线上迈出了重要一步。
在编程能力方面,Opus 5 的表现尤为突出。在 Frontier-Bench v0.1 评测中,Opus 5 超越所有竞争模型,并以更低的单任务成本将 Opus 4.8 的得分提升逾一倍。在 CursorBench 3.2 最高努力设置下,其得分与 Fable 5 峰值仅相差 0.5%,但每项任务的成本仅为后者的一半。多家合作伙伴包括 Devin 和 Cursor 均反馈,Opus 5 在复杂调试和根因分析任务上表现出色,稳定性也显著优于前代。
在知识工作与自动化任务上,Opus 5 同样展现出领先优势。Zapier AutomationBench 测试显示,Opus 5 的任务通过率约为次优模型的 1.5 倍,即便在最低努力设置下也能超越其他所有模型。在一项真实场景测试中,Opus 5 接手了一份原始账户健康数据表,独立完成了从识别高风险账户、通知负责人到生成留存摘要的完整流程,通过率达到 100%,而此前模型均未能完成该任务。
科学研究是 Opus 5 的另一大亮点领域。在覆盖结构生物学、有机化学和生物信息学的生命科学评测中,Opus 5 全面超越 Opus 4.8。其中,在从光谱数据推断分子结构的有机化学任务上,得分高出 10.2 个百分点;在预测蛋白质序列变异对功能影响的任务上,得分高出 7.7 个百分点。基因组学领域的早期用户反馈称,Opus 5 的行为模式更接近一位严谨的科学家,能够主动选择合适的统计方法并交叉验证结果。
在自主代理能力方面,Opus 5 展现出更强的任务验证与迭代能力。在一项 Frontier-Bench 测试中,模型在无法直接查看图纸的情况下,自行编写计算机视觉流水线从原始像素中提取几何信息,并成功重建了完整的三维机械零件模型,而同等条件下的竞争模型在五次尝试后均未能完成。此外,Opus 5 还能够识别开源软件中社区补丁遗漏的边缘案例,并给出更深层的根因修复,而非仅处理表面症状。
在视觉输出能力上,Opus 5 也有显著提升,能够生成风洞气流模拟和细胞交互图示等复杂可视化内容。企业用户方面,Box 的测试数据显示,Opus 5 整体性能比 Opus 4.8 提升 8%,在数据分析工作流上提升 11%,在尽职调查场景中提升 17%。Lovable 平台则指出,Opus 5 是 Opus 系列自 4.5 以来最大的一次跃升,在前端动画、游戏和三维渲染方面的表现尤为突出。
要点
- Claude Opus 5 在 Frontier-Bench、ARC-AGI 3、OSWorld 2.0 等多项主流基准上刷新最优纪录,同时将单任务成本控制在 Fable 5 的约一半。
- 在有机化学和蛋白质功能预测等生命科学任务上,Opus 5 分别比前代 Opus 4.8 高出 10.2 和 7.7 个百分点,科研适用性大幅增强。
- 自主代理能力显著提升,能够在缺乏直接工具支持的情况下自行构建解决方案,并识别社区补丁遗漏的深层缺陷。
- Opus 5 现为 Claude Max 默认模型及 Claude Pro 最强模型,企业用户在数据分析和尽职调查场景中可获得 11%—17% 的性能提升。
- 模型稳定性大幅改善,多个合作平台反馈其逐次运行的方差显著降低,对需要可靠批量输出的生产环境尤为重要。