产业 / 媒体
性能逼近Fable 5,价格仅为一半
Anthropic推出旗舰新模型Claude Opus 5,定位为Claude Fable 5的低价替代方案。Opus 5的输入token价格为每百万5美元、输出为每百万25美元,与前代Opus 4.8持平,仅为Fable 5的一半。在Anthropic自行发布的基准测试中,Opus 5在代理终端编码(Frontier-Bench v0.1)上以43.3%的得分超越Fable 5的33.7%和GPT-5.6 Sol的34.4%;在知识工作基准GDPval-AA v2中,Opus 5以Elo分1861领先同类模型。最引人注目的是ARC-AGI-3测试——该基准衡量无需依赖记忆模式的新颖问题解决能力——Opus 5得分30.2%,而GPT-5.6 Sol仅为7.8%,差距接近四倍。Opus 5同时新增Fast Mode,速度提升2.5倍但价格翻倍,并成为Claude Max的默认模型及Claude Pro上最强可用模型。
Anthropic于2026年7月24日正式发布Claude Opus 5,将其定位为在性能上逼近旗舰级Fable 5、但价格仅为后者一半的新选择。Opus 5的输入token定价为每百万5美元,输出为每百万25美元,与前代Opus 4.8保持一致,而Fable 5的对应价格分别为每百万10美元和50美元。此次发布被视为Anthropic对GPT-5.6 Sol及中国竞争对手价格压力的直接回应。
在Anthropic自行发布的多项基准测试中,Opus 5表现突出。在代理终端编码测试Frontier-Bench v0.1上,Opus 5得分43.3%,大幅领先Fable 5(33.7%)、GPT-5.6 Sol(34.4%)以及前代Opus 4.8(21.1%)。在知识工作基准GDPval-AA v2中,Opus 5以Elo分1861位居榜首,高于Fable 5的1747分和GPT-5.6 Sol的1736分。不过,在DeepSWE v1.1代理编码测试中,GPT-5.6 Sol以72.7%的得分领先,Opus 5以68.8%位列第三。
ARC-AGI-3是本次发布中最具争议性的亮点。该基准专门测试模型在无法依赖记忆模式情况下解决全新问题的能力,Opus 5得分30.2%,而前代Opus 4.8仅为1.5%,GPT-5.6 Sol为7.8%,差距接近四倍。值得注意的是,目前尚无Fable 5在该基准上的成绩,且如此悬殊的测试领先优势能否在实际使用中得到复现,仍有待观察。
Anthropic着重强调Opus 5具备自我检查与迭代改进能力,并能在需要时通过编写代码自行构建工具。在一项Frontier-Bench任务中,Opus 5在无法直接查看图纸的情况下,自主编写了计算机视觉流水线,从原始像素中提取几何信息,最终在FreeCAD中重建出完整的机械零件三维模型——其他所有模型在五次尝试后均未能完成该任务。此外,Opus 5还成功修复了一个开源包管理器中的真实漏洞,并找到了社区补丁遗漏的边界情况。
在安全机制方面,Opus 5的网络安全分类器触发频率比Fable 5低约85%,此前Fable 5因过于频繁的干预而饱受批评。Opus 5允许源代码漏洞研究,但屏蔽二进制漏洞扫描、渗透测试和漏洞利用生成。在科学研究领域,Opus 5在所有生命科学评估中均优于Opus 4.8,其中有机化学(从光谱数据推导分子结构)提升10.2个百分点,蛋白质相关任务提升7.7个百分点。
用户可通过低、中、高、超高和最大五档努力程度设置来平衡性能与token消耗。Anthropic建议在一般任务中广泛使用低档和中档设置,在编码和代理任务中从超高档起步。值得注意的是,在Frontier-Bench v0.1和人工分析编码代理指数两项基准上,最大档设置的得分反而低于超高档,尽管前者价格更高,这一现象提示用户在实际使用中需审慎选择努力程度。
要点
- Claude Opus 5定价为Fable 5的一半,但在代理编码和知识工作多项基准上超越后者,性价比优势显著。
- ARC-AGI-3测试中Opus 5得分30.2%,是排名第二的GPT-5.6 Sol(7.8%)的近四倍,在新颖问题解决能力上展现出明显代际跃升。
- Opus 5能够在任务执行中自主编写工具代码,并通过迭代检查改进自身输出,代理能力大幅增强。
- 网络安全分类器触发频率较Fable 5降低约85%,在安全性与可用性之间取得更好平衡。
- 最大努力档设置在部分基准上得分反而低于超高档,用户需结合实际任务类型选择合适的努力程度以控制成本。
原始标题:Anthropic claims its new Claude Opus 5 delivers near-Fable 5 performance at half the token price
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。