AI资讯 / 产业

产业 / 媒体

Claude Opus 5 多项基准超越 Fable 5,成本最高低一半

The Decoder

根据 Artificial Analysis 最新评测,Anthropic 的 Claude Opus 5 以 61 分位居智能指数榜首,超过 Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)和 Kimi K3(57 分)。该模型在分析质量与知识类任务上表现尤为突出,在编程代理指数中与 GPT-5.6 Sol 并列第一。Epoch AI 的独立测试同样显示 Opus 5 综合能力指数为 159 分,略低于 Fable 5 的 161 分,但在软件工程基准上两者持平。成本方面,Opus 5 平均每任务花费 2.03 美元,低于 Fable 5 的 2.75 美元;在知识工作基准 AA-Briefcase 的「高」推理档位下,单任务成本仅 10.41 美元,不足 Fable 5 的一半。不过,Opus 5 在不确定时仍倾向于给出回答,导致幻觉率较上一代上升 14 个百分点至 50%,在高风险应用场景中的可靠性仍存疑虑。

Anthropic 的 Claude Opus 5 在 Artificial Analysis 智能指数中以 61 分夺得榜首,综合了知识工作、编程、科学推理与事实准确性共九项测试。紧随其后的是 Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)、Kimi K3(57 分)和 Claude Opus 4.8(56 分)。值得注意的是,Artificial Analysis 在模型公开发布前便与 Anthropic 合作完成了测试,确保了评估的独立性与时效性。

在编程能力上,Opus 5 搭配 Claude Code 在「超高」推理档位下与 GPT-5.6 Sol 并列编程代理指数第一,两者均获 67 分。Terminal-Bench v2.1 测试中,Opus 5 在「最高」档位下得分 89%,与此前领先的 GPT-5.6 Sol 持平。科学推理方面,Opus 5 在极难的跨学科知识测试 Humanity's Last Exam 中得分 53%,与 Fable 5 并列,但在物理基准 CritPt 上略逊于多款 GPT 系列模型。

知识工作是 Opus 5 最显著的优势领域。在模拟办公场景的 AA-Briefcase 基准中,Opus 5 在「最高」推理档位下 Elo 评分达 1720,领先 Claude Fable 5 整整 146 分。分析质量 Elo 更高达 2016,几乎比 Fable 5 高出 300 分。Anthropic 旗下的 Opus 5、Fable 5、Sonnet 5 和 Opus 4.8 合计占据了该榜单前十名中的绝大多数席位,显示出该公司在知识工作场景的整体优势。

成本表现同样亮眼。AA-Briefcase 基准下,Opus 5「最高」档位每任务成本为 17.79 美元,低于 Fable 5 的 22.30 美元;「高」档位仅需 10.41 美元,不足 Fable 5 的一半,且 Elo 排名仍优于后者。API 定价方面,输入 token 为每百万 5 美元,输出为每百万 25 美元,缓存命中仅需每百万 0.50 美元。Vals.ai 的编程基准测试显示,「高」推理档位在性价比上最为均衡,得分 89.8%,而更高档位因单次尝试耗时过长反而拉低了整体表现。

尽管综合表现领先,Opus 5 仍存在明显短板。在事实准确性测试 AA-Omniscience 中,Opus 5 虽比上一代提升 7 分,但仍落后于 Fable 5。更值得关注的是,该模型在不确定时倾向于给出答案而非拒绝回答,导致幻觉率较 Opus 4.8 上升 14 个百分点至 50%,在医疗、法律等高风险场景中的可靠性存在隐患。此外,「最高」档位下每任务需耗时逾 36 分钟,约为 Opus 4.8 的 1.5 倍,延迟成本不可忽视。

Epoch AI 的独立评测进一步印证了顶级模型之间竞争的白热化。Opus 5 综合能力指数为 159,略低于 Fable 5 的 161,GPT-5.6 Sol 则在多个子类别中保持领先。没有任何单一模型能够拉开决定性差距,这一格局支持了 AI 模型能力趋于商品化的判断。对于企业用户而言,在性能差距收窄的背景下,成本效率与特定场景适配性将成为选型的核心考量。

要点

  • Claude Opus 5 在 Artificial Analysis 智能指数中以 61 分领跑,在分析质量和知识工作任务上优势最为突出,AA-Briefcase 分析质量 Elo 高达 2016,领先 Fable 5 近 300 分。
  • 成本方面,Opus 5「高」推理档位每任务仅需 10.41 美元,不足 Fable 5(22.30 美元)的一半,且性能仍优于后者,性价比显著。
  • 幻觉率是主要隐患:Opus 5 在不确定时倾向于作答,幻觉率较上一代上升 14 个百分点至 50%,高风险场景需谨慎评估。
  • 「高」推理档位在编程任务中性价比最优,得分 89.8%;更高档位因单次耗时过长导致尝试次数减少,整体表现反而下滑。
  • 顶级模型间差距持续收窄,Epoch AI 数据显示 Opus 5 与 Fable 5 仅相差 2 分,AI 能力商品化趋势进一步强化。
查看原始来源

原始标题:Anthropic's Claude Opus 5 costs well below Fable 5 while matching or beating it across most benchmarks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。