AI资讯 / Agent

Agent / 分析

Claude Fable 5.1 与 Mythos 5.1 发布:刷新编程与知识工作基准,缓存价格大降75%

Latent Space

Anthropic 于2026年9月1日正式发布 Claude Fable 5.1 与 Claude Mythos 5.1,将其定位为「全球最先进的编程与知识工作模型」。发布推文在24小时内获得超过1280万次浏览。在 Artificial Analysis 智能指数中,Fable 5.1 以66分(最高努力模式)领先 Claude Opus 5(63分)、Claude Fable 5(62分)及 GPT-5.6 Sol(61分)。HLE 基准得分从前代的55.5%跃升至59.1%,Terminal-Bench v2.1 达到91.4%。定价方面,输入与输出 token 价格维持不变,但缓存读取价格从每百万 token 1美元降至0.25美元,降幅达75%,对长上下文和智能体工作流用户利好明显。然而,Fable 5.1 的输出 token 用量约为前代的1.7倍,导致每任务综合成本较 Fable 5 上涨约20%,性价比方面仍面临来自 GPT-5.6 Sol 的竞争压力。

Anthropic 此次发布的时机颇具战略意味。在 OpenAI Astra 全面上线预期升温、Grok 4.7 与 Gemini Flash 3.8 相继在路上的背景下,Anthropic 选择率先出手,以 Fable 5.1 和 Mythos 5.1 抢占叙事窗口。官方将 Fable 5.1 定位于「复杂、多步骤、可自主运行的长周期任务」,强调其在编程、知识工作及持续问题求解场景中的能力;Mythos 5.1 则作为配套的知识工作旗舰同步推出。

基准测试数据是本次发布最具说服力的部分。Artificial Analysis 数据显示,Fable 5.1 在智能指数中以66分位居榜首,在 GDPval-AA v2 评测中 Elo 分达到1853,较 Fable 5 提升130分;AA-Briefcase Elo 为1694,提升122分。Terminal-Bench-Science 0.1 的得分从 Fable 5 的24.7%跃升至52.6%,实现翻倍以上的提升,τ³-Banking 评测也较前代高出9个百分点。

定价结构的调整是本次发布的另一核心看点。缓存读取价格从每百万 token 1美元降至0.25美元,降幅75%,对于频繁复用长提示词的智能体工作流而言,每任务可节省约1.40美元。然而,Artificial Analysis 同时指出,Fable 5.1 的输出 token 用量约为 Fable 5 的1.7倍,综合计算后每任务成本约为3.76美元,较前代上涨约20%。相比之下,GPT-5.6 Sol 在同等智能指数得分下每任务成本仅约0.95美元,性价比优势依然显著。

社区讨论中出现了一个值得关注的技术细节:部分研究者认为 Fable 5.1 与 Mythos 5.1 可能共享同一套底层权重,差异主要体现在安全策略与请求路由行为上,而非独立的基础模型。此外,Artificial Analysis 的评测中约有4%的输出 token 因触发安全过滤而被路由至 Claude Opus 4.8 或 Opus 5 作为兜底,这一细节影响了部分基准数据的解读方式。

企业级功能是 Anthropic 此次着力强调的差异化方向。新推出的 Enterprise Frontier Safeguards(EFS)被定位为面向智能体可观测性的企业级安全框架,类似于「ZDR++」。零数据留存支持也被多位用户视为企业采购的重要解锁条件。产品负责人 Dan Shipper 指出,Fable 5 此前的痛点在于「在数据中心里造了一个几乎无法使用的超级天才」,而 5.1 在响应速度、输出简洁度和交互语气上均有明显改善,使其更接近可实际部署的自主工作者。

与此同时,World Labs 发布的 Astra 世界模型在同一时间窗口内也引发了广泛关注,被评价为迄今最令人印象深刻的世界模型发布。若非与 Claude 新模型撞期,Astra 本可独占头条。两场发布的同日竞争,折射出当前 AI 前沿模型迭代节奏之密集,以及各家厂商在叙事窗口上的高度博弈意识。

要点

  • Fable 5.1 在 Artificial Analysis 智能指数中以66分刷新榜首,HLE 得分从55.5%升至59.1%,Terminal-Bench-Science 得分翻倍至52.6%
  • 缓存读取价格降低75%至每百万 token 0.25美元,但因输出 token 用量增加约1.7倍,每任务综合成本仍上涨约20%
  • 社区研究者推测 Fable 5.1 与 Mythos 5.1 可能共享底层权重,差异主要在安全路由策略层面
  • 新增 Enterprise Frontier Safeguards 与零数据留存支持,面向企业智能体部署场景的可用性显著提升
  • GPT-5.6 Sol 在性价比维度仍具竞争力,每任务成本约为 Fable 5.1 的四分之一
查看原始来源

原始标题:[AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。