AI资讯 / 产业

产业 / 媒体

Anthropic 发布 Claude Fable 5.1:编程与科研能力大幅跃升,成本最高降低45%

The Decoder

Anthropic 正式推出 Claude Fable 5.1 与 Mythos 5.1 两款新模型,主打更强的智能体编程能力、更自然的文本输出风格,以及更低的使用成本。Fable 5.1 在 Terminal-Bench-Science 0.1 基准上得分 52.6%,是前代 Fable 5 的两倍有余,也远超 OpenAI 的 GPT-5.6 Sol。在智能体编程测试 Terminal-Bench 4.0 上,Fable 5.1 同样以 55.8% 的成绩领先竞品。Anthropic 宣称,通过将缓存读取价格从每百万 token 1 美元降至 0.25 美元,典型任务成本可降低约 25%,复杂智能体工作流最高可节省 45%。然而,协助 Anthropic 进行预发布测试的 Artificial Analysis 对此提出异议,指出在最高算力设置下,Fable 5.1 每任务实际成本比 Fable 5 高出约 20%。此外,两款 5.1 模型均首次内置文本水印功能,Anthropic 同步推出检测 API 供监管机构和媒体核验。

Anthropic 于 2026 年 9 月 1 日正式发布 Claude Fable 5.1 与 Mythos 5.1,将其定位为迄今最强大的 Claude 系列模型。两款模型共享同一基础模型,区别在于安全护栏的严格程度不同。Fable 5.1 面向所有用户开放,可通过 AWS、Google Cloud 和 Microsoft Azure 访问;Mythos 5.1 则仅限美国境内的网络安全和生命科学机构通过专项验证计划申请使用。值得关注的是,这也是 Claude 系列首批内置文本水印的模型,Anthropic 同步推出检测 API,供监管机构、媒体和事实核查机构验证文本来源。

在基准测试表现上,Fable 5.1 的提升幅度相当显著。在衡量智能体科学研究能力的 Terminal-Bench-Science 0.1 测试中,该模型得分 52.6%,不仅是前代 Fable 5(24.7%)的两倍以上,也大幅领先 GPT-5.6 Sol 的 22.4%。在智能体编程测试 Terminal-Bench 4.0 上,Fable 5.1 得分 55.8%,Mythos 5.1 更达到 60.9%,而 Fable 5 和 GPT-5.6 Sol 分别仅为 42.0% 和 37.3%。在 Artificial Analysis 智能指数综合排名中,Fable 5.1 以 66 分位居榜首,领先 Claude Opus 5(63 分)和 GPT-5.6 Sol(61 分)。

定价策略是此次发布的核心看点之一。Anthropic 将缓存读取价格从每百万 token 1 美元大幅削减至 0.25 美元,其余 API 价格维持不变,输入和输出分别为每百万 token 10 美元和 50 美元。对于涉及大量工具调用的长时智能体任务,官方宣称最高可节省 45% 的成本。然而,Artificial Analysis 的独立分析显示,在最高算力(max effort)设置下,Fable 5.1 每任务成本约为 3.76 美元,比 Fable 5 高出约 20%,原因在于该模型生成的输出 token 数量约为前代的 1.7 倍。相比之下,Opus 5 每任务仅需 2.34 美元,综合得分仅低 3 分。

在安全过滤机制方面,Fable 5.1 对网络安全和生物医学领域的限制有所放宽。此前 5.0 系列模型的过滤器过于敏感,频繁对正当请求触发误报,令企业用户深感困扰。新版本中,网络安全相关误报减少了 60%,基础生物学和医学问题的误报率更下降了 85%。Fable 5.1 现已支持软件漏洞识别,但漏洞利用代码的生成仍被限制,渗透测试等高风险操作依然需要通过 Opus 系列模型处理。Mythos 5.1 则被纳入 Claude Security 体系,专注于防御性安全用途。

在文本质量方面,Anthropic 研究员 Felix Rieseberg 指出,Fable 5.1 改善了此前模型过度依赖项目符号和粗体文字的问题,输出风格更加自然流畅,对用户自定义格式指令的遵循度也有所提升。与此同时,Anthropic 还针对「蒸馏攻击」加强了防护——此类攻击通过大量虚假账号系统性地提取模型能力。新规则下,API 新账号无法在多轮对话中编辑 Claude 的历史上下文同时保留思维链记录,从而封堵了一种已记录在案的模型蒸馏手段。

从市场背景来看,Fable 5.1 的发布有其紧迫性。Fable 5 上市以来因价格偏高而在企业客户中遭遇冷淡,而 Opus 5 于 7 月底推出后,以更低价格在多数基准上追平甚至超越 Fable 5,进一步压缩了后者的市场空间。此次降价和性能升级能否真正扭转局面,仍有待未来数周的实际部署数据来验证。对于企业客户,Anthropic 还同步推出了 Enterprise Frontier Safeguards(EFS)功能,将客户数据完全存储于客户自有云基础设施之上,以满足更严格的数据合规需求。

要点

  • Fable 5.1 在智能体科学研究基准 Terminal-Bench-Science 0.1 上得分 52.6%,是前代的两倍以上,并领先 GPT-5.6 Sol 超过 30 个百分点
  • Anthropic 将缓存读取价格削减 75%,官方宣称典型任务成本降低 25%、复杂智能体工作流最高降低 45%,但独立测试显示最高算力设置下实际成本反而高出约 20%
  • Fable 5.1 与 Mythos 5.1 是首批内置文本水印的 Claude 模型,Anthropic 同步推出检测 API 供监管和媒体机构核验内容来源
  • 网络安全和生物医学领域的安全过滤误报率分别下降 60% 和 85%,Fable 5.1 首次支持软件漏洞识别功能
  • Anthropic 封堵了一种已知的模型蒸馏攻击手段,新 API 账号无法在保留思维链的同时编辑多轮对话历史
查看原始来源

原始标题:Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。