AI资讯 / 产业

产业 / 媒体

Meta发布Muse Spark 1.3,以低价策略逼近AI模型第一梯队

The Decoder

Meta在五个月内发布了第四款Muse Spark系列模型——Muse Spark 1.3,通过Muse Code和Meta Model API正式上线。该系列自今年4月启动,7月推出1.1版,8月推出1.2版,迭代节奏相当密集。新版本在智能体任务基准测试上进步最为显著,在Artificial Analysis的智能指数中,max版本得分从8月的57分跃升至62分,xhigh版本达到61分。在τ³-Banking银行场景智能体测试中,max版本以52%的成绩暂列第一。然而在大多数基准测试中,该模型仍落后于Claude Fable 5.1等顶尖竞争对手。Meta最具竞争力的武器是价格:按每百万输入输出token分别收费1.25美元和4.25美元计算,每项任务成本仅为0.55美元,是同等性能区间内最便宜的选择,同级竞品定价普遍在0.94至1.23美元之间。Meta还宣布将推出开放权重版本。

Meta于2026年9月3日正式发布Muse Spark 1.3,这是该系列五个月内的第四次更新。目前xhigh层级已全面开放,而算力需求更高的max层级仍处于有限合作伙伴预览阶段,需完成进一步安全测试后才会正式上线。该模型通过Muse Code平台和Meta Model API提供服务,延续了此前每月迭代的高频发布节奏。

在性能表现上,Muse Spark 1.3的最大亮点集中于智能体任务。根据Artificial Analysis的智能指数,max版本得分从7月的53分、8月的57分一路攀升至62分。这一跃升主要得益于模型在指数权重最高的三项测试中的集中发力:GDPval-AA v2(占比20%)、Terminal-Bench 2.1(占比16%)以及τ³-Bench Banking(占比14%)。在τ³-Banking银行场景智能体测试中,max版本以52%的成绩暂列榜首,是该模型目前唯一取得领先地位的单项测试。

然而在其他维度,Muse Spark 1.3的表现仍属中游。在Terminal-Bench 2.1终端编程测试中,xhigh版本从80%提升至85%,max版本达到86%,但Claude Fable 5.1的max版本仍以91.4%高居榜首。在GDPval-AA v2专业任务评估中,Meta从1615分提升至max版本的1754分,而Claude Fable 5.1(max)则达到1853分。此外,GPQA Diamond科学问答测试中,模型从90%升至94%,但仍低于Gemini 3.8 Flash的95.3%。值得注意的是,AA-LCR和AA-Omniscience两项指标相比1.2版本出现小幅下滑。

价格是Muse Spark 1.3最具说服力的竞争优势。按每百万token输入1.25美元、输出4.25美元的定价计算,完成一项标准指数任务的成本仅为0.55美元。在智能指数59分及以上的模型中,没有任何竞品能达到这一价位,同级别竞争对手的任务成本普遍在0.94至1.23美元之间。相比之下,Muse Spark 1.3的价格比上一代1.2版本(0.40美元/任务)有所上涨,但在同性能区间内依然保持明显优势。

在技术架构层面,max版本通过消耗比xhigh版本多62%的推理token来换取性能提升,这也解释了为何两个层级之间存在明显的性能差距。目前max版本的具体定价尚未公布。Meta同时宣布,更大规模的模型版本以及开放权重版本均在研发计划之中,这一举措延续了Meta在AI领域坚持开源路线的一贯策略,有望进一步扩大该系列模型的生态影响力。

要点

  • Muse Spark 1.3是Meta五个月内发布的第四款系列模型,在智能体任务基准上进步最为显著,max版本智能指数得分从57分升至62分。
  • 在τ³-Banking银行场景智能体测试中,max版本以52%的成绩暂列第一,但在大多数其他基准测试中仍落后于Claude Fable 5.1。
  • 每任务0.55美元的定价是该模型最核心的竞争优势,在同等性能区间内显著低于0.94至1.23美元的竞品价格区间。
  • max版本通过消耗比xhigh版本多62%的推理token来换取性能提升,其具体定价尚未公布,目前仅对合作伙伴开放预览。
  • Meta已宣布将推出开放权重版本,延续其在AI领域的开源战略布局。
查看原始来源

原始标题:Meta closes in on the top with Muse Spark 1.3, and undercuts rivals on price

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。