AI资讯 / 产业

产业 / 媒体

Meta 新版 Muse Spark 1.1 编码能力超越 GLM-5.2,单任务成本更低

The Decoder

Meta 发布 Muse Spark 1.1 模型,在 Artificial Analysis 的 Intelligence Index 上拿到 51 分,三个月内提升 8 分,与 GLM 5.2、GPT-5.4 和 GPT-5.6 Luna 并列。编码专项得分 71.3,超过 GLM 5.2 的 68.8,仅以微弱差距落后 GPT-5.6 Luna。更关键的是,每任务成本约 0.26 美元,比 GLM-5.2 的 0.37 美元和 GPT-5.4 的 0.89 美元都低,输出 token 也更少。幻觉率从上代 73% 降至 38%,模型更倾向拒绝回答而非胡编。上下文窗口扩大四倍至 100 万 token,目前仅通过 Meta 自有 API 提供。

Meta 推出 Muse Spark 1.1,在 Artificial Analysis 测评体系中的 Intelligence Index 取得 51 分,与 GLM 5.2、GPT-5.4、GPT-5.6 Luna 并列。短短三个月内该模型提升 8 分,进步集中在编码和智能体知识工作两类任务上,反映出 Meta 在工程化能力上的持续投入。

编码能力是本次升级的亮点。Muse Spark 1.1 在 Coding Index 上拿到 71.3 分,超过 GLM 5.2 的 68.8,仅以 0.1 分的微弱差距落后 GPT-5.6 Luna。当前榜单头部分别由 GPT-5.6 Sol(77.4)、Terra(76.7)和 Claude Fable 5(76.5)占据,Meta 已稳居第二梯队前列。

性价比层面,Muse Spark 1.1 表现突出。每任务成本约 0.26 美元,低于 GLM-5.2 的 0.37 美元和 GPT-5.4 的 0.89 美元;输出 token 仅 9400 万,对比 GLM-5.2 的 1.41 亿节省明显。在分数持平甚至略高的情况下,Meta 提供了更经济的选项。

可靠性方面同样有改善。幻觉率从上版本的 73% 下降至 38%,接近减半。模型在面对不确定问题时更倾向直接拒绝,而非强行生成错误答案,这对于企业部署而言是重要的安全信号。

Meta 还把上下文窗口扩展四倍至 100 万 token,可以一次性处理更长的代码库或文档。目前 Muse Spark 1.1 仅通过 Meta 官方 API 开放,尚未登陆第三方云平台,渠道策略略显保守。

需要注意的是,基准测试成绩并不能完全代表真实业务表现。开发者在选型时仍应结合自身场景进行实测,但 Muse Spark 1.1 至少在纸面数据和成本结构上给出了足够有竞争力的组合。

要点

  • Muse Spark 1.1 在 Intelligence Index 上三个月提升 8 分至 51 分,与 GLM 5.2、GPT-5.4 并列
  • 编码得分 71.3,超过 GLM 5.2 的 68.8,仅以微弱差距落后 GPT-5.6 Luna
  • 单任务成本 0.26 美元,低于 GLM-5.2 的 0.37 美元和 GPT-5.4 的 0.89 美元
  • 幻觉率从 73% 降至 38%,模型倾向于拒绝而非胡乱作答
  • 上下文窗口扩大四倍至 100 万 token,目前仅通过 Meta 自有 API 提供
查看原始来源

原始标题:Meta's Muse Spark 1.1 outperforms GLM-5.2 in coding and costs slightly less

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。