AI资讯 / 产业

产业 / 媒体

Meta靠价格战杀入编程AI市场,Muse Spark 1.2与Muse Code同步亮相

The Decoder

Meta发布了编程强化版模型Muse Spark 1.2,同时推出首款专属编程智能体Muse Code,正式进入Claude Code和OpenAI Codex所在的终端编程助手赛道。Muse Spark 1.2在代码生成、调试及大型代码库推理方面较前代有所提升,训练过程引入了前代模型生成的编程任务与评分机制。定价方面,标准档与1.1版持平,新增的超低价档每百万输出token仅收0.2美元,但用户须同意将数据用于模型训练。相比之下,西方主流竞品定价在每百万输出token 10至30美元之间。然而,Meta公布的基准测试存在明显漏洞:在多项榜单上表现接近甚至领先Spark 1.2的Kimi K3,在Meta的对比图表中完全缺席。Meta股价上周已下跌10%,其收入仍有98%来自广告业务。

Meta正式发布Muse Spark 1.2,定位为对今年早些时候推出的Muse Spark 1.1的编程能力升级。官方称新模型在代码生成、调试以及对大型代码库的整体推理上均有改进,背后是更多算力投入和更大规模的训练环境。模型主要针对长周期任务进行训练,例如生成完整代码仓库或独立开展技术研究,并通过提前规划步骤、压缩历史上下文而非截断的方式,维持长会话中的任务连贯性。

训练数据的一部分来自前代模型本身。Muse Spark 1.1负责生成编程任务与指令模板,并对解决方案进行评分,Meta表示这一自我蒸馏流程使1.2在遵循复杂指令方面优于前代。然而,Meta引用的基准测试——Terminal-Bench 2.1、DeepSWE v1.1以及来自自有代码库的440项任务——在方法论上存在明显局限:测试环境并未针对竞品模型进行调优,Meta自己也承认这可能无法反映对手的最佳表现。

基准测试中最引人注目的缺席者是Kimi K3。Meta的方法论文件中提及曾对其进行测试,但最终发布的对比图表中K3踪迹全无。在Terminal-Bench 2.1上,K3仅以微弱差距落后于Claude Opus 5,却大幅领先Spark 1.2。DeepSWE的测试结果同样无法与官方榜单直接比较,因为每个模型都在各自的智能体框架内运行——而这恰恰引出了Meta此次同步发布的另一个产品。

Muse Code是Meta首款面向终端的编程智能体,安装方式与Claude Code、OpenAI Codex相同,均为单条命令完成部署。它支持「/plan」生成执行计划并等待用户确认,还提供「/grill」命令在执行前对计划进行压力测试,以及「/goal」命令驱动智能体朝固定目标持续推进。与竞品的关键差异在于子智能体的管理方式:Meta的辅助智能体在整个会话期间保持活跃并主动汇报,而非为单一子任务临时启动后立即关闭,理论上可减少重复性研究工作。

Muse Code还具备崩溃快速恢复功能。智能体会将每次模型调用、每次用户确认和每次变更记录到本地协议文件中。Meta声称,崩溃后Muse Code能从中断的精确位置续接,而非重新读取完整上下文,这一精度优于现有竞品。在定价层面,新增的超低价档每百万输出token仅需0.2美元,代价是用户数据将被用于模型训练;中国厂商的起步价约为0.18美元,而西方主流竞品普遍在10至30美元区间。Meta此番明确以价格而非顶尖性能作为竞争武器,但在股价上周下跌10%、广告收入占比高达98%的背景下,这场价格战能否持续,仍是外界关注的焦点。

要点

  • Muse Spark 1.2主打编程能力升级,通过自我蒸馏训练和长任务优化提升复杂指令遵循能力,但基准测试方法论存在对竞品不利的系统性偏差。
  • Muse Code作为终端编程智能体,子智能体持久化运行和崩溃精准续接是其区别于Claude Code与Codex的核心差异点。
  • Meta新增每百万输出token 0.2美元的超低价档,以用户训练数据换取价格优势,将竞争重心从性能转向成本。
  • Kimi K3在多项基准上领先Spark 1.2,却被Meta刻意从公开对比图表中删除,引发外界对测试公正性的质疑。
  • Meta股价上周下跌10%,AI业务仍需在广告收入主导的财务结构下寻找可持续的商业化路径。
查看原始来源

原始标题:The company that made open weights mainstream now competes on discounts

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。