产业 / 媒体
中国AI模型GLM 5.2以低成本挑战编程任务
中国AI实验室智谱AI于6月16日发布的开源模型GLM 5.2,拥有7530亿参数但仅激活400亿,在编程基准测试中接近Anthropic的Opus 4.8,但API成本仅为每百万输出令牌4.40美元,远低于美国竞品。该模型采用MIT开源许可,允许自托管,解决了数据安全顾虑。软件工程师反馈显示,GLM 5.2擅长前端开发和长期任务,但存在速率限制和幻觉问题。这一发布加剧了美国AI公司可能失去竞争优势的担忧,反映了中国AI模型数量从2020年占美国五分之一增长到2025年过半的趋势。
智谱AI于6月16日发布的开源大语言模型GLM 5.2,以7530亿参数但仅激活400亿的优化设计,在编程基准测试中展现出接近美国前沿模型的性能。该模型采用MIT开源许可,允许任何组织免费下载和自托管,API成本仅为每百万输出令牌4.40美元,不到Anthropic Opus 4.8的五分之一,是Fable编程模型的十分之一。这种高性价比选择正吸引越来越多注重成本的开发者。
Together AI的AI工程师Zain Hasan表示,他学会了根据任务复杂度选择模型:复杂问题交给前沿模型如Anthropic的Fable,简单任务则用GLM 5.2。他指出,许多公司尚未建立令牌预算,工程师倾向于使用最强大的模型,这种习惯可能成为美国AI实验室的护城河。GLM 5.2在FrontierSWE和PostTrainBench等智能编程基准中几乎与Opus 4.8持平,并在网络安全基准中表现优异,引发与Anthropic Mythos的比较。
斯坦福AI指数显示,2025年中国公司生产的“知名”AI模型数量是美国的一半以上,高于2023年的三分之一和2020年的五分之一。GLM 5.2的出色基准分数创下了开源模型和中国开发模型的新纪录。然而,其中国背景让一些美国公司担忧数据安全,但开源权重允许自托管,这不同于大多数仅通过API访问的前沿模型。智谱AI同日发布的研究报告聚焦于Opus 4.8和GPT-5.5,在编程基准中GLM 5.2通常略逊于Opus 4.8。
软件工程师对GLM 5.2的实际体验不一。Hasan发现它能处理更长时间的对话,保持连贯思路。MetaRouter的David Nix认为它在前端开发方面“非常接近”前沿模型,承担了他10%到20%的LLM工作。Screen Studio的Kacper Michalik在创建网站表单时获得良好结果。但Indhic AI的Sai Kiran Myadaram遇到速率限制、幻觉和过度规划问题,导致代码库混乱,最终回归OpenAI的Codex。
GLM 5.2的发布加剧了美国AI公司可能失去竞争优势的担忧。尽管在SWE-Marathon等困难基准中,Opus 4.8的完成率是GLM 5.2的两倍,但后者在成本效益上具有显著优势。随着中国AI模型数量和质量提升,全球开发者面临更多选择,而成本意识可能成为决定市场格局的关键因素。
要点
- GLM 5.2 API成本仅为每百万输出令牌4.40美元,远低于美国竞品,适合预算敏感项目。
- 模型在智能编程基准中接近Opus 4.8,尤其擅长前端开发和长期任务。
- 开源权重允许自托管,解决了数据安全顾虑,但存在速率限制和幻觉问题。
- 中国AI模型数量从2020年占美国五分之一增长到2025年过半,竞争力显著提升。
原始标题:Chinese AI Model Uses Less Muscle for Coding Tasks
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。