AI资讯 / 产业

产业 / 媒体

GLM-5.3-Flash代码榜杀入前十,千问新版登顶前端榜

IT之家

Arena平台发布2026年第35周(8月24日至30日)AI大模型盲测排行榜,本周最大看点是多款国产新模型集中亮相并取得突出成绩。智谱GLM-5.3-Flash首次入榜即闯入代码榜前十,排名第7位,ELO分数达1535分,超越绝大多数头部海外模型;阿里Qwen3.8-Max-0902首秀直接登顶前端开发榜,以1691分将Anthropic的Claude-Opus-5-Max挤至第二;腾讯Hy4-Preview、阿里Qwen3.8-Flash-Next、智谱GLM-5.3-Flash也同步闯入前端榜前12名,四款国产新模型集体表现抢眼。综合榜方面,Anthropic依然垄断前七席位,月之暗面Kimi-K3-Max稳守第10名。智能体榜上,智谱GLM-5.2-Max大幅跃升7位至第10名。整体来看,国产模型在细分领域的竞争力持续提升,与海外顶尖模型的差距正在缩小。

Arena平台本周综合榜头部格局延续稳定态势,Anthropic旗下Claude-Fable-5以1508分蝉联榜首,该公司多款模型牢牢占据前七席位,各模型间ELO分差均在30分以内,属统计误差范围内的接近。国产模型中,月之暗面Kimi-K3-Max以1489分稳守第10名,是综合榜中排名最高的国产模型。智谱GLM-5.3-Flash作为本周新入榜模型,首秀排在第30位,ELO 1473分,与同期入榜的谷歌Gemini-3-Flash(第27位,1474分)成绩相当。

代码榜是本周国产模型表现最为亮眼的赛道。榜单头部依然由Anthropic垄断,Claude-Opus-4-7-high以1552分居首,前三名分差仅1分,视为并列。然而最引人注目的是智谱GLM-5.3-Flash首次入榜即排在第7名,ELO达1535分,超越了大多数头部海外模型,仅次于月之暗面Kimi-K3-Max(第6名,1542分)。值得一提的是,GLM-5.3-Flash定价极具竞争力,输入仅0.15美元/百万token,输出0.5美元/百万token,性价比突出。

前端开发榜本周迎来最大变局。阿里Qwen3.8-Max-0902首次入榜即以1691分直接登顶,将此前的榜首Claude-Opus-5-Max(1687分)挤至第二。与此同时,腾讯Hy4-Preview(第8名,1627分)、阿里Qwen3.8-Flash-Next(第9名,1622分)、智谱GLM-5.3-Flash(第12名,1604分)也在同一周集体首秀,四款国产新模型齐聚前12名,国产模型在前端开发榜已占据半壁江山,头部竞争格局发生显著变化。

智能体榜方面,Anthropic模型依然占据前三,Claude Opus 5 High以13.74%的净提升度蝉联第一,工具幻觉率仅0.8%,为头部模型中最低。国产模型中,智谱GLM-5.2-Max本周大幅跃升7位至第10名,净提升度6.23%,任务确认成功率达8.65%,表现亮眼。月之暗面Kimi-K3-Max位列第6名,净提升度8.71%,任务确认成功率高达16.90%,在国产模型中排名最高。阿里Qwen3.8-Max工具幻觉率仅0.11%,在可靠性指标上表现突出。

生图榜与视频榜方面,国产模型同样保持稳定存在。生图榜中,字节跳动Seedream-5.0-Pro守住第8名,阿里Qwen-Image-3.0-Pro位列第9名,两款国产模型均稳居Top 10。视频榜迎来新榜首,谷歌Gemini-Omni-1.1-Flash首次入榜即夺冠,ELO 1515分;国产方面,字节跳动旗下Dreamina-Seedance-2.0-720p和2.5-720p分列第4、第5名,MiniMax-H3升至第6名,MiniMax新模型Hailuo-2.3也首次入榜排在第30名。

综合本周各榜单来看,国产大模型正在从综合榜的中上游位置向细分领域榜首发起冲击,并已在前端开发榜实现突破。Anthropic在综合榜和代码榜的统治地位短期内仍难以撼动,但国产模型凭借更具竞争力的定价和持续迭代的能力,正在缩小与顶尖海外模型的差距。智谱、阿里、腾讯、月之暗面等厂商在同一周集中推出新模型并取得亮眼成绩,显示国产AI生态的整体研发节奏正在加快。

要点

  • 智谱GLM-5.3-Flash首次入榜即闯入代码榜第7名,ELO 1535分,超越绝大多数头部海外模型,且定价极具竞争力(输入$0.15/百万token)
  • 阿里Qwen3.8-Max-0902首秀直接登顶前端开发榜,以1691分超越Anthropic Claude-Opus-5-Max,国产模型首次在该榜夺冠
  • 本周四款国产新模型(Qwen3.8-Max-0902、Hy4-Preview、Qwen3.8-Flash-Next、GLM-5.3-Flash)集体闯入前端榜前12名,国产模型占据该榜半壁江山
  • 综合榜和代码榜头部仍由Anthropic垄断,Claude-Fable-5和Claude-Opus-4-7-high分别以1508分和1552分领跑
  • 智能体榜上智谱GLM-5.2-Max单周跃升7位至第10名,月之暗面Kimi-K3-Max任务确认成功率达16.90%,国产模型在智能体能力上持续进步
查看原始来源

原始标题:AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。