产业 / 媒体
glm-5.3-max首秀杀入综合榜前15,kimi-k3-max首进前十
Arena平台发布2026年第34周(8月17日至23日)AI大模型盲测排名,本周国产模型表现尤为亮眼。智谱新发布的glm-5.3-max首次入榜即闯入综合榜第13名(ELO 1487分),同时在代码榜和前端开发榜均进入前十,首秀成绩突出。月之暗面kimi-k3-max在综合榜从第12名升至第10名,首次跻身前十,在代码榜位列第6,在智能体榜升至第4名,净提升度达10.41%。字节跳动新发布的dreamina-seedance-2.5-720p在AI视频榜首次入榜即位列第4名。前端开发榜方面,阿里qwen3.8-27b也首次入榜即进入前十。综合榜头部格局依旧由Anthropic系列模型主导,claude-fable-5以1508分蝉联第一,但国产模型在中上游的存在感持续增强,多个细分赛道已具备与头部模型竞争的实力。
Arena平台本周综合榜头部格局保持稳定,Anthropic旗下claude-fable-5以ELO 1508分蝉联榜首,claude-opus-4-6-high和claude-opus-4-7-high分别以1504分、1502分位列二、三名,三者分差均在误差范围内,实际处于并列水平。本周最大亮点来自国产阵营:智谱glm-5.3-max首次入榜即直接落位第13名,月之暗面kimi-k3-max则从第12名升至第10名,成为本周综合榜中首次闯入前十的国产模型。
在代码能力榜单上,国产模型同样表现不俗。kimi-k3-max稳居第6名(ELO 1542分),glm-5.3-max首次入榜即杀入前十,位列第10名(ELO 1531分)。阿里qwen3.7-max-preview保持第17名,小米mimo-v2.5-pro位列第27名。值得注意的是,qwen3.8-max本周在代码榜下滑明显,从第13名降至第25名,与其在综合榜的下滑趋势一致,显示该模型近期竞争压力有所上升。
前端开发榜方面,国产模型的集体表现尤为突出。kimi-k3-max和qwen3.8-max稳定占据第2、3名,与榜首claude-opus-5-max的分差在误差范围内。新入榜的glm-5.3-max直接落位第8名,阿里qwen3.8-27b首次入榜即位列第9名,两款国产新模型同时进入前十。此外,DeepSeek的两款模型也稳定保持在前15名之内,国产模型在前端开发这一细分赛道的竞争力已相当显著。
AI视频榜方面,字节跳动新发布的dreamina-seedance-2.5-720p首次入榜即位列第4名(ELO 1477分),与前代产品dreamina-seedance-2.0-720p(第3名)同时进入前五,两款国产视频模型并驾齐驱。整体榜单由谷歌gemini-omni-flash以1512分领跑,flux-3-video位列第二。AI生图榜格局相对稳定,gpt-image-2继续领跑,字节seedream-5.0-pro和阿里qwen-image-3.0-pro分别保持第8、9名。
智能体榜方面,Anthropic模型依旧占据前三席位,但国产模型已开始触及第一梯队门槛。kimi-k3-max本周升至第4名,净提升度10.41%,任务确认成功率达17.97%,整体能力已进入头部梯队。DeepSeek V4 Pro(High)和阿里Qwen3.8 Max本周首次入榜,分别位列第14、15名,工具幻觉率等关键指标表现稳健。随着更多国产大模型新版本持续发布,Arena各榜单的竞争格局预计将进一步加剧。
要点
- 智谱glm-5.3-max首次入榜即在综合榜、代码榜、前端开发榜三个榜单同时进入前十五,首秀成绩在国产模型中较为罕见
- 月之暗面kimi-k3-max本周实现多榜突破:综合榜首进前十、智能体榜升至第4名,成为本周国产模型中表现最全面的选手
- 字节跳动dreamina-seedance-2.5-720p在AI视频榜首次入榜即位列第4,与前代产品同时进入前五,国产视频模型竞争力持续提升
- 前端开发榜已有多款国产模型进入前十五,kimi-k3-max和qwen3.8-max稳居前三,国产模型在该细分赛道已具备与头部模型正面竞争的实力
- Arena榜单基于用户匿名盲测投票和ELO算法计算,反映用户主观偏好,不同分榜相互独立,分差在误差范围内视为并列
原始标题:AI 大模型周榜:国产 glm-5.3-max 首秀闯入综合榜前 15,kimi-k3-max 冲进前十
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。