AI资讯 / 产业

产业 / 媒体

B站推出「AI 无限竞技场」大模型测评榜,GPT-6 Astra 登顶,国产模型占前五三席

IT之家

B站正式上线「AI 无限竞技场」大模型测评榜,首轮排行榜显示 GPT-6 Astra 在 10 位 UP 主的测评中累计夺得榜首次数最多,击败 GLM-5.3 位居总榜第一;前五名中国产大模型占据三席,展现出较强竞争力。该榜单由来自各领域的 UP 主对上百个大模型进行真实场景实测构成,涵盖代码、推理、协作、知识等多种主题,并收录 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、MiniMax 等主流模型。与传统基准测试不同,竞技场不设固定测评维度,UP 主可以真实工作流、专业应用或趣味脑洞自主命题,在同题 PK 中直观呈现各模型差异。榜单排名实时更新,持续面向全站 UP 主开放报名。数据显示,过去一年 B 站 AI 知识内容消费时长同比增长 72%,月均观看 AI 内容用户超过 1.9 亿。

B站于 2026 年 9 月 20 日正式上线「AI 无限竞技场」大模型测评榜,并同步公布首轮排行榜单。榜单显示,GPT-6 Astra 在参与测评的 10 位 UP 主中累计夺得榜首次数最多,以此击败 GLM-5.3 登顶总榜。值得关注的是,前五名中国产大模型占据三席,体现出国内头部模型在真实场景测评中的整体竞争实力。

「AI 无限竞技场」的核心定位是一个汇聚 B 站 UP 主 AI 大模型测评的竞技广场。与学术界常见的标准化基准测试不同,该平台不设固定主题或测评维度限制,由来自各分区的 UP 主自主命题,以真实工作流、专业应用场景乃至趣味脑洞为切入点,让多个模型在同一题目下同台竞技,直观呈现各模型在实际使用中的表现差异。

榜单收录范围覆盖当前主流大模型,包括 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等,测评主题涵盖代码生成、逻辑推理、多模态协作、知识问答等多个维度。排名机制采用实时更新方式,并持续面向全站 UP 主开放报名,任何创作者均可参与提交测评内容。

B 站选择以 UP 主生态驱动大模型评测,背后有其用户数据支撑。公开数据显示,过去一年 B 站 AI 知识内容消费时长同比增长 72%,月均观看 AI 相关内容的用户规模超过 1.9 亿。平台已涌现出大量覆盖发布解读、用户讨论、实测对比、使用教程、问题求助及社区共建等多种形态的 AI 内容,形成较为完整的内容生态。

「AI 无限竞技场」的推出,标志着大模型评测正在从实验室走向更广泛的社区化、场景化验证。以内容创作者为核心的评测模式,能够更贴近普通用户的真实使用需求,也为模型厂商提供了区别于学术榜单的另一维度参考。随着参与 UP 主数量持续增加,该榜单的代表性与影响力有望进一步扩大。

要点

  • GPT-6 Astra 在 B 站首轮「AI 无限竞技场」榜单中以榜首次数最多位居总榜第一,击败国产模型 GLM-5.3
  • 前五名中国产大模型占据三席,显示国内头部模型在真实场景测评中具备较强竞争力
  • 榜单采用 UP 主自主命题的社区化评测模式,不设固定维度限制,覆盖代码、推理、协作、知识等多类主题
  • B 站 AI 内容消费时长过去一年同比增长 72%,月均观看用户超 1.9 亿,为该榜单提供庞大用户基础
  • 榜单排名实时更新并持续开放报名,DeepSeek、Claude、Gemini 等主流模型均已纳入对比范围
查看原始来源

原始标题:B站上线“AI 无限竞技场”LLM 测评榜:号称“全球百大模型同场竞技”、GPT-6 现居榜首

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。