AI资讯 / 产业

产业 / 媒体

神秘模型 Ox Alpha 免费上线,代码基准碾压 Claude,疑似出自智谱

IT之家

全球最大 AI 聚合平台 OpenRouter 于 8 月 20 日悄然上线一款匿名模型 Ox Alpha,并提供为期一周的免费试用。该模型在 DeepSWE 编程基准测试中表现抢眼,十项任务平均得分约 80%,远超 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52%,引发开发者广泛关注。Ox Alpha 支持超百万 token 的超长上下文窗口,具备文本、图像和视频多模态输入能力,单次最大输出可达 131,072 个 token。研究人员对 25 个提示词进行分词器指纹分析后发现,其 token 数量与智谱旗下 GLM-5.3 几乎完全吻合,仅存在固定 75 个 token 的包装层偏差,视频编码器行为模式和 API 响应特征也与智谱架构高度一致,种种迹象均指向智谱公司为该模型幕后开发者。

8 月 20 日,OpenRouter 平台在未作任何官方声明的情况下,悄然上线了一款名为 Ox Alpha 的匿名 AI 模型,并宣布免费开放使用一周。这一低调亮相的方式在 AI 社区迅速引发热议,开发者们纷纷对这个来历不明的模型展开测试,试图揭开其真实身份。

开发者 Ben Davis 率先对 Ox Alpha 进行了系统性评测,使用的基准为 DeepSWE——该测试专门衡量 AI 模型读取真实代码库、识别漏洞并生成有效补丁的综合能力,被视为衡量编程智能的重要指标。Ox Alpha 在十项任务中平均得分约 80%,而 Claude Fable 5 仅为 65%,GLM-5.3 和 Grok 4.6 均为 62%,GPT-5.6 Sol 则只有 52%。Davis 本人坦言,鉴于该模型来源不明,这一结果令他感到困惑。

从技术规格来看,Ox Alpha 的参数相当亮眼。OpenRouter 的列表显示,该模型上下文窗口高达 1,048,576 个 token,支持文本、图像和视频的多模态输入,每次响应最大输出 131,072 个 token。终端编程智能体 OpenCode 也通过其免费套餐接入了该模型,并声称每日可处理高达 100 万亿个 token 的请求量。

为追溯 Ox Alpha 的真实来源,研究人员采用了分词器指纹分析方法,对 25 个提示词逐一比对。结果显示,Ox Alpha 的 token 数量与智谱旗下 GLM-5.3 几乎完全吻合,两者之间仅存在恒定 75 个 token 的包装层偏差,这一规律性差异高度符合对已有模型进行系统性封装的特征。

除分词器数据外,研究人员还发现 Ox Alpha 的视频编码器行为模式和 API 响应特征均与智谱的技术架构高度一致。综合多项技术线索,目前社区普遍认为 Ox Alpha 极有可能是智谱以匿名方式在 OpenRouter 平台进行的一次隐秘测试,但智谱方面尚未就此作出任何官方回应。

此次事件再度引发业界对 AI 模型匿名测试惯例的讨论。以隐身模式在第三方平台收集真实用户反馈,已成为部分头部 AI 实验室在正式发布前的常见策略。若 Ox Alpha 确为智谱出品,其在编程基准上的强劲表现将意味着国产大模型在代码能力领域已具备与国际顶尖模型正面竞争的实力。

要点

  • Ox Alpha 在 DeepSWE 编程基准测试中以 80% 的得分领先 Claude Fable 5(65%)和 GPT-5.6 Sol(52%),表现出色。
  • 该模型支持超百万 token 超长上下文窗口及文本、图像、视频多模态输入,技术规格处于行业前列。
  • 分词器指纹分析显示,Ox Alpha 与智谱 GLM-5.3 的 token 数量几乎完全吻合,仅有固定 75 个 token 的包装层偏差。
  • 视频编码器行为模式和 API 响应特征同样与智谱架构高度一致,多项技术证据共同指向智谱为幕后开发方。
  • 以匿名方式在第三方平台进行隐身测试,已成为 AI 实验室收集真实反馈、评估模型能力的常见做法。
查看原始来源

原始标题:神秘 Ox Alpha AI 模型限免上架:DeepSWE 跑分碾压 Claude Fable 5,线索指向智谱

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。