AI资讯 / 产业

产业 / 媒体

阿里Qwen3.8 Max追平Claude Opus 4.8,但Kimi K3性价比仍领先25%

The Decoder

阿里巴巴最新发布的Qwen3.8 Max在Artificial Analysis智能指数上获得56分,较上一代Qwen3.7 Max的46分提升10分,与Anthropic的Claude Opus 4.8持平,并超越GLM-5.2(51分)。然而,月之暗面的Kimi K3以57分略胜一筹,且每项任务费用仅为0.86美元,比Qwen3.8 Max的1.14美元低约25%。在面向职场任务的GDPval-AA基准测试中,Qwen3.8 Max以1739分的Elo评分超越Kimi K3(1685分),仅次于Claude Opus 5(1852分)。但这一成绩背后代价不小:模型每项任务平均需要64个步骤,是前代的4倍多,输入令牌量增长15倍,单任务成本也从0.53美元翻倍至1.14美元。与此同时,模型在长文本理解和知识问答方面出现退步,幻觉率从23%大幅跳升至40%。

阿里巴巴旗下大模型Qwen3.8 Max在Artificial Analysis发布的智能指数评测中斩获56分,相比上一代Qwen3.7 Max的46分实现了10分的跨越式提升。这一成绩使其与Anthropic的Claude Opus 4.8并驾齐驱,并将智谱AI的GLM-5.2(51分)甩在身后。然而,月之暗面的Kimi K3以57分的成绩依然保持领先,且在价格上更具竞争力。

在专门衡量职场实用任务的GDPval-AA基准测试中,Qwen3.8 Max表现亮眼,Elo评分跃升468分至1739,成功超越Kimi K3的1685分。在这一榜单上,仅有Claude Opus 5以1852分的成绩位居其上。这表明Qwen3.8 Max在处理复杂工作场景任务时具备相当强的能力,但这种能力的获取方式值得深究。

Qwen3.8 Max的高分背后隐藏着显著的效率代价。该模型完成每项任务平均需要64个步骤,而前代仅需14步;由于测试机制在每个步骤都会将完整对话历史重新发送给模型,输入令牌量因此膨胀了15倍。尽管阿里巴巴已下调定价——输入从每百万令牌2.50美元降至2.00美元,输出从7.50美元降至6.00美元——单任务成本仍从0.53美元翻倍至1.14美元,性价比明显下滑。

与Kimi K3相比,Qwen3.8 Max的成本劣势尤为突出。Kimi K3在智能指数上仅比Qwen3.8 Max低一分,但每项任务费用仅为0.86美元,便宜约25%;GLM-5.2的单任务成本更低至0.57美元。这意味着在实际部署场景中,追求性价比的用户有充分理由优先考虑竞争对手的产品。

更令人担忧的是,Qwen3.8 Max在部分关键指标上出现了相对前代的退步。长文本理解测试AA-LCR下降2分,知识问答测试AA-Omniscience下降10分。尤其值得警惕的是,模型的幻觉率从23%大幅攀升至40%——这意味着当模型面对不确定的问题时,它更倾向于给出猜测性答案,而非坦诚表示不知道,整体准确率仍维持在约31%的水平。

Qwen3.8 Max的发布折射出当前大模型竞争的深层矛盾:性能提升与成本控制、推理深度与响应效率之间的张力日益凸显。阿里巴巴在绝对性能上取得了实质性进展,但在性价比和可靠性方面仍面临来自Kimi K3等竞争对手的压力。如何在更强的推理能力与更低的幻觉率、更合理的运行成本之间找到平衡,将是下一代模型迭代的核心课题。

要点

  • Qwen3.8 Max在Artificial Analysis智能指数上得分56,追平Claude Opus 4.8,较上代提升10分,但Kimi K3以57分和更低成本仍占优势
  • 模型每任务需64个步骤、输入令牌量增长15倍,导致单任务成本从0.53美元翻倍至1.14美元,性价比明显下降
  • 幻觉率从23%跳升至40%,模型在不确定时更倾向于猜测而非承认未知,知识问答和长文本理解能力出现退步
  • 在职场任务基准GDPval-AA上,Qwen3.8 Max以1739分超越Kimi K3,仅次于Claude Opus 5,显示其在复杂工作场景中的实力
  • 大模型竞争中性能与成本的平衡难题愈发突出,高分背后的效率代价正成为企业选型的重要考量因素
查看原始来源

原始标题:Qwen3.8 Max catches Claude Opus 4.8 but Kimi K3 still scores higher for 25 percent less

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。