产业 / 媒体
Artificial Analysis 发布智能指数4.2版,GPT-6 Astra排名回升但仍落后Claude Fable 5.1
AI评测机构Artificial Analysis近日发布了智能指数(Intelligence Index)4.2版本,此次更新很可能是对外界批评的直接回应——此前该机构的评分体系被认为未能准确反映OpenAI GPT-6 Astra的实际能力进步。在旧版指数中,Astra的得分与其前代模型Sol几乎持平,但Epoch AI等机构的评测显示Astra在267个模型中排名第一,ARC-AGI-3测试也显示其有显著乃至大幅跃升。更新后的4.2版本中,Astra比前代模型高出4分,但仍位列第二,Anthropic的Claude Fable 5.1继续领跑榜单,Meta位居第三。此次修订还新增了两项基准测试,删除了已被模型普遍攻克的GPQA-Diamond,并将私有测试数据的权重提升至40%,以降低模型针对性刷榜的可能性。Artificial Analysis表示,更全面的第5版指数已筹备八个月,将分阶段推出。
Artificial Analysis于2026年9月5日发布了智能指数4.2版本,对其基准评测体系进行了较大幅度的调整。此次更新的直接导火索,是此前该机构对GPT-6 Astra的评分引发的广泛质疑。在旧版指数中,Astra的得分与前代模型Sol几乎相同,令业界感到困惑,因为多家独立机构的评测结果均显示Astra有明显的能力跃升。
Epoch AI的评测数据显示,GPT-6 Astra在涵盖50余项基准的综合评分中以169分位列267个模型之首。ARC-AGI-3测试同样表明,Astra相较前代模型实现了大幅进步,具体幅度因所使用的测试框架而有所差异。OpenAI自身的评估也将Astra置于领域前列,与Artificial Analysis的评分结论形成明显落差,这一矛盾促使外界对后者的方法论提出质疑。
在4.2版本中,GPT-6 Astra的得分比前代模型Sol高出4分,排名升至第二位。Anthropic的Claude Fable 5.1仍然领跑整体榜单,Meta位居第三。值得关注的是,Artificial Analysis指出,Astra在完成每项任务时所消耗的token数量少于所有其他前沿模型,显示出较高的推理效率。在性价比维度,Anthropic、OpenAI、Meta与智谱AI并列领先。
此次版本更新在基准构成上也有明显变化。新增了两项测试:AA-Briefcase专注于真实世界的知识工作场景,Surge AI推出的GDP.pdf则针对PDF文档分析能力。与此同时,GPQA-Diamond因主流模型已普遍能够解答其中的题目而被移除。私有测试数据的权重从此前水平提升至40%,旨在降低模型开发者针对公开题库进行专项优化、从而人为抬高分数的可能性。
Artificial Analysis还对多项基准的历史评分错误进行了修正,并调整了评分系统以提升结果的稳定性。该机构解释称,此前为维持重大模型发布期间评分的可比性而刻意推迟更新,但顶部排名变动过于迅速,不得不提前发布这一中间版本。据悉,更为全面的第5版指数已历经八个月的研发,将以分阶段方式陆续推出,预计将在方法论层面带来更系统性的改进。
要点
- Artificial Analysis发布智能指数4.2版,修订后GPT-6 Astra得分比前代高出4分,但仍落后于Claude Fable 5.1,排名第二。
- 新版指数新增AA-Briefcase和GDP.pdf两项基准,删除已被普遍攻克的GPQA-Diamond,私有数据权重提升至40%以防刷榜。
- Astra在每任务token消耗上优于所有其他前沿模型,在性价比维度与Anthropic、Meta、智谱AI并列领先。
- 此次更新是对外界批评的直接回应,此前多家机构评测均显示Astra能力大幅领先,与Artificial Analysis旧版评分存在明显矛盾。
- 更全面的第5版指数已筹备八个月,将分阶段推出,预计带来更系统性的方法论改进。
原始标题:Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。