产业 / 媒体
GPT-6 Astra基准测试结果分歧,但ARC-AGI-3效率超越人类均值,Chollet上调AGI预测时间表
OpenAI发布的GPT-6 Astra在各大基准测试中收获了截然相反的评价。Epoch AI综合逾50项测试,给出169分的综合评分,将其列于267个模型之首;而Artificial Analysis的评分仅为61分,与前代持平,落后于Claude Fable 5.1的66分。价格方面,Astra比前代贵约两倍半,但在编程任务上成本仅为Claude Opus 5的五分之一,因为其所需计算步骤极少。最引人注目的突破来自ARC-AGI-3测试——该测试将AI置于规则未知的陌生游戏世界中,要求其通过试错自主掌握规则。Astra以62.7%的得分大幅领先前代的7.78%和Claude Opus 5的30.16%,更重要的是,其解题所用步骤数首次低于人类测试者的中位数。ARC Prize联合创始人François Chollet表示,这一进展速度是他预期的两倍,并因此上调了对AGI到来时间的预测,但他明确表示这并不等同于AGI已经实现。
两家独立机构对GPT-6 Astra的综合评估得出了截然相反的结论。Epoch AI整合超过50项基准,给出169分的总分,在267个参评模型中排名第一;Artificial Analysis则从知识、编程和文本理解三个维度评分,仅给出61分,与前代GPT-5.6 Sol持平,低于Claude Fable 5.1的66分。这种分歧折射出当前AI评测体系的深层矛盾:不同机构选取的测试维度和权重差异,可能导致对同一模型的判断南辕北辙。
在成本结构上,Astra呈现出一种独特的双面性。与自家前代相比,每单位文本处理费用提高了约两倍半,单次任务成本比Sol贵约75%。但与Anthropic的旗舰模型相比,局面完全反转:在编程任务上,Astra与Claude Fable 5得分相当,但每次任务成本不足后者的一半。这一优势源于Astra极高的计算效率——其所需计算步骤仅为Sol的三分之一、Opus 5的五分之一。
ARC-AGI-3测试带来了本次评测中最具冲击力的结果。该测试将模型置于规则和目标均未说明的陌生游戏世界,要求其完全依靠试错自主学习。Astra以约2.6万美元的测试成本达到62.7%的得分,远超前代Sol的7.78%和Claude Opus 5的30.16%。值得注意的是,OpenAI此前公布的99.9%成绩使用了其自研的推理链保留工具,ARC Prize认为该条件无法在不同厂商间进行公平比较,因此以62.7%作为标准参照值。
更值得关注的是效率维度而非原始得分。ARC Prize在测试前招募约500名人类测试者,记录了每个关卡中成功通关者所用步骤数的中位数。在使用OpenAI自研框架的测试中,Astra在96%的关卡中所用步骤数低于人类中位数,平均仅用人类中位数步骤的一半略多。这意味着Astra一旦理解游戏机制,其执行效率便进入人类水平区间,而这正是此前被认为人类将长期保持优势的领域。
为实现这一表现,Astra在解题过程中自发形成了一套类代数的符号记录系统,用于追踪对象坐标、规则推断和行动计划,例如用extend8 to3; retract10 to2表示有序动作序列,或用Turn 5: P=(24,20), empty, facing west记录状态。ARC Prize指出,在标准测试框架下,模型无法保留上下文记忆,因此这种自创的信息压缩方式至关重要。其他模型也出现了类似行为,但Astra在精确度和信息密度上表现尤为突出。
ARC Prize联合创始人François Chollet表示,当前AI进展速度是他此前预期的两倍,并因此将AGI到来的时间预测提前。他明确强调,Astra在ARC-AGI-3上的表现并不构成AGI的证明,但这一效率突破确实超出了他的预期节奏。与此同时,Astra在部分领域仍存在明显短板:幻觉率虽从92%降至51%,但在银行客服支持、SciCode和长上下文推理等任务上的表现有所退步,GDPval-AA v2评分也下滑约80个Elo分。
要点
- Epoch AI与Artificial Analysis对GPT-6 Astra的综合评分结论相反,前者将其列为第一,后者认为其与前代持平,凸显当前AI基准测试体系缺乏统一标准的问题。
- Astra在ARC-AGI-3测试中首次在解题步骤效率上超越人类测试者中位数,这一维度被认为比原始得分更能反映模型的真实推理能力。
- Astra自发形成类代数符号记录系统以压缩和保留关键信息,展现出此前未见于主流模型的自主知识组织能力。
- François Chollet将AGI预测时间表提前,但明确表示ARC-AGI-3的表现不等于AGI实现,当前进展仍属能力跃升而非质变。
- Astra的计算效率极高,在编程任务上成本仅为Claude Opus 5的五分之一,但相比自家前代Sol价格大幅上涨,成本优势因比较对象不同而呈现截然不同的面貌。
原始标题:Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。