产业 / 媒体
Anthropic Claude Opus 5 在 ARC-AGI-3 基准测试中大幅领先,得分近乎四倍于 GPT-5.6 Sol
Anthropic 的 Claude Opus 5 在专为衡量真实智能设计的 ARC-AGI-3 基准测试中取得 30.2% 的得分,将此前由 OpenAI GPT-5.6 Sol 创下的 7.8% 纪录提升近四倍。ARC Prize 团队将这一领先归因于更强的逻辑推理能力,使模型能够在陌生环境中进行更自主的探索、规划与执行。测试过程中,Opus 5 展现出此前从未在 AI 模型中观察到的行为:将任务转化为代数符号表示,并独立推导出反射方程。该模型还攻克了五个此前无模型能解决的环境,其中四个达到或超过人类水平。在更早的 ARC-AGI-2 和 ARC-AGI-1 基准上,Opus 5 分别达到 90.4% 和 97.5%。不过,独立测试显示,在私有基准 Witness 上,Opus 5 的进步幅度远小于在 ARC-AGI-3 上的表现,引发外界对其是否针对特定基准进行专项训练的讨论。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中以 30.2% 的得分登顶排行榜,将 OpenAI GPT-5.6 Sol 此前创下的 7.8% 纪录提升近四倍,同时也超越了 Anthropic 自家的「Fable 级」模型约 20% 的成绩。ARC Prize 团队将这一显著领先归因于模型具备更强的逻辑推理能力,能够在未曾见过的环境中进行更自主的探索、规划与逐步执行,而非依赖记忆中的已知知识。
ARC-AGI-3 的设计初衷是测量 AI 模型处理训练阶段未曾遇到的全新任务的能力,包括人类通常能轻松应对的场景。该基准以游戏形式呈现:模型需推断交互环境的规则,制定行动计划并逐步执行,考验的是通用推理而非存储知识。目前 25 个公开演示环境中已有 6 个被成功解决,完整结果、回放记录及测试代码均已公开。
在测试过程中,Opus 5 展现出研究人员此前从未在任何 AI 模型中观察到的行为:它将任务自主转化为代数符号表示,并独立推导出反射方程。该模型还攻克了五个此前无模型能解决的环境,其中四个的表现达到或超过人类水平。在更早版本的 ARC-AGI-2 和 ARC-AGI-1 上,Opus 5 分别取得 90.4% 和 97.5% 的成绩,与此前最高分持平,但成本略有上升。
尽管 Anthropic 尚未公开解释这一进步的具体原因,但研究人员认为针对性数据标注与强化学习是合理的推动因素。由于 Opus 5 是在 ARC-AGI-3 及其格式公开之后才开发的,Anthropic 有可能针对该基准的技能类型和谜题格式进行了专项优化。标注人员可能对类似谜题中的推理轨迹、有效行动、失败尝试和恢复步骤进行了标注,强化学习则可奖励探索、规划、规则发现和自我纠错等行为。
然而,独立测试呈现出更为复杂的图景。在研究者 Guanghan Ning 的私有基准 Witness 上,Opus 5 得分 43.4,与 Kimi K3 和 Fable 5 统计上持平,相较于 Opus 4.8 的提升幅度远小于在 ARC-AGI-3 上的表现。Ning 认为这一模式符合针对特定类型数据进行训练的特征,但同时也指出 Opus 5 确实在 Witness 上实现了泛化,只是程度有限。ARC-AGI-3 联合研究者 Greg Kamradt 则表示,单一较弱的结果并不能否定模型整体推理能力的提升,且 Witness 本身也是围绕 ARC-AGI-3 风格谜题设计的,更好的表现可能反映的是真实迁移能力而非记忆。
Ning 将这一现象类比于编码基准的演进历程:随着 ARC-AGI-3 成为交互推理领域的核心目标,它将首先吸引最多的训练资源投入,覆盖更多边缘案例后,模型才能逐步泛化到更广泛的抽象推理任务。正如编码领域从 HumanEval 等饱和基准演进到频繁更新的竞赛和今天的编码智能体,推理基准的生态也将随之持续迭代演化。
要点
- Claude Opus 5 在 ARC-AGI-3 上以 30.2% 的得分大幅领先,将前纪录提升近四倍,并首次展现出自主推导反射方程等此前 AI 从未有过的行为
- ARC Prize 团队将这一领先归因于更强的逻辑推理能力,而非单纯的基准针对性训练,但 Anthropic 尚未公开具体技术细节
- 独立基准 Witness 的测试显示 Opus 5 的进步幅度远小于在 ARC-AGI-3 上的表现,引发对专项训练与真实泛化能力的讨论
- ARC-AGI-3 仅统计语言模型自身的表现,不计入依赖外部软件辅助的成绩,旨在衡量模型在无外部帮助下解决新任务的真实能力
- 推理基准的竞争格局正在加速演进,类似编码基准从饱和到持续更新的历程,未来模型的泛化能力将成为核心考量
原始标题:Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。