AI资讯 / 产业

产业 / 媒体

OpenAI称GPT-5.6 Sol在ARC-AGI-3上超越Opus 5,但测试条件存争议

The Decoder

Anthropic的Claude Opus 5刚刚以30.2%的成绩刷新ARC-AGI-3基准测试纪录后,OpenAI随即宣布GPT-5.6 Sol在启用两项API专属设置的情况下达到38.3%,声称超越对手。这两项设置分别是「保留推理」(Retained Reasoning,在多步骤间保持模型的思维链)和「压缩」(Compaction,对旧上下文进行摘要而非截断)。然而,在官方标准测试环境中,GPT-5.6 Sol仅得7.8%,因为该环境会在每次操作后丢弃模型的推理过程。ARC Prize方面表示,官方评测采用统一方法,不引入特定供应商的设置,以确保横向比较的公平性。ARC Prize联合创始人François Chollet随后回应称,通用API设置属于合理范围,但承认此前的测试可能对OpenAI存在不利,并表示只要设置和成本信息透明公开,一定程度的差异是可以接受的。

Anthropic的Claude Opus 5近期以30.2%的得分将ARC-AGI-3基准测试的纪录提升至此前的四倍,在业界引发广泛关注。OpenAI随即作出回应,宣布其GPT-5.6 Sol模型在特定条件下可以达到38.3%,超过Opus 5的成绩。这场围绕逻辑推理基准测试的竞争,折射出两家顶级AI公司在模型能力上的持续角力。

OpenAI取得这一成绩的关键在于启用了两项自家Responses API的专属功能。其一是「保留推理」,允许模型在多个操作步骤之间保持连贯的思维链,而非每步重置;其二是「压缩」,通过对旧有上下文进行摘要处理来替代直接截断,从而让模型在长任务中保留更多有效信息。这两项设置共同作用,显著提升了模型在复杂推理任务上的表现。

然而,在ARC Prize官方标准测试环境下,GPT-5.6 Sol的得分仅为7.8%。官方环境会在每次操作后丢弃模型的推理过程,这对依赖持续推理链的模型尤为不利。OpenAI对此提出异议,认为基准测试衡量的从来不只是模型本身,还包括围绕模型的技术配置,不同的测试框架会产生截然不同的结果。

争议的核心在于ARC Prize是否在测试OpenAI模型时使用了较旧的API接口。有观点认为,ARC Prize采用的「OpenAI风格补全API」缺乏Claude API已具备的某些功能,这可能在客观上对OpenAI造成了不公平的比较劣势。若属实,则意味着两家公司的模型并非在同等技术条件下接受评测。

ARC Prize联合创始人François Chollet随后发表声明,对测试设置作出区分:专门为破解基准测试而定制的工具属于违规,但面向所有API用户开放的通用设置则属合理范围。他承认此前的测试在一定程度上对OpenAI不利,并表示欢迎OpenAI探索更优的测试方式。他同时指出,不同供应商使用不同设置确实存在「潜在的可比性问题」,但只要相关设置和成本信息得到清晰披露,这种差异是可以接受的。

这场争论揭示了AI基准测试领域的深层矛盾:随着模型能力日益复杂,统一、公平的评测标准愈发难以制定。API功能的差异、上下文管理策略的不同,都可能对最终得分产生决定性影响。如何在保证横向可比性的同时,允许各家模型发挥其技术优势,将是AI评测体系亟需解决的核心问题。

要点

  • GPT-5.6 Sol在启用保留推理和压缩两项API设置后,ARC-AGI-3得分从7.8%跃升至38.3%,超过Anthropic Opus 5的30.2%,但官方环境下的巨大差距引发公平性质疑。
  • ARC Prize官方测试环境对所有模型采用统一设置,不引入供应商专属功能,旨在确保横向比较的一致性,但这可能对依赖特定API能力的模型造成不利。
  • ARC Prize联合创始人Chollet承认,此前测试可能因使用旧版API而对OpenAI存在不公平,并表示通用API设置在透明披露的前提下属于合理范围。
  • 此次争议表明,AI基准测试的结果不仅取决于模型本身,还高度依赖测试框架、API版本及上下文管理策略等技术配置,评测标准的制定面临日益复杂的挑战。
查看原始来源

原始标题:OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。