模型 / 官方
两项API设置让GPT-5.6在ARC-AGI-3基准测试中得分翻三倍
OpenAI近日发布研究报告,揭示了一个令人意外的发现:GPT-5.6 Sol在ARC-AGI-3基准测试中的低分,并非源于模型本身的能力缺陷,而是测试框架的配置问题所致。ARC-AGI-3是一项通过2D益智游戏评估AI推理与学习能力的基准测试,官方框架采用了丢弃私有推理记录和滚动截断上下文两种机制,导致模型每次行动都需从零开始理解游戏规则,无法积累经验。OpenAI通过Responses API启用了两项设置——跨轮次保留推理记忆,以及用上下文压缩替代滚动截断——使GPT-5.6 Sol的得分从13.3%提升至38.3%,同时输出token数量减少约六倍。这一结果表明,基准测试的得分不仅反映模型能力,也深刻受到API配置、框架设计和提示策略的影响。
当OpenAI团队首次看到GPT-5.6 Sol在ARC-AGI-3基准测试中仅得7.8%的成绩时,感到十分困惑。这款模型此前已解决了数学领域的长期开放问题——如环双覆盖猜想——并在《宝可梦:火红》等游戏中表现出色。相比之下,GPT-5.5在同一测试中仅得0.4%,几乎无法正常游玩。ARC-AGI-3要求AI代理在没有明确说明的情况下,自主探索并推断陌生2D游戏的运行规则,是一项专门考察学习与推理能力的测试。
深入分析后,OpenAI发现问题根源在于官方测试框架的两项设计选择。其一,每次游戏行动结束后,模型的私有推理记录会被完全丢弃,导致GPT-5.6 Sol每一步都需重新理解游戏,无法延续此前的思考与计划。其二,框架采用滚动截断机制,当对话上下文超过17.5万字符时,最早的消息会被删除,使模型同时失去对过去行动的记忆。两种机制叠加,严重削弱了模型随时间积累经验的能力。
为了复现生产环境中的实际配置,OpenAI使用Responses API重新实现了ARC-AGI-3的测试框架。在GPT-5.6中,只需传入上一次响应的ID,即可自动在工具调用和多轮对话之间保留推理记忆。启用这一设置后,模型在每次行动前的思考时间明显缩短,因为它不再需要每轮从头解析游戏状态;同时,模型能够延续此前的策略,在游戏过程中展现出更连贯、更有效的决策行为。
第二项改进是用上下文压缩替代滚动截断。滚动截断在上下文超限时直接丢弃最早的消息,存在两个明显缺陷:模型会丢失早期的关键观察与行动记录,且长时间运行时上下文窗口始终处于接近满载的状态,可能对性能产生负面影响。而上下文压缩机制会对历史内容进行智能摘要,使模型在更长的游戏流程中仍能保留对游戏规则的理解,从而以更少的输出token取得更高的得分。
综合两项设置的效果,GPT-5.6 Sol(最大版本)在ARC-AGI-3公开任务集上的得分从13.3%提升至38.3%,约为原来的三倍,同时输出token数量减少约六倍。作为参考,官方记录显示人类测试者的平均得分约为48%。OpenAI还展示了一段动画,直观呈现了两种框架下17.5万token上下文窗口的使用差异,保留推理记忆的模型每步思考更少、推进速度更快。
OpenAI在报告结尾指出,这一实验再次提醒业界:基准测试的得分从来不是对模型能力的单纯衡量,它同时也反映了API配置、框架设计和提示策略等一系列不那么显眼的选择。对于开发者而言,在评估AI模型时,测试环境的设置与模型本身的能力同样值得重视。OpenAI建议在使用Responses API时,优先考虑启用推理保留与上下文压缩,以更准确地发挥模型的实际潜力。
要点
- 保留推理记忆使GPT-5.6 Sol无需每轮重新解析游戏,显著提升了跨步骤的策略连贯性与决策效率。
- 用上下文压缩替代滚动截断,让模型在长流程中保留更多关键历史信息,同时减少了输出token的消耗。
- 两项设置合并启用后,ARC-AGI-3公开集得分从13.3%升至38.3%,输出token减少约六倍,效率与效果双重提升。
- 基准测试得分不仅衡量模型能力,也深受API配置、框架设计和提示策略的影响,评估时需综合考量。
- OpenAI的Responses API通过传入上一次响应ID即可自动保留推理记忆,开发者可低成本复现生产级配置。
原始标题:How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。