AI资讯 / 产业

产业 / 媒体

GPT-6 Astra数学能力登顶,但OpenAI说这并非刻意为之

The Decoder

OpenAI的GPT-6 Astra在ErdosBench开放数学问题榜单上暂居首位,共解决106道题目,其中43道完整求解,并推翻了另外27道题的既有结论。然而,OpenAI首席科学家Jakub Pachocki在其文章中明确表示,公司并未将数学研究列为优先方向,Astra的数学表现只是其他研发重心的附带成果。目前,OpenAI将资源集中投入递归自我改进(RSI)与自动化对齐研究,认为这是保持AI前沿地位的唯一路径。这一表态揭示了当前AI发展的深层逻辑:即便是顶尖实验室,也无法在所有方向同时实现最大化突破,能力的增长高度依赖定向优化。与此同时,数学界本身也在反思AI带来的冲击——如果模型产出证明的速度超过人类验证的速度,数学领域将面临从「证明稀缺」转向「证明过载」的根本性危机。

GPT-6 Astra发布后,在ulam.ai的ErdosBench榜单上一度位居第一。该榜单涵盖226道受著名数学家Erdős问题启发的开放性难题。Astra得分3.23,解决了106道题,其中43道完整求解,并推翻了另外27道题的结论。与此前的Sol模型相比,Astra在科学写作质量上更为出色,也更少出现夸大结论的情况,有时甚至低估了自身的成果。榜单开发者Przemek Chojecki将其评价为「在各项数学研究技能上取得了约5%至10%的稳健提升」。不过,Fable 5.1随后以3.25的得分将Astra挤下榜首。

令外界意外的是,OpenAI首席科学家Jakub Pachocki在其文章《一种异类思维》中坦承,公司本可以让Astra在数学研究上表现更强,但主动选择了放弃这一方向。他写道,公司感受到递归自我改进与自动化对齐研究的紧迫性,认为这是维持AI研究前沿地位的唯一途径,因此将资源集中于此。这意味着,当前最强的数学AI模型,并非定向优化的产物,而是其他研发优先级的副产品。

Pachocki的表态印证了AI发展路径中一个日益清晰的现象——研究者Adam Hunt将其描述为「尖刺型」轨迹。与「主流AGI」假设中模型能力全面均衡提升的图景不同,现实中的AI发展呈现出极度不均衡的特征:在编程、数学等特定领域极为突出,而在常识推理、语言质量或社会理解等方面则停滞甚至退步。这样的模型更接近高度专业化的工具,而非大多数人心目中的通用人工智能。

OpenAI将资源押注于递归自我改进,背后隐含着一个更大的赌注:一旦模型能够自主优化自身,便可在所有方向上实现跨越式提升,包括数学。然而,这一愿景目前仍停留在理论层面。批评者指出,语言模型缺乏类人创造力,难以实现真正意义上的自我改进,而非仅仅是在已有框架内的参数调整。这场关于AI能否突破自身局限的争论,将在很大程度上决定未来几年AI发展的实际走向。

数学界自身也在经历一场深刻的价值反思。数学家陶哲轩在2026年国际数学家大会上提出警示:如果AI模型产出证明的速度持续超过人类验证的速度,数学领域将面临从「证明稀缺」转向「证明过载」的根本性转变。届时,最关键的任务将不再是解决问题,而是判断哪些结果真正重要。陶哲轩将这场危机比作20世纪初数学基础的根本性动荡,认为数学界正在经历一场关于自身价值与实践方式的深层危机。

要点

  • GPT-6 Astra在ErdosBench数学榜单上暂居首位,但OpenAI首席科学家明确表示数学并非公司的优先研发方向,这一成绩是其他目标的副产品
  • OpenAI当前将核心资源投入递归自我改进与自动化对齐研究,认为这是保持前沿地位的唯一路径,体现了顶尖实验室在能力方向上的明确取舍
  • AI发展正呈现「尖刺型」轨迹,在特定领域极为突出,但无法在所有方向同时实现最大化突破,与通用人工智能的理想图景存在明显落差
  • 数学界面临AI带来的双重冲击:一方面是证明产出速度超越人类验证能力,另一方面是对语言模型能否实现真正数学创新的根本性质疑
查看原始来源

原始标题:GPT-6 Astra gives mathematicians a breather, and OpenAI says that's by design

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。