AI资讯 / 产业

产业 / 媒体

OpenAI 称 GPT-5.6 Sol Ultra 一小时内攻克五十年悬而未决数学猜想

The Decoder

OpenAI 宣布旗下 GPT-5.6 Sol Ultra 模型在不到一小时内,利用 64 个并行子智能体,为悬而未决近五十年的图论难题“循环双重覆盖猜想”生成了完整证明。曼彻斯特大学数学家 Thomas Bloom 认为该证明短小、基础,本可在 1980 年代被发现,关键在于机器不放弃的“坚持”。他同时批评 OpenAI 论文未引用 1983 年 Bermond 等人的相关文献,质疑其究竟是真正创新还是对既有知识的重新组合。该事件再次引发关于推理模型本质的争论。

OpenAI 近日宣布,旗下新模型 GPT-5.6 Sol Ultra 在不到一小时内生成了图论难题“循环双重覆盖猜想”的完整证明,整个过程由 64 个子智能体并行完成。论文本身则由稍早版本 GPT-5.6 Sol 撰写。该猜想由多位数学家在 1970 年代独立提出,核心问题是:在任意由顶点和边构成的网络中,是否总能找到一组环路,使每条边恰好被经过两次。半个世纪以来,研究者只取得部分特殊情形的进展,从未出现被广泛接受的通解。

曼彻斯特大学数学家 Thomas Bloom 对证明本身给予积极评价,称其“非常漂亮”,并指出解法“短小、基础,本可在 1980 年代被发现”,无需引入新数学理论,只是巧妙地组合了已有工具。Bloom 认为人类未能更早突破的原因在于思路上的小障碍:人尝试常规路径失败后往往会放弃,而 AI 不会气馁,会不断尝试微小变体直到找到突破口。这种不知疲倦的“机械式坚持”被 Bloom 视为本次突破的关键。

在肯定证明质量的同时,Bloom 重点批评了 OpenAI 论文在学术规范上的缺陷。他指出,核心数学思路至少可追溯至 1983 年 Bermond、Jackson 与 Jaeger 的工作,但 OpenAI 论文对此只字未提,容易让读者误以为模型独立发明了整套策略。Bloom 表示,AI 模型解决数学问题的第一反应往往是检索并阅读所有相关论文,但生成论文时却常常不给出引用,这已成为 AI 撰写学术内容的通病。

围绕这一事件,更深层的争议是:推理模型究竟只是在重组既有知识,还是能产出真正的新东西?Bloom 倾向于前者。他将此次突破与 OpenAI 此前解出的“单位距离猜想”类比,认为两者都属于“解起来比预想容易得多”的开放问题,关键只在于耐心与信念。他还预期未来会有更多此类猜想被 AI 破解,但同时强调,这类问题可能只占未解难题的一小部分,且事先难以分辨。

OpenAI 在此次任务中还展示了高度工程化的提示词设计。提示首先要求模型假设完整证明一定存在,并禁止其上网查询猜想是否已被解决或宣称该猜想未解,同时明确拒绝把“部分结果、归约到其他猜想、综述或问题为何困难”等作为答复。多数子智能体被刻意隔离以鼓励独立探索,对抗型智能体则按详尽错误清单逐项校验候选证明,例如识别被误标的环路或归约中新生成的“桥”。系统被要求至少计算八小时才可宣告放弃,最终一小时即完成任务。

要点

  • GPT-5.6 Sol Ultra 在一小时内借助 64 个并行子智能体,为悬而未决五十年的循环双重覆盖猜想给出完整证明。
  • 数学家 Thomas Bloom 评价证明短小、基础,本可在 1980 年代被发现,关键优势在于 AI 不放弃的持续尝试。
  • Bloom 批评 OpenAI 论文未引用 1983 年 Bermond 等人的相关工作,指出 AI 论文缺乏引用的现象十分普遍。
  • 该事件再次引发“AI 是重组既有知识还是真正创新”的争论,Bloom 本次倾向于前者。
  • OpenAI 通过高度结构化的提示词与对抗验证机制,把“假设证明存在、禁止查询、不接受部分结果”作为解题前提。
查看原始来源

原始标题:OpenAI's GPT-5.6 Sol Ultra reportedly solves a 50-year-old math problem in under an hour

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。