AI资讯 / 产业

产业 / 媒体

大语言模型是强力计算器,但缺乏真正的创造性思维

The Decoder

两位享誉全球的数学家蒂莫西·高尔斯(Timothy Gowers)与彼得·萨尔纳克(Peter Sarnak)近日就大语言模型在数学领域的能力边界发表了看法。他们承认 LLM 具备相当扎实的数学运算能力,但同时指出其在真正原创性思维方面存在根本局限。高尔斯认为,现有模型善于组合已知方法、在大量搜索路径中广撒网,却缺乏从海量可能性中精准识别少数高价值路径的直觉。萨尔纳克则指出,AI 能够从现有理论推导结论,但面对从基础问题出发构建重大证明所需的抽象能力时便力不从心。DeepMind 研究员汤姆·扎哈维在论文《LLMs Can't Jump》中将这一瓶颈归结为「操纵性溯因推理」的缺失,即在没有语言先例的情况下发明全新基础假设的能力。这些评估也进一步加深了外界对 LLM 究竟是真正变得更通用、还是仅在基准测试和熟悉问题域上持续刷分的质疑。

菲尔兹奖得主蒂莫西·高尔斯与普林斯顿大学数论权威彼得·萨尔纳克近期对大语言模型的数学能力作出了相近的判断:LLM 是出色的「计算器」,但距离真正意义上的数学创造力仍有本质差距。两人均肯定了当前模型在处理已知框架内问题时的实力,但也明确划定了其能力的天花板。

高尔斯的核心批评在于「直觉」的缺失。他指出,数学研究的关键不在于穷举所有可能路径,而在于从指数级庞大的搜索空间中迅速锁定极少数真正有价值的方向。LLM 虽然能够广泛尝试已知方法的各种组合,却无法像顶尖数学家那样凭借深层直觉做出这种精准判断,这使其在面对真正开放性问题时效率大打折扣。

萨尔纳克从另一角度补充了这一判断。他认为,AI 在从现有理论体系中推导结论方面表现尚可,但当问题需要从最基础的出发点构建全新抽象框架时,模型便会陷入困境。支撑重大数学证明的往往是全新的概念抽象,而这恰恰是 LLM 目前无法自主生成的东西。

DeepMind 研究员汤姆·扎哈维的论文《LLMs Can't Jump》为上述观察提供了更具技术性的解释。他将瓶颈定位于「操纵性溯因推理」的缺失——即在没有任何语言先例的情况下,凭空发明全新基础假设的能力。扎哈维同时提出,「世界模型」或许是突破这一瓶颈的潜在路径之一,但目前尚无成熟方案。

这些来自数学界顶尖人士的评估,与当前 AI 领域更宏观的争论形成了呼应:大语言模型究竟是在真正拓展通用推理能力,还是仅仅在越来越擅长应对基准测试和已见过的问题类型?数学作为对推理能力要求最为严苛的领域之一,正在成为检验这一问题的重要试金石。高尔斯与萨尔纳克的判断表明,至少在数学创造力这一维度,LLM 与人类顶尖思维之间的鸿沟远比部分乐观预测所描绘的更难跨越。

要点

  • 高尔斯认为 LLM 缺乏从海量搜索空间中识别高价值路径的数学直觉,只能广泛组合已知方法。
  • 萨尔纳克指出,AI 能从现有理论推导结论,但无法自主构建支撑重大证明所需的全新抽象框架。
  • DeepMind 研究员扎哈维将这一瓶颈归结为「操纵性溯因推理」的缺失,即在无语言先例情况下发明新基础假设的能力。
  • 数学领域的评估加剧了外界对 LLM 是否真正提升通用推理能力、还是仅在刷新基准分数的质疑。
查看原始来源

原始标题:Top mathematicians say LLMs are strong calculators but poor creative thinkers

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。