The Decoder:AI News(RSS)
精选
82AI 编辑部评分,满分 100

菲尔兹奖得主称 ChatGPT 5.5 Pro 在无人帮助下两小时内完成"博士级"数学研究

2026-05-09 22:32· 93天前· Matthias Bastian
AI 导读

菲尔兹奖得主蒂莫西·高尔斯让 ChatGPT 5.5 Pro 尝试解决数论中的开放性问题。该模型在不到一小时内,将一个问题中的指数界限改进为多项式界限。一位参与的 MIT 研究员认为其核心想法“完全具有原创性”。高尔斯总结指出,未来数学贡献的门槛将变为证明某些是大语言模型无法完成的工作。

推荐理由

Gowers 让 ChatGPT 5.5 Pro 独立改进了一个数论开放问题,关键步骤被 MIT 研究者评价为完全原创——AI 做研究的门槛第一次被菲尔兹奖得主亲自认证了。

正文 · AI 翻译
Image description

英国数学家蒂莫西·高尔斯让 ChatGPT 5.5 Pro 挑战数论中的未解难题。该模型显著改进了某个现有的数学界值。参与其中的一位初级研究员称,该模型的核心思路“完全原创”。

菲尔兹奖得主蒂莫西·高尔斯在其博客中写道,ChatGPT 5.5 Pro 产出了一项达到博士水平的数学研究,而他本人的数学贡献为零。模型在不到两小时内完成了全部工作。高尔斯写道:“我甚至没有在提示词上做什么巧妙处理。”

这位数学家现任法兰西公学院组合数学讲席教授,同时也是剑桥大学三一学院院士。他将数论学家梅尔·纳桑森论文中的未解问题输入给模型。该论文探讨了某些整数和集合的可能大小,以及如何高效构造具有特定性质的集合。

ChatGPT 5.5 Pro 在 17 分钟内破解了一个未解数学难题

纳桑森曾为其中一个问题证明了一个指数级界值,并询问能否加以改进。据高尔斯称,ChatGPT 5.5 Pro 思考了 17 分 5 秒,随后给出了一个具有二次界值的最优构造。其核心思路是:模型将纳桑森证明中的某个组件替换成了一个更高效的变体,该变体在组合数学中广为人知,但将其应用于这个特定问题并不显而易见。

在被要求后,ChatGPT 在 2 分 23 秒内将论证改写为一份 LaTeX 预印本。高尔斯核对了其正确性,随后让模型求解一个相关的变体问题,模型毫无困难地完成了。两项结果均已作为预印本发布。

该问题的一个泛化版本则困难得多。此前,麻省理工学院学生艾萨克·拉贾戈帕尔已有相关研究,他证明了一个指数级依赖关系。高尔斯将拉贾戈帕尔的论文交给 ChatGPT,并要求其做出改进。

随后是一场逐步升级的过程:在 16 分 41 秒后,模型给出了第一项改进。拉贾戈帕尔判定这一步是正确的,但称这只是对自己工作的常规修改。高尔斯随后,用他自己的话说,“变得贪心起来”,要求 ChatGPT 尝试得到一个强得多的界值。

经过 13 分 33 秒,该模型表达了乐观态度,但表示仍有两项技术性陈述需要核查。又过了 9 分 12 秒,核查完成。最终预印本在 31 分 40 秒内准备就绪。该模型将边界条件从指数级改进为多项式级。

"这种思路,我沉思一两周后能想出来都会非常自豪"

据高尔斯称,拉贾戈帕尔宣布这些结果"几乎可以确定是正确的",无论是在单个证明步骤层面,还是在底层思路层面。

拉贾戈帕尔的评价颇为细致:第一项改进是对他自己工作的"常规修改"。而将边界改进为多项式级,则"相当令人印象深刻"。

拉贾戈帕尔称该模型的核心思路"相当巧妙"。它找到了一种反直觉的方法来压缩某些代数结构,使其能够适配到更小的数值范围内,同时又不丧失其关键的组合学特性。

"这种思路,我沉思一两周后能想出来都会非常自豪,而 ChatGPT 用了不到一小时就找到并证明了它,采用的方法与我自己的证明类似,"拉贾戈帕尔写道。据他所知,这个思路"完全是原创的"。

数学家们的新门槛,现在是证明大语言模型无法证明的东西

高尔斯将这一成果定位在"组合学博士论文中一个完全合理的章节"水平,并指出这并非一个"惊人的成果",因为它很大程度上建立在拉贾戈帕尔的思路之上,但"无疑是一个非平凡的扩展"。高尔斯表示,对于一名博士生来说,要研读拉贾戈帕尔的论文、找出薄弱环节并调整相关技术,需要花费相当长的时间。

他得出了意义深远的结论:"为数学做出贡献的门槛,现在将是证明大语言模型无法证明的东西,而不仅仅是证明一个迄今无人证明过、且至少有人觉得有趣的东西。"不过他也做了限定:博士生可以将大语言模型作为工具使用。真正的任务将在于,与大语言模型协作创造出模型独自无法完成的东西。

高尔斯提出了一个思想实验:“假设一位数学家通过与一个大语言模型进行长时间交流,解决了一个重大难题。在此过程中,数学家扮演了有用的引导角色,但大语言模型完成了所有技术工作并提出了主要思路。我们还会认为这是数学家的重大成就吗?我认为不会。”

尽管如此,他仍然看到了亲自钻研数学的价值。那些独立解决过难题的人,能够获得对解题过程的深刻见解,这是单纯阅读无法得到的。“正如非常优秀的程序员比不那么优秀的程序员更擅长‘氛围编程’,”高尔斯写道。他的预测是:任何今天开始攻读博士学位、最早在2029年完成学业的人,届时都会看到数学研究“变得面目全非”。

这与著名数学家陶哲轩的愿景不谋而合。陶哲轩描述了一种由AI工具驱动的“工业化规模数学”,即由AI支持的大型团队开展广泛的研究,而不是由孤胆英雄在狭窄的问题上钻研多年。

不过,当时陶哲轩将AI模型比作“水平平庸,但并非完全无能”的研究助手。高尔斯使用ChatGPT 5.5 Pro的经验表明,这一评价可能已经过时了。陶哲轩最近的评论也积极得多。

生成式AI正不断深入数学领域

AI在数学研究中的一个早期例子,是将GPT-5用作研究工具。OpenAI的研究人员声称,一个GPT模型“找到了”一个Erdos问题的解法。实际上,该AI只是在现有文献中找到了一个已有的解法,并没有提出自己的证明。

据陶哲轩称,一个明显的飞跃出现在GPT-5.2 Pro“或多或少自主地”解决了Erdos问题#728。在现有文献中找不到相应的解法。随后,GPT-5.4 Pro更进一步,解决了一个长期悬而未决的Erdos开放问题。

其他领域也取得了进展。2025年12月,一位物理学家发表了一篇论文,其核心思想来自GPT-5。作者预计,在数学、物理学及其他形式科学领域,人机混合协作模式不久将成为常态。随着大语言模型日益精准,它们将越来越能充当自主研究智能体。

为何贸然下结论是危险的

Google DeepMind 在其 AI 智能体 Aletheia 上既看到了突破,也观察到了令人警醒的失败率。该系统基于 Gemini Deep Think 构建,独立撰写了一篇数学论文,推翻了一个存在数十年的假设,并发现了一篇密码学论文中的错误。但当研究人员在 700 个开放数学问题上对其进行系统测试时,其答案中仅有 6.5% 是可用的。

陶哲轩一直在强调类似的观点。他指出,Erdős 问题的难度存在“数个数量级”的差异。一个存在了 50 年的问题被 AI 解决,并不意味着它半个世纪以来一直难倒所有人类。很多时候,根本没有人认真尝试过解决它。

来源:The Decoder:AI News(RSS) · the-decoder.com

菲尔兹奖得主称 ChatGPT 5.5 Pro 在无人帮助下两小时内完成"博士级"数学研究

The Decoder:AI News(RSS)·2026-05-09 22:32·93天前·Matthias Bastian
AI 导读

菲尔兹奖得主蒂莫西·高尔斯让 ChatGPT 5.5 Pro 尝试解决数论中的开放性问题。该模型在不到一小时内,将一个问题中的指数界限改进为多项式界限。一位参与的 MIT 研究员认为其核心想法“完全具有原创性”。高尔斯总结指出,未来数学贡献的门槛将变为证明某些是大语言模型无法完成的工作。

正文 · AI 翻译
Image description

英国数学家蒂莫西·高尔斯让 ChatGPT 5.5 Pro 挑战数论中的未解难题。该模型显著改进了某个现有的数学界值。参与其中的一位初级研究员称,该模型的核心思路“完全原创”。

菲尔兹奖得主蒂莫西·高尔斯在其博客中写道,ChatGPT 5.5 Pro 产出了一项达到博士水平的数学研究,而他本人的数学贡献为零。模型在不到两小时内完成了全部工作。高尔斯写道:“我甚至没有在提示词上做什么巧妙处理。”

这位数学家现任法兰西公学院组合数学讲席教授,同时也是剑桥大学三一学院院士。他将数论学家梅尔·纳桑森论文中的未解问题输入给模型。该论文探讨了某些整数和集合的可能大小,以及如何高效构造具有特定性质的集合。

ChatGPT 5.5 Pro 在 17 分钟内破解了一个未解数学难题

纳桑森曾为其中一个问题证明了一个指数级界值,并询问能否加以改进。据高尔斯称,ChatGPT 5.5 Pro 思考了 17 分 5 秒,随后给出了一个具有二次界值的最优构造。其核心思路是:模型将纳桑森证明中的某个组件替换成了一个更高效的变体,该变体在组合数学中广为人知,但将其应用于这个特定问题并不显而易见。

在被要求后,ChatGPT 在 2 分 23 秒内将论证改写为一份 LaTeX 预印本。高尔斯核对了其正确性,随后让模型求解一个相关的变体问题,模型毫无困难地完成了。两项结果均已作为预印本发布。

该问题的一个泛化版本则困难得多。此前,麻省理工学院学生艾萨克·拉贾戈帕尔已有相关研究,他证明了一个指数级依赖关系。高尔斯将拉贾戈帕尔的论文交给 ChatGPT,并要求其做出改进。

随后是一场逐步升级的过程:在 16 分 41 秒后,模型给出了第一项改进。拉贾戈帕尔判定这一步是正确的,但称这只是对自己工作的常规修改。高尔斯随后,用他自己的话说,“变得贪心起来”,要求 ChatGPT 尝试得到一个强得多的界值。

经过 13 分 33 秒,该模型表达了乐观态度,但表示仍有两项技术性陈述需要核查。又过了 9 分 12 秒,核查完成。最终预印本在 31 分 40 秒内准备就绪。该模型将边界条件从指数级改进为多项式级。

"这种思路,我沉思一两周后能想出来都会非常自豪"

据高尔斯称,拉贾戈帕尔宣布这些结果"几乎可以确定是正确的",无论是在单个证明步骤层面,还是在底层思路层面。

拉贾戈帕尔的评价颇为细致:第一项改进是对他自己工作的"常规修改"。而将边界改进为多项式级,则"相当令人印象深刻"。

拉贾戈帕尔称该模型的核心思路"相当巧妙"。它找到了一种反直觉的方法来压缩某些代数结构,使其能够适配到更小的数值范围内,同时又不丧失其关键的组合学特性。

"这种思路,我沉思一两周后能想出来都会非常自豪,而 ChatGPT 用了不到一小时就找到并证明了它,采用的方法与我自己的证明类似,"拉贾戈帕尔写道。据他所知,这个思路"完全是原创的"。

数学家们的新门槛,现在是证明大语言模型无法证明的东西

高尔斯将这一成果定位在"组合学博士论文中一个完全合理的章节"水平,并指出这并非一个"惊人的成果",因为它很大程度上建立在拉贾戈帕尔的思路之上,但"无疑是一个非平凡的扩展"。高尔斯表示,对于一名博士生来说,要研读拉贾戈帕尔的论文、找出薄弱环节并调整相关技术,需要花费相当长的时间。

他得出了意义深远的结论:"为数学做出贡献的门槛,现在将是证明大语言模型无法证明的东西,而不仅仅是证明一个迄今无人证明过、且至少有人觉得有趣的东西。"不过他也做了限定:博士生可以将大语言模型作为工具使用。真正的任务将在于,与大语言模型协作创造出模型独自无法完成的东西。

高尔斯提出了一个思想实验:“假设一位数学家通过与一个大语言模型进行长时间交流,解决了一个重大难题。在此过程中,数学家扮演了有用的引导角色,但大语言模型完成了所有技术工作并提出了主要思路。我们还会认为这是数学家的重大成就吗?我认为不会。”

尽管如此,他仍然看到了亲自钻研数学的价值。那些独立解决过难题的人,能够获得对解题过程的深刻见解,这是单纯阅读无法得到的。“正如非常优秀的程序员比不那么优秀的程序员更擅长‘氛围编程’,”高尔斯写道。他的预测是:任何今天开始攻读博士学位、最早在2029年完成学业的人,届时都会看到数学研究“变得面目全非”。

这与著名数学家陶哲轩的愿景不谋而合。陶哲轩描述了一种由AI工具驱动的“工业化规模数学”,即由AI支持的大型团队开展广泛的研究,而不是由孤胆英雄在狭窄的问题上钻研多年。

不过,当时陶哲轩将AI模型比作“水平平庸,但并非完全无能”的研究助手。高尔斯使用ChatGPT 5.5 Pro的经验表明,这一评价可能已经过时了。陶哲轩最近的评论也积极得多。

生成式AI正不断深入数学领域

AI在数学研究中的一个早期例子,是将GPT-5用作研究工具。OpenAI的研究人员声称,一个GPT模型“找到了”一个Erdos问题的解法。实际上,该AI只是在现有文献中找到了一个已有的解法,并没有提出自己的证明。

据陶哲轩称,一个明显的飞跃出现在GPT-5.2 Pro“或多或少自主地”解决了Erdos问题#728。在现有文献中找不到相应的解法。随后,GPT-5.4 Pro更进一步,解决了一个长期悬而未决的Erdos开放问题。

其他领域也取得了进展。2025年12月,一位物理学家发表了一篇论文,其核心思想来自GPT-5。作者预计,在数学、物理学及其他形式科学领域,人机混合协作模式不久将成为常态。随着大语言模型日益精准,它们将越来越能充当自主研究智能体。

为何贸然下结论是危险的

Google DeepMind 在其 AI 智能体 Aletheia 上既看到了突破,也观察到了令人警醒的失败率。该系统基于 Gemini Deep Think 构建,独立撰写了一篇数学论文,推翻了一个存在数十年的假设,并发现了一篇密码学论文中的错误。但当研究人员在 700 个开放数学问题上对其进行系统测试时,其答案中仅有 6.5% 是可用的。

陶哲轩一直在强调类似的观点。他指出,Erdős 问题的难度存在“数个数量级”的差异。一个存在了 50 年的问题被 AI 解决,并不意味着它半个世纪以来一直难倒所有人类。很多时候,根本没有人认真尝试过解决它。

来源:The Decoder:AI News(RSS)· the-decoder.com