# 菲尔兹奖得主称 ChatGPT 5.5 Pro 在无人帮助下两小时内完成"博士级"数学研究

- 来源：The Decoder：AI News（RSS）
- 作者：Matthias Bastian
- 发布时间：2026-05-09 22:32
- AIHOT 分数：82
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmoyh118d09uqsllhfwv7ggxu
- 原文链接：https://the-decoder.com/fields-medalist-says-chatgpt-5-5-pro-delivered-phd-level-math-research-in-under-two-hours-with-zero-human-help

## 精选理由

Gowers 让 ChatGPT 5.5 Pro 独立改进了一个数论开放问题，关键步骤被 MIT 研究者评价为完全原创——AI 做研究的门槛第一次被菲尔兹奖得主亲自认证了。

## AI 摘要

菲尔兹奖得主蒂莫西·高尔斯让 ChatGPT 5.5 Pro 尝试解决数论中的开放性问题。该模型在不到一小时内，将一个问题中的指数界限改进为多项式界限。一位参与的 MIT 研究员认为其核心想法“完全具有原创性”。高尔斯总结指出，未来数学贡献的门槛将变为证明某些是大语言模型无法完成的工作。

## 正文

英国数学家蒂莫西·高尔斯让 ChatGPT 5.5 Pro 挑战数论中的未解难题。该模型显著改进了某个现有的数学界值。参与其中的一位初级研究员称，该模型的核心思路“完全原创”。

菲尔兹奖得主蒂莫西·高尔斯在其博客中写道，ChatGPT 5.5 Pro 产出了一项达到博士水平的数学研究，而他本人的数学贡献为零。模型在不到两小时内完成了全部工作。高尔斯写道：“我甚至没有在提示词上做什么巧妙处理。”

这位数学家现任法兰西公学院组合数学讲席教授，同时也是剑桥大学三一学院院士。他将数论学家梅尔·纳桑森论文中的未解问题输入给模型。该论文探讨了某些整数和集合的可能大小，以及如何高效构造具有特定性质的集合。

ChatGPT 5.5 Pro 在 17 分钟内破解了一个未解数学难题

纳桑森曾为其中一个问题证明了一个指数级界值，并询问能否加以改进。据高尔斯称，ChatGPT 5.5 Pro 思考了 17 分 5 秒，随后给出了一个具有二次界值的最优构造。其核心思路是：模型将纳桑森证明中的某个组件替换成了一个更高效的变体，该变体在组合数学中广为人知，但将其应用于这个特定问题并不显而易见。

在被要求后，ChatGPT 在 2 分 23 秒内将论证改写为一份 LaTeX 预印本。高尔斯核对了其正确性，随后让模型求解一个相关的变体问题，模型毫无困难地完成了。两项结果均已作为预印本发布。

该问题的一个泛化版本则困难得多。此前，麻省理工学院学生艾萨克·拉贾戈帕尔已有相关研究，他证明了一个指数级依赖关系。高尔斯将拉贾戈帕尔的论文交给 ChatGPT，并要求其做出改进。

随后是一场逐步升级的过程：在 16 分 41 秒后，模型给出了第一项改进。拉贾戈帕尔判定这一步是正确的，但称这只是对自己工作的常规修改。高尔斯随后，用他自己的话说，“变得贪心起来”，要求 ChatGPT 尝试得到一个强得多的界值。

经过 13 分 33 秒，该模型表达了乐观态度，但表示仍有两项技术性陈述需要核查。又过了 9 分 12 秒，核查完成。最终预印本在 31 分 40 秒内准备就绪。该模型将边界条件从指数级改进为多项式级。

"这种思路，我沉思一两周后能想出来都会非常自豪"

据高尔斯称，拉贾戈帕尔宣布这些结果"几乎可以确定是正确的"，无论是在单个证明步骤层面，还是在底层思路层面。

拉贾戈帕尔的评价颇为细致：第一项改进是对他自己工作的"常规修改"。而将边界改进为多项式级，则"相当令人印象深刻"。

拉贾戈帕尔称该模型的核心思路"相当巧妙"。它找到了一种反直觉的方法来压缩某些代数结构，使其能够适配到更小的数值范围内，同时又不丧失其关键的组合学特性。

"这种思路，我沉思一两周后能想出来都会非常自豪，而 ChatGPT 用了不到一小时就找到并证明了它，采用的方法与我自己的证明类似，"拉贾戈帕尔写道。据他所知，这个思路"完全是原创的"。

数学家们的新门槛，现在是证明大语言模型无法证明的东西

高尔斯将这一成果定位在"组合学博士论文中一个完全合理的章节"水平，并指出这并非一个"惊人的成果"，因为它很大程度上建立在拉贾戈帕尔的思路之上，但"无疑是一个非平凡的扩展"。高尔斯表示，对于一名博士生来说，要研读拉贾戈帕尔的论文、找出薄弱环节并调整相关技术，需要花费相当长的时间。

他得出了意义深远的结论："为数学做出贡献的门槛，现在将是证明大语言模型无法证明的东西，而不仅仅是证明一个迄今无人证明过、且至少有人觉得有趣的东西。"不过他也做了限定：博士生可以将大语言模型作为工具使用。真正的任务将在于，与大语言模型协作创造出模型独自无法完成的东西。

高尔斯提出了一个思想实验：“假设一位数学家通过与一个大语言模型进行长时间交流，解决了一个重大难题。在此过程中，数学家扮演了有用的引导角色，但大语言模型完成了所有技术工作并提出了主要思路。我们还会认为这是数学家的重大成就吗？我认为不会。”

尽管如此，他仍然看到了亲自钻研数学的价值。那些独立解决过难题的人，能够获得对解题过程的深刻见解，这是单纯阅读无法得到的。“正如非常优秀的程序员比不那么优秀的程序员更擅长‘氛围编程’，”高尔斯写道。他的预测是：任何今天开始攻读博士学位、最早在2029年完成学业的人，届时都会看到数学研究“变得面目全非”。

这与著名数学家陶哲轩的愿景不谋而合。陶哲轩描述了一种由AI工具驱动的“工业化规模数学”，即由AI支持的大型团队开展广泛的研究，而不是由孤胆英雄在狭窄的问题上钻研多年。

不过，当时陶哲轩将AI模型比作“水平平庸，但并非完全无能”的研究助手。高尔斯使用ChatGPT 5.5 Pro的经验表明，这一评价可能已经过时了。陶哲轩最近的评论也积极得多。

生成式AI正不断深入数学领域

AI在数学研究中的一个早期例子，是将GPT-5用作研究工具。OpenAI的研究人员声称，一个GPT模型“找到了”一个Erdos问题的解法。实际上，该AI只是在现有文献中找到了一个已有的解法，并没有提出自己的证明。

据陶哲轩称，一个明显的飞跃出现在GPT-5.2 Pro“或多或少自主地”解决了Erdos问题#728。在现有文献中找不到相应的解法。随后，GPT-5.4 Pro更进一步，解决了一个长期悬而未决的Erdos开放问题。

其他领域也取得了进展。2025年12月，一位物理学家发表了一篇论文，其核心思想来自GPT-5。作者预计，在数学、物理学及其他形式科学领域，人机混合协作模式不久将成为常态。随着大语言模型日益精准，它们将越来越能充当自主研究智能体。

为何贸然下结论是危险的

Google DeepMind 在其 AI 智能体 Aletheia 上既看到了突破，也观察到了令人警醒的失败率。该系统基于 Gemini Deep Think 构建，独立撰写了一篇数学论文，推翻了一个存在数十年的假设，并发现了一篇密码学论文中的错误。但当研究人员在 700 个开放数学问题上对其进行系统测试时，其答案中仅有 6.5% 是可用的。

陶哲轩一直在强调类似的观点。他指出，Erdős 问题的难度存在“数个数量级”的差异。一个存在了 50 年的问题被 AI 解决，并不意味着它半个世纪以来一直难倒所有人类。很多时候，根本没有人认真尝试过解决它。
