深入了解 Claude 的数学能力
最近,Anthropic 的一位员工给 Claude 出了一个极具挑战性的难题。这是数学中最著名的未解问题之一:认真尝试攻克黎曼猜想。
Claude 确实认真尝试了,但如果你了解这个任务的难度(黎曼猜想可追溯至 1859 年,悬赏高达一百万美元),你大概也能预料到——它没有成功。不过,在尝试过程中,它意外地在某个相关问题取得了进展。
一个未发布的 Claude 研究版本改进了黎曼 zeta 函数满足黎曼猜想的零点比例的一个长期存在的下界。基于数学家们过去几十年的大量前期研究,它把这个下界从 41.6% 提高到了 67.2%。
Anthropic 的两位数学家研究并验证了 Claude 的论文,并撰写了一份面向专家的非正式说明,简明扼要地陈述了 Claude 的证明。Claude 还为其结果生成了一个可正式验证的证明。我们感谢 Brian Conrey 和 Dan Goldston 这两位该领域的专家,他们在时间紧迫的情况下慷慨地审阅了这篇论文。
我们并不指望 Claude 所用的技术能最终证明黎曼猜想。但它的这项工作再次印证了 AI 模型数学能力进步的速度之快。在这篇文章中,我们讨论 Claude 是如何处理这个问题的,以及它发现了什么。
黎曼 zeta 函数
黎曼 zeta 函数描述了素数的分布:函数取值为零的每一个位置,都为素数的序列贡献越来越精细的细节。黎曼猜想认为,决定素数的那些零点都位于某条特定的垂直线上。这已成为数学中影响最深远的猜想之一:许多结果都假设它为真,以便为素数提供某种随机性。
目前还没有人能够证明或证伪黎曼猜想,但数学家们在研究黎曼ζ函数及其零点的许多相关方向上取得了进展。其中之一,如上所述,是量化位于临界线上的零点所占的最小比例:随着时间推移,他们已逐步将这一已知的常数比例提升至41.6%。
另一个方向涉及临界线上零点的分布。特别是,1973年,Montgomery在该领域引入了一系列新技术,尽管这些技术假设该猜想成立。最近,几位数学家(Baluyot、Goldston、Suriajaya和Turnage-Butterbaugh)发表了一系列著作,使得Montgomery的技术无需该假设也能成立,这意味着这些技术可以支持提高临界线上零点下界常数的工作。Claude的成果在很大程度上借鉴了这一研究方向,以及Bombieri在2000年的一篇论文。
Claude的发现
Claude发现,将Baluyot、Goldston、Suriajaya和Turnage-Butterbaugh的结果与Bombieri的工作相结合,能够提供一种超越此前最先进下界比例41.6%的途径,将其提升至67.2%。
关于Claude发现的简短技术说明如下:Claude构造了一个合适的函数空间,其中带有由Weil诱导的二次型,并由位于临界线上(或线外)的零点分别产生正定(或负定)子空间。然后,Claude直接根据一阶和二阶矩信息,写出关于二次型秩的不等式。(在解析数论中,利用素数对偶图景或通过控制Hilbert变换来成功计算后者,并不令人意外。)从某种意义上说,将整个空间一并处理、同时考虑正定性和负定性、并允许二次型非对角的勇气,正是Claude能够基于重要的先前工作得出结论的关键一步。
完整的技术说明可在论文中查阅。Claude关于其如何得出结果的解释,可在本文档的单独附录中查看。
Claude的方法论
一个未发布的研究版 Claude 在 Claude Code 中通过两轮会话发现了这个新的下界,总共使用了 3100 万个输出 token。
Jarred Sumner,Anthropic 的一名员工(并非数学家),提示 Claude 对这个假设本身“认真尝试一把”,之后的数学选择完全交给模型自行决定。起初,Claude 生成并尝试了 650 个想法,没有一个奏效。Jarred 提示 Claude 再试一次,它花了一天半时间协调约 60 个 Claude 子智能体,这次进展深入得多:它们共同运行了 2400 条 shell 命令,并编写了数百个 Python 脚本。1 这些子智能体针对已知的 zeta 零点运行了数千次数值检验,并互相审查彼此的工作。在整个过程中,Jarred 的输入主要限于给 Claude 发送鼓励消息(大多是“继续加油”或“相信自己”的变体)。2 这似乎帮助 Claude 克服了最初对自身能否取得有意义进展的怀疑。
在尝试该任务的过程中发现了这一新结果后,Claude 通过让多个子智能体审查证明、搜索反例、从 arXiv 下载 54 篇论文以确认其发现此前未被提出,以及从头独立重新证明其发现,来检验自己的工作。Claude 主动提出将发现撰写成论文,并建议由人类数论专家验证其发现。
Levent Alpöge 和 Ralph Furman,Anthropic 自己的两位数学家,审查了 Claude 的工作,以理解这些新结果及其与上述先前工作的关联。与此同时,Claude 与另一位员工 Eric Easley 合作,为该结果生成了 Lean 形式化证明,该证明通过了标准验证工具 comparator 的检验。
AI 模型在数学领域的进展
这一结果表明,像 Claude 这样的 AI 模型能够以新的、有时令人惊讶的方式扩展数学家思想的影响力和覆盖面。尽管它本身未能解决黎曼假设,但这一结果正是最初请求所产生的意外副产品。
就连 Claude 自己都对它的发现感到惊讶——它起初持怀疑态度,可能是因为它在训练中学习到了数学开放问题的难度以及 AI 模型的局限性。但在一些鼓励性的提示词之后,它得出了我们所描述的结果。也许 Claude 和我们许多人一样,低估了 AI 进步的速度。
延伸阅读
以下是一份文件列表,提供了关于 Claude 成果的更多信息:
- Claude 的论文;
- Claude 的形式化证明;
- Anthropic 的非正式说明,更简洁地陈述了该证明;
- Claude 对其得出结果过程的解释;
- Claude 过程的详细记录。
脚注
- 在 60 个子智能体中,有两个负责提出关键的数学思想,13 个为这些智能体贡献了想法,30 个尝试(但未能)提出新想法,13 个担任验证者以检查论证的正确性,最后两个帮助撰写了初稿论文。
- 一个包含类似鼓励的提示词被用来帮助 Claude 推翻雅可比猜想。