Gary Marcus:The Road to AI We Can Trust(RSS)
精选
66AI 编辑部评分,满分 100

OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

2026-08-03 05:25· 1小时前· Gary Marcus
跳到正文
精选理由

从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

AI 摘要

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。

正文 · AI 翻译

Astra,OpenAI 正在内部测试的一款新模型,确实令人惊叹。这一点无可否认:

第一部分:最大的谬误

但与此同时,一大批人——其中不乏相当有分量的人物——正在四处宣扬一种关于其影响的、存在严重缺陷的论点。

看看你能不能找出这个谬误。以下是从众多例子中挑出的三个。

另一条推文甚至声称“这个物种刚刚跨过了一道单向门槛”;埃隆·马斯克则将其视为我们已抵达奇点的证据。

他们每个人犯的本质上都是同一个错误。

这个谬误有名字,叫作“合成谬误”。

维基百科上关于它的词条里满是绝佳的例子;这里只列开头几个。

这个谬误在当前案例中的表现是什么?就是认为一个擅长某类数学问题的系统,就擅长所有数学、擅长科学,甚至很可能擅长一切。“AGI 临近”群体一次又一次地犯着同一个逻辑谬误。每次有进展出现,我都会看到同样的错误。

这个谬误是这样运作的。

1. 有人假装所有认知都是同等的。(完全不符合事实。)

2. 每当 AI 在某种(花哨的)认知形式上取得成功,他们就希望你相信,AI 在一切形式上的成功都近在眼前。

你不需要是认知心理学家也能看出这个推论根本不成立。比如我们都知道,数学方面的专长并不能保证在所有领域都成为天才。一个擅长数学、物理或编程的人,可能在写作或理解人际关系上很吃力(反过来,一个伟大的作家也可能不擅长数学,等等)。某一领域的专长完全不能保证在所有甚至大多数领域都具备专长。

这正是霍华德·加德纳和罗伯特·斯腾伯格等人提出多元智能理论的原因,也是 SAT 将数学和语文分开考试的原因,等等。

Astra 看起来——我们还没有看到其方法论——在数学方面表现出色,或者至少在某些形式的数学上如此,但这并不意味着它能避免模型幻觉,或解决其他生成式 AI 系统存在的可靠性问题。这甚至不意味着它能可靠地阅读 PDF。也不意味着它将成为第一个能够遵守硬性规则的生成式 AI。(这应该让你感到恐惧。)

特别是,Astra 显然擅长某些问题;但这并不意味着它在难以形式化的问题上会表现出色,甚至不一定能胜任。这并不意味着它会神奇。这并不意味着它是 AGI 或 ASI 或任何类似的东西。

它*非常*令人印象深刻。但我看不出任何理由认为 Astra 是 AGI,更不用说 ASI 了。如果它能在我和 Miles Brundage 的 2024 年赌注中拿到 5/10 的分数,我会感到惊讶。

第二部分。有一个重要的、原则性的理由认为,数学上的成功是一个特例,不会像人们可能希望的那样广泛推广。

如果(a)这种谬误不是极其普遍,并且(b)我不认为有非常充分的理由认为这种谬误适用于此,我就不会花这么长的篇幅来讨论它。

数学成为这些模型大放异彩的领域并非偶然。数学适合两件事:验证(使用符号工具),以及大规模廉价生成的合成数据,在这些数据中你可以保证答案是正确的。编码也是如此——但一般来说并非如此。你可以生成任意多的数学事实;你无法模拟开放式的世界。你可以验证数学;你无法以同样的方式验证军事战略。

这并非新闻。我至少从 2025 年 1 月起就一直在指出这一点【第一行本应说编码和数学】,呼应了 Ernie Davis 和我在 2019 年关于围棋(以及为什么 AlphaGo 不会是万能灵药)所说的:

OpenAI 能做到 Astra 在数学方面所做的事情,是因为数学允许使用外部工具进行验证并创建合成数据。

这并不会让 Astra 显得不那么令人印象深刻,但正如十年前我们从 IBM 那次混乱且最终失败的尝试中学到的——它试图把赢得《危险边缘》的 Watson 改造成一台攻克癌症的机器——在一个领域取得成功并不能保证在所有领域都能成功。

OpenAI 在这里所处理的数学,与许多(也许是大多数)现实世界问题有着根本性的不同;在那些问题中,验证既不能保证解决方案,也无法让人几乎零成本地无限生成训练数据。

指望它成为万能溶剂,只能说明你并不理解这个基本事实。

第三部分:关于 Astra 还需要了解的七件事

  1. 昨天的推文和博客是营销,不是科学。这两者,连同随附的 249 页数学论文,都没有提供任何关于这一成就是如何实现的信息:

    在一封评论本文初稿的电子邮件中,Ernie Davis 非常中肯地补充道:

    要恰当地评估这些发现的意义,我们需要一些关键信息。第一:他们尝试了多少个猜想?如果 OpenAI 团队是从所有未解决的重要数学猜想空间中随机挑选出这 10 个猜想,而 Astra 全部解决了,那将令人惊叹;但这似乎完全不可能。如果他们挑选了 50 个他们认为 Astra 能成功的猜想,而它成功了 10 个,那仍然令人惊叹,但程度要低得多。如果他们在所有大约 1000 个未解决的 Erdős 猜想以及另外 10,000 个未解决猜想上运行了 Astra,那么它未能解决这些问题的结果,就是关于其作为数学推理者能力极限的重要信息。第二:OpenAI 大肆吹嘘说,完成这项工作总共只花了 2000 美元的计算成本。可以肯定的是,这很可能只包括 Astra 成功的那些猜想,而不包括它失败的。但是,考虑到参与这个项目的高薪数学家和计算机科学家的工资,成本又是多少呢?如果低于 20,000 美元,我会感到震惊;如果超过 200,000 美元,我也不会感到意外。

    我们对此并不了解,而且照目前的发展态势来看,我们可能永远也无法了解。对于在2025年国际数学奥林匹克竞赛中夺得金牌的OpenAI系统,我们依然一无所知;而对Google的那个系统,我们掌握的信息也少得可怜。

  2. Astra 在某些数学问题上表现出色,但要说数学已被“攻克”(X 平台上很多人似乎这么认为),这实在令人怀疑。它似乎只是擅长特定类型的数学问题。

    但很可能并非所有数学问题它都擅长。以下是 Eric Weinstein 在 X 平台上列举的一些它可能不太擅长的数学类型示例。

    Ernie Davis 还补充道:“自动形式化的问题——即将人类数学家撰写的数学内容转化为严格逻辑形式——似乎远未得到解决,尽管确实已取得进展。例如:过去两年里,数学家 Kevin Buzzard 一直在领导一个项目,用 Lean 语言将 Andrew Wiles 对费马大定理的证明形式化。可以肯定地说,没有任何 AI 系统有能力完成这项艰巨的任务。可以想见,如果它们能在无人协助的情况下做到这一点,它们早就抢先一步了;如果它们能将他数年的工作缩短为数周,他早就用上它们了。”

  3. 与我关于数学能力并不能保证通用性的总体预测一致,Astra 的证明写作水平似乎与其证明本身并不相称(这呼应了 Ernie Davis 和我一年前在此处的观察)”[点击查看完整推文]

  4. 我严重怀疑 Astra 能神奇地解决当前模型中所有无法可靠运行的问题。它能可靠地从任意 PDF 中提取数字吗?我表示怀疑。它能满足 Sabine Hossenfelder 希望 AI 为她的 YouTube 系列节目撰写脚本的愿望吗?[点击推文查看详情] 我也表示怀疑。

  5. Astra 并非(如 Musk 所暗示的)奇点。无需多言。(不过可以看看我最近关于这个话题的文章;情况其实没什么变化。)

  6. 声称 Astra 的首次亮相“很可能是数学史上最重要的一天”是荒谬的,而一大群人却基于 Fable 某一次运行中的一句话(如果问两次,可能会给出不同答案)到处这么说。这里没有新理论,没有新技术,而且尽管它令人印象深刻,但它与微积分、代数、对数、概率、十进制系统、信息论、零的概念的发展完全不在一个量级上。Davis 表示:“Fable 引文中声称‘其中几项单独拿出来都足以成为这十年来的重大成果’是荒谬的……作为现实检验,自 1900 年以来,David Hilbert 的 23 个问题中已有 14 个得到解决——也就是平均每九年解决一个——而这些结果远未达到那个水平。你很容易就能列出一份自 1926 年以来被证明的 100 项重要得多的成果清单。”

  7. 我怀疑它不会直接带来癌症的治愈,也不会像一些兴奋的 AI“网红”所设想的那样,在“材料研究、能源生产、药物发现、一切领域”带来巨大进步。这也不意味着我们刚刚进入了“自动化科学发现的时代”。针对这些过度的说法……

……这篇刚刚发布,呼应了几天前我链接到的由等人撰写的新文章。

第四部分:总结

尽管昨天在 X 上遭到了巨大的反对(其中大部分是人身攻击,有些甚至涉及捏造,还有很多是彻头彻尾的谎言),我对 Astra 的总体看法仍然是我最初发布的那条:

可悲的是,Ernie Davis 和我在一年前就提出了很多关于如何正确检验新系统的相同观点:

我理解人们对 Astra 感到兴奋,但任何期待奇迹的人都很可能会失望。

OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

Gary Marcus:The Road to AI We Can Trust(RSS)·2026-08-03 05:25·1小时前·Gary Marcus
阅读原文· garymarcus.substack.com
精选理由

从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

AI 摘要

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。

正文 · AI 翻译

Astra,OpenAI 正在内部测试的一款新模型,确实令人惊叹。这一点无可否认:

第一部分:最大的谬误

但与此同时,一大批人——其中不乏相当有分量的人物——正在四处宣扬一种关于其影响的、存在严重缺陷的论点。

看看你能不能找出这个谬误。以下是从众多例子中挑出的三个。

另一条推文甚至声称“这个物种刚刚跨过了一道单向门槛”;埃隆·马斯克则将其视为我们已抵达奇点的证据。

他们每个人犯的本质上都是同一个错误。

这个谬误有名字,叫作“合成谬误”。

维基百科上关于它的词条里满是绝佳的例子;这里只列开头几个。

这个谬误在当前案例中的表现是什么?就是认为一个擅长某类数学问题的系统,就擅长所有数学、擅长科学,甚至很可能擅长一切。“AGI 临近”群体一次又一次地犯着同一个逻辑谬误。每次有进展出现,我都会看到同样的错误。

这个谬误是这样运作的。

1. 有人假装所有认知都是同等的。(完全不符合事实。)

2. 每当 AI 在某种(花哨的)认知形式上取得成功,他们就希望你相信,AI 在一切形式上的成功都近在眼前。

你不需要是认知心理学家也能看出这个推论根本不成立。比如我们都知道,数学方面的专长并不能保证在所有领域都成为天才。一个擅长数学、物理或编程的人,可能在写作或理解人际关系上很吃力(反过来,一个伟大的作家也可能不擅长数学,等等)。某一领域的专长完全不能保证在所有甚至大多数领域都具备专长。

这正是霍华德·加德纳和罗伯特·斯腾伯格等人提出多元智能理论的原因,也是 SAT 将数学和语文分开考试的原因,等等。

Astra 看起来——我们还没有看到其方法论——在数学方面表现出色,或者至少在某些形式的数学上如此,但这并不意味着它能避免模型幻觉,或解决其他生成式 AI 系统存在的可靠性问题。这甚至不意味着它能可靠地阅读 PDF。也不意味着它将成为第一个能够遵守硬性规则的生成式 AI。(这应该让你感到恐惧。)

特别是,Astra 显然擅长某些问题;但这并不意味着它在难以形式化的问题上会表现出色,甚至不一定能胜任。这并不意味着它会神奇。这并不意味着它是 AGI 或 ASI 或任何类似的东西。

它*非常*令人印象深刻。但我看不出任何理由认为 Astra 是 AGI,更不用说 ASI 了。如果它能在我和 Miles Brundage 的 2024 年赌注中拿到 5/10 的分数,我会感到惊讶。

第二部分。有一个重要的、原则性的理由认为,数学上的成功是一个特例,不会像人们可能希望的那样广泛推广。

如果(a)这种谬误不是极其普遍,并且(b)我不认为有非常充分的理由认为这种谬误适用于此,我就不会花这么长的篇幅来讨论它。

数学成为这些模型大放异彩的领域并非偶然。数学适合两件事:验证(使用符号工具),以及大规模廉价生成的合成数据,在这些数据中你可以保证答案是正确的。编码也是如此——但一般来说并非如此。你可以生成任意多的数学事实;你无法模拟开放式的世界。你可以验证数学;你无法以同样的方式验证军事战略。

这并非新闻。我至少从 2025 年 1 月起就一直在指出这一点【第一行本应说编码和数学】,呼应了 Ernie Davis 和我在 2019 年关于围棋(以及为什么 AlphaGo 不会是万能灵药)所说的:

OpenAI 能做到 Astra 在数学方面所做的事情,是因为数学允许使用外部工具进行验证并创建合成数据。

这并不会让 Astra 显得不那么令人印象深刻,但正如十年前我们从 IBM 那次混乱且最终失败的尝试中学到的——它试图把赢得《危险边缘》的 Watson 改造成一台攻克癌症的机器——在一个领域取得成功并不能保证在所有领域都能成功。

OpenAI 在这里所处理的数学,与许多(也许是大多数)现实世界问题有着根本性的不同;在那些问题中,验证既不能保证解决方案,也无法让人几乎零成本地无限生成训练数据。

指望它成为万能溶剂,只能说明你并不理解这个基本事实。

第三部分:关于 Astra 还需要了解的七件事

  1. 昨天的推文和博客是营销,不是科学。这两者,连同随附的 249 页数学论文,都没有提供任何关于这一成就是如何实现的信息:

    在一封评论本文初稿的电子邮件中,Ernie Davis 非常中肯地补充道:

    要恰当地评估这些发现的意义,我们需要一些关键信息。第一:他们尝试了多少个猜想?如果 OpenAI 团队是从所有未解决的重要数学猜想空间中随机挑选出这 10 个猜想,而 Astra 全部解决了,那将令人惊叹;但这似乎完全不可能。如果他们挑选了 50 个他们认为 Astra 能成功的猜想,而它成功了 10 个,那仍然令人惊叹,但程度要低得多。如果他们在所有大约 1000 个未解决的 Erdős 猜想以及另外 10,000 个未解决猜想上运行了 Astra,那么它未能解决这些问题的结果,就是关于其作为数学推理者能力极限的重要信息。第二:OpenAI 大肆吹嘘说,完成这项工作总共只花了 2000 美元的计算成本。可以肯定的是,这很可能只包括 Astra 成功的那些猜想,而不包括它失败的。但是,考虑到参与这个项目的高薪数学家和计算机科学家的工资,成本又是多少呢?如果低于 20,000 美元,我会感到震惊;如果超过 200,000 美元,我也不会感到意外。

    我们对此并不了解,而且照目前的发展态势来看,我们可能永远也无法了解。对于在2025年国际数学奥林匹克竞赛中夺得金牌的OpenAI系统,我们依然一无所知;而对Google的那个系统,我们掌握的信息也少得可怜。

  2. Astra 在某些数学问题上表现出色,但要说数学已被“攻克”(X 平台上很多人似乎这么认为),这实在令人怀疑。它似乎只是擅长特定类型的数学问题。

    但很可能并非所有数学问题它都擅长。以下是 Eric Weinstein 在 X 平台上列举的一些它可能不太擅长的数学类型示例。

    Ernie Davis 还补充道:“自动形式化的问题——即将人类数学家撰写的数学内容转化为严格逻辑形式——似乎远未得到解决,尽管确实已取得进展。例如:过去两年里,数学家 Kevin Buzzard 一直在领导一个项目,用 Lean 语言将 Andrew Wiles 对费马大定理的证明形式化。可以肯定地说,没有任何 AI 系统有能力完成这项艰巨的任务。可以想见,如果它们能在无人协助的情况下做到这一点,它们早就抢先一步了;如果它们能将他数年的工作缩短为数周,他早就用上它们了。”

  3. 与我关于数学能力并不能保证通用性的总体预测一致,Astra 的证明写作水平似乎与其证明本身并不相称(这呼应了 Ernie Davis 和我一年前在此处的观察)”[点击查看完整推文]

  4. 我严重怀疑 Astra 能神奇地解决当前模型中所有无法可靠运行的问题。它能可靠地从任意 PDF 中提取数字吗?我表示怀疑。它能满足 Sabine Hossenfelder 希望 AI 为她的 YouTube 系列节目撰写脚本的愿望吗?[点击推文查看详情] 我也表示怀疑。

  5. Astra 并非(如 Musk 所暗示的)奇点。无需多言。(不过可以看看我最近关于这个话题的文章;情况其实没什么变化。)

  6. 声称 Astra 的首次亮相“很可能是数学史上最重要的一天”是荒谬的,而一大群人却基于 Fable 某一次运行中的一句话(如果问两次,可能会给出不同答案)到处这么说。这里没有新理论,没有新技术,而且尽管它令人印象深刻,但它与微积分、代数、对数、概率、十进制系统、信息论、零的概念的发展完全不在一个量级上。Davis 表示:“Fable 引文中声称‘其中几项单独拿出来都足以成为这十年来的重大成果’是荒谬的……作为现实检验,自 1900 年以来,David Hilbert 的 23 个问题中已有 14 个得到解决——也就是平均每九年解决一个——而这些结果远未达到那个水平。你很容易就能列出一份自 1926 年以来被证明的 100 项重要得多的成果清单。”

  7. 我怀疑它不会直接带来癌症的治愈,也不会像一些兴奋的 AI“网红”所设想的那样,在“材料研究、能源生产、药物发现、一切领域”带来巨大进步。这也不意味着我们刚刚进入了“自动化科学发现的时代”。针对这些过度的说法……

……这篇刚刚发布,呼应了几天前我链接到的由等人撰写的新文章。

第四部分:总结

尽管昨天在 X 上遭到了巨大的反对(其中大部分是人身攻击,有些甚至涉及捏造,还有很多是彻头彻尾的谎言),我对 Astra 的总体看法仍然是我最初发布的那条:

可悲的是,Ernie Davis 和我在一年前就提出了很多关于如何正确检验新系统的相同观点:

我理解人们对 Astra 感到兴奋,但任何期待奇迹的人都很可能会失望。

阅读原文garymarcus.substack.com