# OpenAI 新模型 Astra 数学表现出色，但被过度吹捧

- 来源：Gary Marcus：The Road to AI We Can Trust（RSS）
- 作者：Gary Marcus
- 发布时间：2026-08-03 05:25
- AIHOT 分数：66
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmscc62eo033broeusw72isi0
- 原文链接：https://garymarcus.substack.com/p/openais-amazing-but-vastly-oversold

## 精选理由

从合成谬误切入，剖开 Astra 舆论热潮的底层逻辑，并指出数学成功依赖于可验证性与海量合成数据，而多数真实问题没有这种特权，提醒对通用性期待需克制。

## AI 摘要

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳，但 Gary Marcus 指出相关讨论犯了“合成谬误”：擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口，是因为它便于用符号工具验证且能廉价生成海量合成数据，而开放世界问题无法如此模拟。此外，OpenAI 未公布方法细节，尚无法评估其真实意义。

## 正文

Astra，OpenAI 正在内部测试的一款新模型，确实令人惊叹。这一点无可否认：

第一部分：最大的谬误

但与此同时，一大批人——其中不乏相当有分量的人物——正在四处宣扬一种关于其影响的、存在严重缺陷的论点。

看看你能不能找出这个谬误。以下是从众多例子中挑出的三个。

另一条推文甚至声称“这个物种刚刚跨过了一道单向门槛”；埃隆·马斯克则将其视为我们已抵达奇点的证据。

他们每个人犯的本质上都是同一个错误。

这个谬误有名字，叫作“合成谬误”。

维基百科上关于它的词条里满是绝佳的例子；这里只列开头几个。

这个谬误在当前案例中的表现是什么？就是认为一个擅长某类数学问题的系统，就擅长所有数学、擅长科学，甚至很可能擅长一切。“AGI 临近”群体一次又一次地犯着同一个逻辑谬误。每次有进展出现，我都会看到同样的错误。

这个谬误是这样运作的。

1. 有人假装所有认知都是同等的。（完全不符合事实。）

2. 每当 AI 在某种（花哨的）认知形式上取得成功，他们就希望你相信，AI 在一切形式上的成功都近在眼前。

你不需要是认知心理学家也能看出这个推论根本不成立。比如我们都知道，数学方面的专长并不能保证在所有领域都成为天才。一个擅长数学、物理或编程的人，可能在写作或理解人际关系上很吃力（反过来，一个伟大的作家也可能不擅长数学，等等）。某一领域的专长完全不能保证在所有甚至大多数领域都具备专长。

这正是霍华德·加德纳和罗伯特·斯腾伯格等人提出多元智能理论的原因，也是 SAT 将数学和语文分开考试的原因，等等。

Astra 看起来——我们还没有看到其方法论——在数学方面表现出色，或者至少在某些形式的数学上如此，但这并不意味着它能避免模型幻觉，或解决其他生成式 AI 系统存在的可靠性问题。这甚至不意味着它能可靠地阅读 PDF。也不意味着它将成为第一个能够遵守硬性规则的生成式 AI。（这应该让你感到恐惧。）

特别是，Astra 显然擅长某些问题；但这并不意味着它在难以形式化的问题上会表现出色，甚至不一定能胜任。这并不意味着它会神奇。这并不意味着它是 AGI 或 ASI 或任何类似的东西。

它*非常*令人印象深刻。但我看不出任何理由认为 Astra 是 AGI，更不用说 ASI 了。如果它能在我和 Miles Brundage 的 2024 年赌注中拿到 5/10 的分数，我会感到惊讶。

第二部分。有一个重要的、原则性的理由认为，数学上的成功是一个特例，不会像人们可能希望的那样广泛推广。

如果（a）这种谬误不是极其普遍，并且（b）我不认为有非常充分的理由认为这种谬误适用于此，我就不会花这么长的篇幅来讨论它。

数学成为这些模型大放异彩的领域并非偶然。数学适合两件事：验证（使用符号工具），以及大规模廉价生成的合成数据，在这些数据中你可以保证答案是正确的。编码也是如此——但一般来说并非如此。你可以生成任意多的数学事实；你无法模拟开放式的世界。你可以验证数学；你无法以同样的方式验证军事战略。

这并非新闻。我至少从 2025 年 1 月起就一直在指出这一点【第一行本应说编码和数学】，呼应了 Ernie Davis 和我在 2019 年关于围棋（以及为什么 AlphaGo 不会是万能灵药）所说的：

OpenAI 能做到 Astra 在数学方面所做的事情，是因为数学允许使用外部工具进行验证并创建合成数据。

这并不会让 Astra 显得不那么令人印象深刻，但正如十年前我们从 IBM 那次混乱且最终失败的尝试中学到的——它试图把赢得《危险边缘》的 Watson 改造成一台攻克癌症的机器——在一个领域取得成功并不能保证在所有领域都能成功。

OpenAI 在这里所处理的数学，与许多（也许是大多数）现实世界问题有着根本性的不同；在那些问题中，验证既不能保证解决方案，也无法让人几乎零成本地无限生成训练数据。

指望它成为万能溶剂，只能说明你并不理解这个基本事实。

第三部分：关于 Astra 还需要了解的七件事

昨天的推文和博客是营销，不是科学。这两者，连同随附的 249 页数学论文，都没有提供任何关于这一成就是如何实现的信息：

在一封评论本文初稿的电子邮件中，Ernie Davis 非常中肯地补充道：

要恰当地评估这些发现的意义，我们需要一些关键信息。第一：他们尝试了多少个猜想？如果 OpenAI 团队是从所有未解决的重要数学猜想空间中随机挑选出这 10 个猜想，而 Astra 全部解决了，那将令人惊叹；但这似乎完全不可能。如果他们挑选了 50 个他们认为 Astra 能成功的猜想，而它成功了 10 个，那仍然令人惊叹，但程度要低得多。如果他们在所有大约 1000 个未解决的 Erdős 猜想以及另外 10,000 个未解决猜想上运行了 Astra，那么它未能解决这些问题的结果，就是关于其作为数学推理者能力极限的重要信息。第二：OpenAI 大肆吹嘘说，完成这项工作总共只花了 2000 美元的计算成本。可以肯定的是，这很可能只包括 Astra 成功的那些猜想，而不包括它失败的。但是，考虑到参与这个项目的高薪数学家和计算机科学家的工资，成本又是多少呢？如果低于 20,000 美元，我会感到震惊；如果超过 200,000 美元，我也不会感到意外。

我们对此并不了解，而且照目前的发展态势来看，我们可能永远也无法了解。对于在2025年国际数学奥林匹克竞赛中夺得金牌的OpenAI系统，我们依然一无所知；而对Google的那个系统，我们掌握的信息也少得可怜。

Astra 在某些数学问题上表现出色，但要说数学已被“攻克”（X 平台上很多人似乎这么认为），这实在令人怀疑。它似乎只是擅长特定类型的数学问题。

但很可能并非所有数学问题它都擅长。以下是 Eric Weinstein 在 X 平台上列举的一些它可能不太擅长的数学类型示例。

Ernie Davis 还补充道：“自动形式化的问题——即将人类数学家撰写的数学内容转化为严格逻辑形式——似乎远未得到解决，尽管确实已取得进展。例如：过去两年里，数学家 Kevin Buzzard 一直在领导一个项目，用 Lean 语言将 Andrew Wiles 对费马大定理的证明形式化。可以肯定地说，没有任何 AI 系统有能力完成这项艰巨的任务。可以想见，如果它们能在无人协助的情况下做到这一点，它们早就抢先一步了；如果它们能将他数年的工作缩短为数周，他早就用上它们了。”

与我关于数学能力并不能保证通用性的总体预测一致，Astra 的证明写作水平似乎与其证明本身并不相称（这呼应了 Ernie Davis 和我一年前在此处的观察）”[点击查看完整推文]

我严重怀疑 Astra 能神奇地解决当前模型中所有无法可靠运行的问题。它能可靠地从任意 PDF 中提取数字吗？我表示怀疑。它能满足 Sabine Hossenfelder 希望 AI 为她的 YouTube 系列节目撰写脚本的愿望吗？[点击推文查看详情] 我也表示怀疑。

Astra 并非（如 Musk 所暗示的）奇点。无需多言。（不过可以看看我最近关于这个话题的文章；情况其实没什么变化。）

声称 Astra 的首次亮相“很可能是数学史上最重要的一天”是荒谬的，而一大群人却基于 Fable 某一次运行中的一句话（如果问两次，可能会给出不同答案）到处这么说。这里没有新理论，没有新技术，而且尽管它令人印象深刻，但它与微积分、代数、对数、概率、十进制系统、信息论、零的概念的发展完全不在一个量级上。Davis 表示：“Fable 引文中声称‘其中几项单独拿出来都足以成为这十年来的重大成果’是荒谬的……作为现实检验，自 1900 年以来，David Hilbert 的 23 个问题中已有 14 个得到解决——也就是平均每九年解决一个——而这些结果远未达到那个水平。你很容易就能列出一份自 1926 年以来被证明的 100 项重要得多的成果清单。”

我怀疑它不会直接带来癌症的治愈，也不会像一些兴奋的 AI“网红”所设想的那样，在“材料研究、能源生产、药物发现、一切领域”带来巨大进步。这也不意味着我们刚刚进入了“自动化科学发现的时代”。针对这些过度的说法……

……这篇刚刚发布，呼应了几天前我链接到的由等人撰写的新文章。

第四部分：总结

尽管昨天在 X 上遭到了巨大的反对（其中大部分是人身攻击，有些甚至涉及捏造，还有很多是彻头彻尾的谎言），我对 Astra 的总体看法仍然是我最初发布的那条：

可悲的是，Ernie Davis 和我在一年前就提出了很多关于如何正确检验新系统的相同观点：

我理解人们对 Astra 感到兴奋，但任何期待奇迹的人都很可能会失望。
