我提前体验了 GPT-5.51,我认为这是一件大事。说它重要,是因为它表明 AI 的快速进步并未止步。说它重要,也因为它本身确实非常出色。而说它重要,还因为即便如此,AI 能力的前沿依然参差不齐。
随着 AI 能力的提升,越来越难快速展示每一代际变化带来的差异,因为许多过去 AI 不擅长的旧任务,比如数学计算或数单词中的字母,现在对 AI 来说已变得轻而易举。因此,我会提供复杂的细节,但首先,我想用一个我认为能很好说明问题的简单例子。AI 模型最擅长的是编程,所以我给从 OpenAI 首个推理模型 o3(发布已有一年零一周!)到当前最佳开源权重模型(Kimi K2.6),再到新的 GPT-5.5 Pro 这些 AI 出了一道编程挑战题:“为我构建一个程序化生成的 3D 模拟,展示一个港口小镇从公元前 3000 年到公元 3000 年的演变过程,它应该看起来美观,并允许我对其进行一些控制。”
然后我将所有答案发布到了这个展示页面上,以便你可以亲自体验它们(实际上,我是让 GPT-5.5 Codex 帮我搭建了这个展示页面)。你应该亲自操作一下,感受其中的差异,不过你也可以在下面看到其中几个示例。除了在所有其他维度上表现更优之外,只有 GPT-5.5 Pro 真正模拟了一个不断演变的小镇,而不仅仅是随时间生成新的建筑替换物。GPT-5.5 Pro 的速度也比上一代快得多:GPT-5.4 Pro 完成该任务需要 33 分钟,而 GPT-5.5 Pro 只用了 20 分钟。
模型、应用与工具框架
我一直鼓励大家不要把 AI 看作单一事物,而应将其视为三个相互关联的概念。你需要关注模型,比如 Opus 4.7、Gemini 3.1,或者(现在的)GPT-5.5。同时也要留意应用,也就是你实际用来与模型对话的产品,它们能让模型为你完成实际工作。最常见的应用是每个模型对应的网站:chatgpt.com、claude.ai、gemini.google.com。但如今,像 Claude Code、Claude Cowork 和 OpenAI Codex 这样的桌面应用正逐渐成为最有用的 AI 工具。最后还有工具框架,即 AI 可以使用的工具,以及 AI 模型如何与这些工具连接。工具让 AI 能够控制你的电脑、编写代码、做研究以及生成图像。
OpenAI 在这三个领域都取得了进展。在模型方面,GPT-5.5 是一个强大的模型系列,其中 GPT-5.5 Pro(仅限网站使用)能力最强。近期在应用方面也有重大进展,OpenAI 的 Codex 越来越追随优秀的 Claude Code 的脚步,打造出了一款易用且实用的桌面应用。最后是工具框架及其可使用的工具。工具框架方面有许多新的改进,但最有趣的之一来自 OpenAI,它拥有一个新的图像模型。
这个新模型现在可以渲染高质量的文字,并几乎能根据你的描述创作出任何图像。老读者都知道我的“水獭测试”,即要求 AI 生成一张水獭在飞机上使用 Wi-Fi 的图片。与其再次描述,不如让这个新图像模型(有时被称为 GPT-imagegen-2)来为我解释:“一张水獭科学家展示 Ethan Mollick 水獭测试结果的照片,该测试展示了 AI 图像生成器在制作水獭坐在飞机上使用 Wi-Fi 的图像方面的能力。”
也许你想看看关于它的学术论文?“展示水獭测试学术论文的第一页,格式良好,放在桌子上”(请随意放大查看文字)。
或者,我们干脆把它变成艺术?“现在展示一个精美的艺术画廊,墙上每一幅画都是一只水獭在飞机上使用笔记本电脑,风格分别模仿克里姆特、罗斯科、马蒂斯、莫奈、毕加索、提香、伦勃朗和欧姬芙。每幅画下方应有清晰可读的标签。”(这幅图值得放大细看)
这一切都非常酷,而且在几个月前还不可能实现,但它同样非常实用。一个能够生成精细文字和图像的图像生成器,可以用来制作 PowerPoint 幻灯片、产品模型、示例网站,或者任何你要求的东西。但这仅仅是一种工具,真正的魔力在于,当你将各种工具套件、应用程序和模型结合起来解决一个实际问题时才会显现。下面就是一个我拖延了十年之久的问题。
整合起来
我是一名学者,在 2010 年代初期,我很多非 AI 领域的工作都聚焦于众筹。我手头有数百个关于这个主题的匿名数据文件,来自我收集的问卷调查、分析和研究工作,混合了 STATA、CSV、XLS 和 Word 格式,我一直没来得及把它们写成论文。我想看看 GPT-5.5 能利用这些信息做到什么程度。于是,我使用了由 GPT-5.5 驱动的 Codex,并指示它:“帮我整理[这些数据],生成一个可能有趣的新假设,用复杂的方法进行检验,并写一篇学术论文。”我还要求它包含文献综述和格式排版。结果令人印象深刻,尤其是在我让 GPT-5.5 Pro 对论文进行评论,并将这些反馈结果重新输入 Codex 之后。你可以在这里阅读结果。它并不完美,但原因不再是存在明显的错误:文献综述全部是真实的,统计数据也是如此。相反,问题在于,作为专家,我认为这个假设并不那么有趣,而且尽管 AI 使用了非常复杂的统计方法来尝试解决,但仍存在一些关于因果关系的标准疑虑。简而言之,如果这篇论文是一个二年级博士生的研究成果,我会非常满意。而我仅仅给了它四个提示词,自己从未动过手修改文本。
我们还可以用另一种方式将工具、应用和模型整合在一起。我让 Codex 从头创建一款全新的桌面角色扮演游戏,本质上就是它自己发明的一个奇幻世界版的《龙与地下城》,包含了游玩所需的所有表格和规则。我还让它模拟玩家体验这款游戏,并根据模拟结果修改规则。如你所见,AI 照做了,包括生成了一份排版精美的 101 页 PDF,并用它的图像生成器为其配图。
除了技术上的精巧,实际内容也有很多可取之处。背景设定有趣且新颖,规则看起来也合理,借鉴了现有游戏模式的同时加入了独特元素。然而,仔细审视后会发现,AI 能力的参差不齐并未完全消失。每一代 AI 模型在真正构建长篇虚构作品时都存在问题。如果你经常阅读 AI 写作,会在这里看到同样的问题:偏爱诡异感;过于复杂却未能充分展开的想法;奇怪的比喻(“天气和建筑是不同速度下的同一场争论”);太多华丽的句子(“当一片海洋忘记自己曾是条路时浮现出的神圣之物”,出现一次很酷,整本书都这样就很累人);对话中每个角色都用同样简短的语气说话;以及“玛拉”这个名字。所以,尽管技术取得了惊人的进步,但依然存在粗糙之处。
GPT-5.5 向我们展示了模型越来越智能,应用越来越强大,工具也越来越好,使它们解决实际问题的效率不断提高。我可以用四个提示词得到一篇接近博士水平的论文,或者用一个提示词得到一款配有插图和“试玩”反馈的可玩角色扮演游戏。但虚构作品依然平淡,有些假设即使统计上合理,也往往缺乏趣味。不过话说回来,一年前,这些还都遥不可及,而随着最新版本的发布,能力提升的速度似乎正在加快。
GPT-5.5 显然不是这一进程的终点,但它是沿途值得注意的一步。我撰写这份通讯已超过三年,模式从未改变:每隔几个月就会有一款新模型问世。我运行自己的测试,曾经不可能的事情变得轻而易举,而每次新发布周期中,跨越的幅度都在增大。参差不齐的前沿依然存在,只是它比过去远得多了。
这是 GPT-5.5 为本文选择的配图,我又有什么好争辩的呢?
1
我不从 OpenAI 或任何其他 AI 实验室获取报酬,OpenAI 也未曾事先看过这篇文章。此外,在我撰写本文时,我并不了解发布的所有细节,因此如有任何错误,敬请谅解。