核心要点
- OpenAI 一篇论文首次列出了 GPT-5.6 的三种 Pro 模型:Luna Pro、Terra Pro 和 Sol Pro。此前,Pro 始终是单一顶级模型。
- Pro 用户或许很快就能在速度、吞吐量和最大推理能力之间做出选择。
- 该论文并未说明这一产品线是否真的会在 ChatGPT 中上线,且 Pro 运行的 token 用量仍未披露。
OpenAI 的一篇基准测试论文表明,GPT-5.6 的 Pro 层级可能以三种变体形式推出。这将是自该计划启动以来 ChatGPT Pro 结构的首次重大变革。
OpenAI 于 6 月下旬正式发布了 GPT-5.6 代模型,将其分为三个型号。Sol 负责处理最困难的任务,Terra 面向高负载商业场景,Luna 则覆盖更快、更便宜的日常查询。Pro 变体并未包含在当时的发布公告中。
如今,OpenAI 一篇关于基因组学基准测试的新论文首次揭示了 Pro 模型。结果表格中包含了“GPT-5.6 Luna Pro”、“Terra Pro”和“Sol Pro”的行,每行均标注为“Pro(扩展)”运行。
Pro 不再只是单一顶级模型
在该基准测试中,Sol Pro 的通过率达到 31.5%,成为全部 60 个测试模型中最强的一个。它击败了标准版 Sol 的 28.7%,以及非 GPT 模型中的最佳成绩——Claude Opus 4.8 的 16.0%。通过率衡量的是模型完整完成多步骤分析且无错误、并得出正确最终答案的频率。
此前,ChatGPT Pro 仅仅是可用的单一最佳模型,比所有其他模型高出一个层级。该论文表明这一情况正在改变。它列出了三种并行的 Pro 变体,与标准 GPT-5.6 产品线相对应:一个快速型、一个高吞吐量型,以及一个最大性能型。
将每个标准层级在其最高推理设置(“max”)下与其 Pro 变体进行比较,可以看出性能提升的效果。所有数值均为完整 129 项任务套件的通过率:
在这种情况下,Pro 版本的性能提升会随着等级升高而递减。Luna Pro 相比标准版提升了整整七个百分点,而 Sol Pro 的提升则不到三个百分点。额外的算力对较低层级模型的提升更为显著:Terra Pro 达到了 28.5%,几乎与标准版 Sol 的 28.7% 持平,这意味着高容量的 Pro 版本性能几乎与最好的标准旗舰型号相当。
与 Pro 一贯的运作方式截然不同
这种分层模式将是自 ChatGPT Pro 推出以来,Pro 产品首次出现的重大变化。Pro 不再只是一个昂贵的高端层级,而是可能演变成一个包含三个模型的系列,用户可以根据手头任务在速度、吞吐量和最大推理能力之间进行选择。
这篇论文并未明确说明这种分层结构是否真的会出现在 ChatGPT 中。目前,这些名称仅来自基准测试表格。
还有一个细节被隐藏了。对于标准版 GPT 模型,论文报告了平均 token 使用量,作为计算成本的一个粗略指标——Sol 在最高设置下约为 33,200 个 token。而对于 Pro 版本的运行,这个数字是缺失的。作者表示没有可比的 token 核算数据,但更可能的解释是,OpenAI 根本不想分享这些数字。