GPT-6 Astra 在 Artificial Analysis 编程智能体指数中取得显著进步,以更低成本取得与 Fable 5 相同的得分。在智能指数中,它实现相近性能所消耗的 token 少于 GPT-5.6 Sol,但这一优势被更高的价格所抵消。
定价全面为 GPT-5.6 Sol 当前价格的 2.5 倍,每百万输入/输出 token 的价格从 $4/$20 上调至 $10/$50,缓存读取仍享 90% 折扣,缓存写入则加收 25% 溢价。
在我们的两大旗舰指数中,我们看到截然不同的情况。在 Artificial Analysis 编程智能体指数中,GPT-6 Astra 以不到一半的成本追平 Fable 5,这得益于显著的 token 效率提升。在 Artificial Analysis 智能指数中,GPT-6 Astra 在相近性能下比其前代产品更具 token 效率,但这一优势被价格上涨所抵消。
Artificial Analysis 编程智能体指数--核心要点:
➤ 比肩顶级模型:在 Codex 环境中,GPT-6 Astra 在该指数中得分 67--与 Claude Code 中的 Claude Opus 5 和 Fable 5、以及 Muse Code 中的 Muse Spark 1.3 大致相当。Claude Code 中的 Fable 5.1 以 70 分领跑该指数。
➤ token 效率比 GPT-5.6 Sol 提升 70%:GPT-6 Astra 在 token 效率上实现了大幅提升,在 Codex 测试环境中消耗的 token 仅为 GPT-5.6 Sol(max)的三分之一,为 Claude Opus 5(xhigh)的五分之一。该模型的不同推理力度档位占据了 token 效率的帕累托前沿。
➤ 领跑 Coding Agent Index 成本效率前沿:在最大努力(max effort)设置下,GPT-6 Astra 的成本与 GPT-5.6 Sol(max)大致相当,而在该 Index 上的得分高出 2 分。按任务计算,在得分相同的情况下,该模型的成本不到 Claude Fable 5 的一半。
Artificial Analysis Intelligence Index -- 核心要点:
➤ 智能水平与 GPT-5.6 Sol 比肩:GPT-6 Astra 在该 Index 上的得分与 GPT-5.6 Sol 持平,均为 61 分。这比 Claude Fable 5.1(max with fallback)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1.3(max)。
➤ 输出 token 减少约 10%,但被价格上涨抵消:GPT-6 Astra 在 Intelligence Index 对比每任务输出 token 方面定义了新的帕累托前沿--在最大努力设置下,其 token 使用量相比 GPT-5.6 Sol 减少了约 10%。然而,由于价格上调 2.5 倍,该模型在最大努力设置下每任务成本比前代高出 75%。
➤ 幻觉率仅为 GPT-5.6 Sol 的一半:GPT-6 Astra 在我们用于评测知识与幻觉的 AA-Omniscience 基准上实现了大幅跃升。这主要得益于最大努力设置下幻觉率从 92% 显著下降至 51%。与某些模型不同,这一改进并未以牺牲准确率为代价--与此同时,Astra 的准确率还提升了 4 个百分点。
➤ AA-Briefcase Elo 提升约 80 分:GPT-6 Astra 在 AA-Briefcase(我们用于评估前沿模型长期多步骤知识工作的评测)中提升了约 80 分。该评测要求模型处理跨数周的项目,包含大量相互关联的任务和数千个源文件。与上一代模型相比,Astra 在 AA-Briefcase 中的评分标准和 Analytical Quality Elo 均有显著提升。另一方面,我们观察到 Presentation Quality Elo 有所下降,GPT-5.6 Sol(max)在该项上仍领先所有模型。
➤ 其他评测进展不一:该模型在 Humanity's Last Exam(一项长期评测,侧重数学、科学和人文学科)中提升了 6 分。但这一提升被 GDPval-AA v2 中约 80 Elo 分的下降所抵消--该基准改编自 OpenAI 的数据集,用于衡量 44 个职业中具有经济价值的任务表现。我们还在其他多项评测中观察到 2-3 分的回退,涉及多种能力,包括 τ3-Banking(客户支持)、SciCode(科学领域的 Python 问题)以及 AA-LCR(对大型文档的长期上下文推理)。
祝贺 @OpenAI 和 @sama 发布新模型!