OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%

Simon Willison 博客·2026-09-04 04:18·24分钟前
AI 导读

OpenAI 的 GPT-6 Astra 今日起向部分组织推出,随后面向 ChatGPT Plus、Pro、Business、Enterprise 用户开放,API 定价为每百万输入 $10、每百万输出 $50,与 Claude Fable 5/5.1 持平。

Simon Willison 博客
精选
82AI 编辑部评分,满分 100

OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%

2026-09-04 04:18· 24分钟前
AI 导读

OpenAI 的 GPT-6 Astra 今日起向部分组织推出,随后面向 ChatGPT Plus、Pro、Business、Enterprise 用户开放,API 定价为每百万输入 $10、每百万输出 $50,与 Claude Fable 5/5.1 持平。

推荐理由

作者汇总了 GPT-6 Astra 的定价、ARC-AGI 3 与安全基准成绩及第三方对比,读者可据此了解它相对 Claude Fable 的定位。

正文 · AI 翻译

GPT-6 Astra“今日起向一小部分组织推出,未来几天将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,也可通过 OpenAI API 和 AWS 使用”——我自己还没试过,所以暂时没有太多可说的。

其 API 定价将与 Claude Fable 5 和 5.1 相同:输入 $10/百万 token,输出 $50/百万 token。这显然是 OpenAI 对标 Fable 的产品,而且在 OpenAI 自行报告的多数基准测试中,其得分似乎都高于 Fable。

最令人印象深刻的是,Astra 在近期(3 月发布)的 ARC-AGI 3 基准测试中取得了 99.9% 的得分——不过值得注意的是,Fable 5 尚未公布测试结果,而且 ARC-AGI 博客指出,99.9% 的得分是在花费 $19K、使用 OpenAI 定制的“Provider Adapter harness”的情况下取得的,而默认 ARC-AGI harness 的得分为 62.7%,花费 $26K。

Provider Adapter harness 会在请求之间保留不透明的推理状态,并对较长的对话使用压缩处理,使模型能够复用先前的工作成果。

考虑到近期 Hugging Face 事件,Astra 在安全任务上表现出色并不令人意外。它在 ExploitBench 上得分 100%(GPT-5.6 Sol 为 78.5%),在 ExploitGym 上得分 42.4%(Sol 为 30.3%),在 SRE-Bench 二进制逆向工程任务中四次尝试内得分 99.2%,而 Sol 为 68.7%。

它在长上下文方面也更出色:在 OpenAI 的八针基准测试中,它在 256K–512K token 范围内得分 100%,在 512K–1M token 范围内得分 96.3%。OpenAI 或许已经攻克了长上下文处理中长期存在的一个挑战。

不过它并非在所有方面都胜出。Artificial Analysis 指出,Astra 在其 Intelligence Index(智能指数)上仍被 Fable 击败:

在智能水平上与 GPT-5.6 Sol 比肩:GPT-6 Astra 在该指数上的得分为 61,与 GPT-5.6 Sol 持平。这比 Claude Fable 5.1(含回退的最高分)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1.3(最高分)。

它在 Coding Agent Index(编程智能体指数)上表现更好:

领跑 Coding Agent Index 成本效益前沿:在最大推理强度下,GPT-6 Astra 的成本与 GPT-5.6 Sol(最大强度)大致相当,而指数得分高出 2 分。在相同得分下,该模型每项任务的成本不到 Claude Fable 5 的一半。

等我获得 Astra 的访问权限后,会再写更多相关内容。该 API 模型一旦上线,其标签将是 gpt-6-astra。

来源:Simon Willison 博客· simonwillison.net