Chubby♨️ · @kimmonismus · X·2026-09-04 03:06·15分钟前
AI 导读

作者引用 OpenAI 官方基准称 GPT-6 Astra 以 99.9% 饱和 ARC-AGI-3,在 ExploitBench 得 100%,并在各项基准上全面超过此前保持 SOTA 两天的 Claude Fable 5.1,且价格更低。

Chubby♨️@kimmonismus
精选
76AI 编辑部评分,满分 100
2026-09-04 03:06· 15分钟前
AI 导读

作者引用 OpenAI 官方基准称 GPT-6 Astra 以 99.9% 饱和 ARC-AGI-3,在 ExploitBench 得 100%,并在各项基准上全面超过此前保持 SOTA 两天的 Claude Fable 5.1,且价格更低。

推荐理由

原文汇总了官方基准数字与开放范围,并附成本对比图,读者可据此比较 GPT-6 Astra 与 Claude Fable 5.1 的性价比。

正文 · AI 翻译

到这个时候,他们在所有基准测试上已经完全碾压了 Fable 5.1。Claude Fable 5.1 曾在几项关键基准测试中保持 SOTA 状态长达两天。

Astra 更好--而且便宜得多。

Chubby♨️来自 OpenAI 官网的官方 GPT-6 Astra 基准测试 "Astra 在 ARC-AGI-3 上以 99.9% 的得分达到饱和,在 ExploitBench 上以 100% 的得分达到饱和" "GPT-6 Astra 今天开始向有限的组织推出,未来几天将向所有 ChatGPT Plus、Pro、Busines...