正文 · AI 翻译
到这个时候,他们在所有基准测试上已经完全碾压了 Fable 5.1。Claude Fable 5.1 曾在几项关键基准测试中保持 SOTA 状态长达两天。
Astra 更好--而且便宜得多。
来自 OpenAI 官网的官方 GPT-6 Astra 基准测试 "Astra 在 ARC-AGI-3 上以 99.9% 的得分达到饱和,在 ExploitBench 上以 100% 的得分达到饱和" "GPT-6 Astra 今天开始向有限的组织推出,未来几天将向所有 ChatGPT Plus、Pro、Busines...