ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 上得分 63%
Greg Brockman 称 ARC-AGI-3 基准已饱和
事件全貌
ARC Prize 公布 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上的评测结果。使用标准 harness 时,GPT-6 Astra 得分为 63%;而采用新的 provider adapter harness 后,得分达到 99%。此外,在 96% 的关卡上,其动作效率超过受测人类中位数。
ARC Prize 观察到,GPT-6 Astra 能够将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则,并自建领域速记语言来跟踪状态和规划动作。
OpenAI 联合创始人 Greg Brockman 转发该评测,称 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,并认为该基准已趋于饱和。排行榜图还显示,更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少了模型调用和 token 数。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。
报道时间线
- Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
- ARC Prize:GPT-6 Astra 以标准 harness 在 ARC-AGI-3 拿下 63% 得分
GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。