STORY · 事件进行中

ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 上得分 63%

2 个精选信源 · 2 篇报道持续 1最新动态 9小时前
最新进展

Greg Brockman 称 ARC-AGI-3 基准已饱和

DIGEST

事件全貌

AI 综述 · 更新于 57分钟前

ARC Prize 公布 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上的评测结果。使用标准 harness 时,GPT-6 Astra 得分为 63%;而采用新的 provider adapter harness 后,得分达到 99%。此外,在 96% 的关卡上,其动作效率超过受测人类中位数。

ARC Prize 观察到,GPT-6 Astra 能够将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则,并自建领域速记语言来跟踪状态和规划动作。

OpenAI 联合创始人 Greg Brockman 转发该评测,称 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,并认为该基准已趋于饱和。排行榜图还显示,更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少了模型调用和 token 数。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

24 HOURS

本事件热度走势

当前热度 22峰值 239月4日 15:00近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 0 条 · 最新在前
  1. Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和
    X:Greg Brockman (@gdb)精选

    Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

  2. ARC Prize:GPT-6 Astra 以标准 harness 在 ARC-AGI-3 拿下 63% 得分
    X:Testing Catalog (@testingcatalog)

    GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。