Epoch AI · @EpochAIResearch · X·2026-08-07 04:31·11天前
AI 导读

我们推出了一项新的“游戏谜题”基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。

Epoch AI@EpochAIResearch
26AI 编辑部评分,满分 100
2026-08-07 04:31· 11天前
AI 导读

我们推出了一项新的“游戏谜题”基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。

We've launched a new "game puzzles" benchmark, similar to our Chess Puzzles benchmark but using puzzles from a different, undisclosed game. This helps us test AI on reasoning-heavy tasks where they probably weren't post-trained. The current record-holder is Opus 5, scoring 59%.

来源:Epoch AI· x.com