We've launched a new "game puzzles" benchmark, similar to our Chess Puzzles benchmark but using puzzles from a different, undisclosed game. This helps us test AI on reasoning-heavy tasks where they probably weren't post-trained. The current record-holder is Opus 5, scoring 59%.
AI 导读
我们推出了一项新的“游戏谜题”基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。
26
AI 编辑部评分,满分 100我们推出了一项新的“游戏谜题”基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。
来源:Epoch AI· x.com