Elon Musk · @elonmusk · X·2026-08-22 07:55·13天前
AI 导读

马斯克转发VulcanBench排行榜,Grok 4.5 High在Eval Suite 3中得分最高,Fable 5 Low紧随其后。VulcanBench是唯一跨推理努力级别评测、且100%真实工程任务的基准。评测者指出,Max effort并非总能提升准确性,反而消耗更多token和时间。

Elon Musk@elonmusk
38AI 编辑部评分,满分 100
2026-08-22 07:55· 13天前
AI 导读

马斯克转发VulcanBench排行榜,Grok 4.5 High在Eval Suite 3中得分最高,Fable 5 Low紧随其后。VulcanBench是唯一跨推理努力级别评测、且100%真实工程任务的基准。评测者指出,Max effort并非总能提升准确性,反而消耗更多token和时间。

Interesting

MorganI am going to start to share the leaderboard at VulcanBench more regularly. VulcanBench is the only benchmark I know that benchmarks across effort levels, on an...