NanoGPT 速通前沿:Fable 5 以 81.7% 通过率登顶

Hacker News 热门(buzzing.cc 中文翻译)·2026-08-23 18:13·21小时前·stared
AI 导读

NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。

Hacker News 热门(buzzing.cc 中文翻译)
49AI 编辑部评分,满分 100

NanoGPT 速通前沿:Fable 5 以 81.7% 通过率登顶

2026-08-23 18:13· 21小时前· stared
AI 导读

NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。

NanoGPT Speedrun Frontier

All models

Best validated result for each model

1

Fable 5

2,726

81.7% closed

claude-code · high

@24H 3,010

8.7d

2

Opus 5

2,920

53.6% closed

claude-code · max

@24H 3,045

2.9d

3

Kimi K3

2,930

52.2% closed

prime-agent · max

@24H 3,125

3.6d

4

Kimi K3

2,974

45.8% closed

kimi-code · max

@24H 3,135

5.1d

5

Opus 4.8

3,018

39.4% closed

claude-code · max

@24H 3,180

3.0d

6

GPT-5.6 Sol

3,042

35.9% closed

codex · xhigh

@24H 3,160

6.1d

7

GPT-5.6 Sol Pro

3,058

33.6% closed

codex · xhigh

@24H 3,100

3.4d

8

Sonnet 5

3,105

26.8% closed

claude-code · max

@24H 3,120

2.0d

9

GPT-5.6 Luna

3,110

26.1% closed

codex · xhigh

@24H 3,170

1.9d

10

Grok 4.5

3,120

24.6% closed

grok-cli · xhigh

@24H 3,160

2.7d

11

Qwen3.8 Max

3,120

24.6% closed

qwen-code · max

@24H 3,225

1.9d

12

GLM 5.2

3,150

20.3% closed

pi · high

@24H 3,200

1.8d

13

DeepSeek V4 Pro

3,205

12.3% closed

claude-code · max

@24H 3,205

1.1d

14

GPT-5.6 Terra

3,214

11.0% closed

codex · xhigh

@24H 3,214

1.1d

15

Grok 4.6

3,220

10.1% closed

grok-cli · xhigh

0.6d

16

Muse Spark 1.2

3,230

8.7% closed

muse-code · xhigh

0.6d

17

Muse Spark 1.1

3,232

8.4% closed

pi · max

@24H 3,240

3.7d

18

GPT-5.5

3,234

8.1% closed

codex · xhigh

@24H 3,234

1.1d

19

Kimi K2.7

3,240

7.2% closed

kimi-code · max

@24H 3,240

1.6d

20

GLM 5.3

no record

claude-code · xhigh

ModelHarnessTraces
Fable 5claude-code · high2,72681.7%3,010800M1.1M8113k8.7
Opus 5claude-code · max2,92053.6%3,045183M690k2924012.9
Kimi K3prime-agent · max2,93052.2%3,125112M2.2M4883.6
Kimi K3kimi-code · max2,97445.8%3,135682M1.4M7134k5.1
Opus 4.8claude-code · max3,01839.4%3,180318M2.3M4272k3.0
GPT-5.6 Solcodex · xhigh3,04235.9%3,1602.9B2.2M96328k6.1
GPT-5.6 Sol Procodex · xhigh3,05833.6%3,1001.2B4.6M5097k3.4
Sonnet 5claude-code · max3,10526.8%3,120998M2.1M2132k2.0
GPT-5.6 Lunacodex · xhigh3,11026.1%3,170894M888k36212k1.9
Grok 4.5grok-cli · xhigh3,12024.6%3,16046M385k3994k2.7
Qwen3.8 Maxqwen-code · max3,12024.6%3,225216M629k3128661.9
GLM 5.2pi · high3,15020.3%3,20057M1.7M1941k1.8
DeepSeek V4 Proclaude-code · max3,20512.3%3,20526M319k1893091.1
GPT-5.6 Terracodex · xhigh3,21411.0%3,214417M298k1543k1.1
Grok 4.6grok-cli · xhigh3,22010.1%27M346k976910.6
Muse Spark 1.2muse-code · xhigh3,2308.7%41M910k567240.6
Muse Spark 1.1pi · max3,2328.4%3,240122M1.6M4892k3.7
GPT-5.5codex · xhigh3,2348.1%3,23470M77k1856141.1
Kimi K2.7kimi-code · max3,2407.2%3,240160M763k1873k1.6
GLM 5.3claude-code · xhigh

Model

Record

Human 2,600

Baseline 3,290

Gray runs ended before the selected budget

Open Traces to explore 41 curated full agent trajectories, including tool calls, subagents, and scratchpads.

来源:Hacker News 热门(buzzing.cc 中文翻译)· primeintellect.ai