# AI 大模型周榜：智谱 glm-5.3-max 首秀闯入综合榜前 15，月之暗面 kimi-k3-max 冲进前十

- 来源：IT之家（RSS）
- 发布时间：2026-08-24 16:10
- AIHOT 分数：52
- AIHOT 链接：https://aihot.virxact.com/items/cmt6z08z41o2vro73god5x268
- 原文链接：https://www.ithome.com/0/993/601.htm

## AI 摘要

Arena 平台发布第 34 周 AI 大模型盲测排名，智谱新发布的 glm-5.3-max 首次入榜即位列综合榜第 13 名（ELO 1487 分），月之暗面 kimi-k3-max 升至第 10 名，首次进入前十。代码榜中 glm-5.3-max 同样首秀即杀入前十（第 10 名，ELO 1531 分）。综合榜头部由 claude-fable-5 以 1508 分蝉联第一。

## 正文

IT之家 8 月 24 日消息，Arena（arena.ai）平台发布 2026 年第 34 周（8 月 17 日 ~8 月 23 日）AI 大模型盲测排名，本期智谱新发布的 glm-5.3-max 首次入榜即闯入综合榜 Top 15，位列第 13 名，ELO 得分 1487 分；月之暗面 kimi-k3-max 从第 12 名升至第 10 名，首次杀入综合榜前十。此外，本周还有多个国产模型在各细分榜单中取得亮眼表现，新模型入榜数量较多，整体竞争格局进一步变化。

IT之家注：本榜单基于 Arena（arena.ai）平台匿名盲测投票，通过 ELO（智能体榜为百分比信号）计算排名，反映用户主观偏好而非绝对能力测试；不同分榜相互独立，不宜跨榜比较，分差在误差范围内均视为并列，新模型也需积累一定投票量后才会正式入榜。

综合榜

综合榜头部格局保持稳定，claude-fable-5 以 1508 分蝉联第一，claude-opus-4-6-high 和 claude-opus-4-7-high 分别以 1504 分、 1502 分位列二、三名，三者分差均在 30 分以内，在误差范围内视为接近。

本周最大变化是新入榜的 glm-5.3-max 直接来到第 13 名，表现突出； kimi-k3-max 上升 2 位来到第 10 名，首次进入前十； muse-spark-1.1 上升 3 位至第 8 名。同时本周有 gpt-5.5-instant 、 claude-opus-4-8 两款新模型入榜，分别位列第 28、 29 名。qwen3.8-max 排名有所下滑，从第 8 名降至第 19 名。

国产模型在中上游占据多个席位，整体表现稳定：

月之暗面 kimi-k3-max 位列第 10 名，ELO 1489 分，较上周上升 2 位；

智谱 glm-5.3-max 位列第 13 名，ELO 1487 分，首次入榜；

阿里 qwen3.8-max 位列第 19 名，ELO 1481 分，较上周下降 11 位；

阿里 qwen3.7-max-preview 位列第 27 名，ELO 1474 分，排名基本持平。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-fable-5Anthropic1508 ±524331$10 / $501M

2-claude-opus-4-6-highAnthropic1504 ±472359$5 / $251M

3-claude-opus-4-7-highAnthropic1502 ±460203$5 / $251M

4-muse-spark-1.2 (xHigh)Meta1498 ±103257$1.25 / $4.25N/A

5-claude-opus-4-6Anthropic1497 ±376362$5 / $251M

6-claude-opus-4-7Anthropic1494 ±461304$5 / $251M

7-claude-opus-5-highAnthropic1493 ±527610$5 / $251M

8↑ 3muse-spark-1.1Meta1491 ±520242$1.25 / $4.25N/A

9-gemini-3.7-flash-highGoogle1490 ±85718$0.75 / $3.571.05M

10↑ 2kimi-k3-maxMoonshot1489 ±615054N/AN/A

— 以下为 Top 10 外的国产模型 —

13新上榜glm-5.3-maxZ.ai1487 ±103751$1.4 / $4.41.05M

19↓ 11qwen3.8-maxAlibaba1481 ±79955$2 / $61M

27↓ 1qwen3.7-max-previewAlibaba1474 ±103712$1.48 / $4.431M

代码榜

代码榜头部发生微调，claude-opus-4-7-high 升至榜首，ELO 1552 分，claude-opus-4-6-high 位列第二，原本榜首的 claude-fable-5 降至第三，三者 ELO 分差仅为 1 分，在误差范围内属于并列水平。智谱 glm-5.3-max 首次入榜即杀入前十，位列第 10 名，ELO 1531 分，首秀表现亮眼。grok-4.20-beta1 新入榜位列第 20 名； claude-sonnet-4-5-20250929-high-32k 、 gpt-5.5-high 两款新模型也完成首次排名。qwen3.8-max 排名下滑明显，从第 13 名降至第 25 名。

国产模型在代码榜中已有多款进入前三十，具体排名如下：

月之暗面 kimi-k3-max 位列第 6 名，ELO 1542 分，排名基本持平；

智谱 glm-5.3-max 位列第 10 名，ELO 1531 分，首次入榜；

阿里 qwen3.7-max-preview 位列第 17 名，ELO 1524 分，排名基本持平；

阿里 qwen3.8-max 位列第 25 名，ELO 1520 分，较上周下降 12 位；

小米 mimo-v2.5-pro 位列第 27 名，ELO 1519 分，排名基本持平。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1↑ 1claude-opus-4-7-highAnthropic1552 ±617212$5 / $251M

2↑ 1claude-opus-4-6-highAnthropic1551 ±618844$5 / $251M

3↓ 2claude-fable-5Anthropic1551 ±86552$10 / $501M

4-claude-opus-4-7Anthropic1547 ±617362$5 / $251M

5-claude-opus-4-6Anthropic1546 ±521288$5 / $251M

6-kimi-k3-maxMoonshot1542 ±103966N/AN/A

7↑ 2claude-opus-5-highAnthropic1533 ±87416$5 / $251M

8↓ 1claude-opus-4-8-highAnthropic1533 ±712425$5 / $251M

9↓ 1muse-spark-1.2 (xHigh)Meta1531 ±20939$1.25 / $4.25N/A

10新上榜glm-5.3-maxZ.ai1531 ±19994$1.4 / $4.41.05M

— 以下为 Top 10 外的国产模型 —

17-qwen3.7-max-previewAlibaba1524 ±181119$1.48 / $4.431M

25↓ 12qwen3.8-maxAlibaba1520 ±112970$2 / $61M

27↓ 2mimo-v2.5-proXiaomi1519 ±614938$0.44 / $0.871.05M

前端开发榜

前端开发榜头部依旧稳定，claude-opus-5-max 以 1691 分蝉联第一，国产 kimi-k3-max 和 qwen3.8-max 稳定占据二、三名，ELO 分别为 1674 分和 1669 分，与榜首分差在 30 分以内，误差范围内视为接近。新入榜的 glm-5.3-max 直接来到第 8 名，qwen3.8-27b 首次入榜位列第 9 名，两款国产新模型均进入前十，表现突出。目前已有多款国产模型进入前十五，在前端开发领域竞争力显著。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-opus-5-maxAnthropic1691 ±98116$5 / $251M

2-kimi-k3-maxMoonshot1674 ±114546$3 / $151.05M

3-qwen3.8-maxAlibaba1669 ±133212$2 / $61M

4-claude-opus-5-highAnthropic1663 ±88659$5 / $251M

5-grok-4.6-highSpaceXAI1629 ±171523$2 / $6500K

6-claude-fable-5Anthropic1626 ±88382$10 / $501M

7-gpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89499$5 / $301.05M

8新上榜glm-5.3-maxZ.ai1599 ±151916$1.4 / $4.41.05M

9新上榜qwen3.8-27bAlibaba1595 ±132464$0.5 / $3N/A

10↓ 2gemini-3.7-flash-highGoogle1587 ±132552$0.75 / $3.571.05M

— 以下为 Top 10 外的国产模型 —

11↓ 2glm-5.2-maxZ.ai1582 ±88775$1.4 / $4.41M

12↓ 2deepseek-v4-pro-high-20260813DeepSeek1582 ±122869$1.32 / $3.96N/A

13↓ 2deepseek-v4-flash-highDeepSeek1579 ±113537$0.44 / $1.321.05M

26↓ 1seed-2.1-pro-previewBytedance1521 ±87679N/AN/A

28↓ 4hy3Tencent1518 ±122680$0.13 / $0.53262.1K

AI 生图榜

AI 生图榜头部格局稳定，gpt-image-2 (medium) 以 1381 分继续领跑，国产 seedream-5.0-pro 稳定保持第 8 名，qwen-image-3.0-pro 位列第 9 名，两款国产模型均进入前十，整体排名没有大幅波动。hunyuan-image-3.0 本周升至第 29 名，保持在前三十行列。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gpt-image-2 (medium)OpenAI1381 ±570065$8 / $30N/A

2-mai-image-2.6-previewMicrosoft AI1336 ±113488N/AN/A

3-grok-imagine-image-2.0 (low)SpaceXAI1316 ±122676N/AN/A

4-reve-2.1Reve1302 ±87588N/AN/A

5-muse-imageMeta1282 ±715119N/AN/A

6-reve-2.0Reve1270 ±614641N/AN/A

7-gemini-3.1-flash-image (nano-banana-2) [web-search]Google1264 ±529102N/AN/A

8-seedream-5.0-proBytedance1258 ±528830N/AN/A

9-qwen-image-3.0-proAlibaba1257 ±94705N/AN/A

10-mai-image-2.5Microsoft AI1256 ±446329N/AN/A

— 以下为 Top 10 外的国产模型 —

16↑ 1qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612021N/AN/A

29↑ 1hunyuan-image-3.0Tencent1151 ±3173345N/AN/A

AI 视频榜

AI 视频榜中，字节跳动新发布的 dreamina-seedance-2.5-720p 首次入榜即来到第 4 名，ELO 1477 分，紧随其前代产品 dreamina-seedance-2.0-720p 之后，两款国产模型均进入前五，表现亮眼。gemini-omni-flash 继续以 1512 分排名第一，flux-3-video 位列第二，dreamina-seedance-2.0-720p 保持第三。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gemini-omni-flashGoogle1512 ±1116916N/AN/A

2-flux-3-videoBlack Forest Labs1494 ±171291N/AN/A

3-dreamina-seedance-2.0-720pBytedance1482 ±1049058N/AN/A

4新上榜dreamina-seedance-2.5-720pBytedance1477 ±191337N/AN/A

5↓ 1muse-videoMeta1457 ±152176N/AN/A

6↓ 1minimax-h3MiniMax1453 ±133081N/AN/A

7↓ 1happyhorse-1.0Alibaba-ATH1428 ±1322113N/AN/A

8↓ 1sora-2-proOpenAI1364 ±746509$0 / $0.3N/A

9↓ 1veo-3.1-audioGoogle1364 ±1413743$0 / $0.4N/A

10↓ 1veo-3.1-audio-1080pGoogle1363 ±1024979N/AN/A

— 以下为 Top 10 外的国产模型 —

15↓ 1wan2.7-t2vAlibaba1344 ±917769N/AN/A

18↓ 1wan2.6-t2vAlibaba1330 ±844304N/AN/A

19↓ 1seedance-v1.5-proBytedance1256 ±775990N/AN/A

21↓ 1wan2.5-t2v-previewAlibaba1249 ±928239N/AN/A

智能体榜

智能体榜头部依旧由 Anthropic 模型占据，Claude Opus 5 (High) 以 12.47% 的净提升度保持第一，Claude Opus 5 (Max) 上升一位至第二，Claude Fable 5 (High) 降至第三，三者净提升度差距小于置信区间，在误差范围内视为接近。月之暗面 Kimi K3 (Max) 上升一位至第四，净提升度 10.41%，任务确认成功率达到 17.97%，整体表现已经进入头部梯队。本周 DeepSeek V4 Pro (High) (0813) 和 Qwen3.8 Max 两款国产模型新入榜，分别位列第 14 和第 15 名，表现不俗。

国产模型在智能体榜已有多款进入前三十，头部已经摸到第一梯队门槛：

月之暗面 Kimi K3 (Max) 排名第 4，净提升度 10.41%，任务确认成功率 17.97%，较上周上升 1 位；

深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14，净提升度 6.26%，任务确认成功率 13.06%，首次入榜；

阿里 Qwen3.8 Max 排名第 15，净提升度 6.20%，工具幻觉率仅 0.18%，首次入榜；

智谱 GLM 5.2 (Max) 排名第 17，净提升度 5.82%，较上周下降 3 位；

深度求索 Deepseek V4 Flash (High) (20260731) 排名第 20，净提升度 3.99%。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性

1-Claude Opus 5 (High)Anthropic12.47% ±1.54%15.41% ±3.16%20.52% ±5.59%11.15% ±2.98%

2↑ 1Claude Opus 5 (Max)Anthropic12% ±1.8%18.52% ±3.24%19.13% ±6.56%6.65% ±3.66%

3↓ 1Claude Fable 5 (High)Anthropic11.57% ±1.7%12.44% ±3.24%21.37% ±5.95%8.99% ±3.55%

4↑ 1Kimi K3 (Max)Moonshot10.41% ±0.62%17.97% ±1.23%18.31% ±2.23%5.96% ±1.13%

5↓ 1GPT 5.6 Sol (xHigh)OpenAI9.74% ±1.39%10% ±2.87%22.2% ±5.11%5.77% ±2.88%

6-Claude Opus 4.8 (High)Anthropic9.55% ±1.51%8.26% ±2.7%21.65% ±4.97%9.01% ±2.86%

7-GPT 5.5 (xHigh)OpenAI8.51% ±0.93%4.42% ±1.96%13.46% ±3.23%8.86% ±1.76%

8-Claude Opus 4.7 (High)Anthropic8.12% ±1.24%5.62% ±2.53%12.36% ±4.17%8.44% ±2.47%

9-GPT 5.5 (High)OpenAI7.74% ±0.84%4.09% ±1.74%11.26% ±2.94%9.12% ±1.56%

10-Claude Opus 4.7Anthropic7.4% ±1.25%4.99% ±2.59%11.51% ±4.09%9.32% ±2.45%

— 以下为 Top 10 外的国产模型 —

14新上榜DeepSeek V4 Pro (High) (0813)DeepSeek6.26% ±1.28%13.06% ±2.65%3.82% ±4.37%2.35% ±2.83%

15新上榜Qwen3.8 MaxAlibaba6.2% ±1.36%11.62% ±3.03%6.81% ±4.79%4% ±2.67%

17↓ 3GLM 5.2 (Max)Z.ai5.82% ±0.87%7.24% ±1.87%9.42% ±2.99%5.22% ±1.53%

20↓ 1Deepseek V4 Flash (High) (20260731)DeepSeek3.99% ±0.79%8.09% ±1.89%2.15% ±2.64%3.45% ±1.5%

27↓ 2Kimi K2.7 CodeMoonshot0.43% ±2.07%3.72% ±4.42%1.53% ±6.94%2.59% ±4.69%

28-DeepSeek V4 ProDeepSeek0.05% ±0.88%2.66% ±2.21%2.39% ±2.82%0.15% ±1.66%

29↓ 3GLM 5.1Z.ai0% ±0.75%0.93% ±1.69%0.28% ±2.27%0.97% ±1.4%

本周 Arena 榜单迎来多款国产新模型亮相，智谱 glm-5.3-max 在综合榜、代码榜、前端开发榜均取得出色排名，月之暗面 kimi-k3-max 首次杀入综合榜前十，智能体榜也进入前四，字节跳动新模型 dreamina-seedance-2.5-720p 在 AI 视频榜直接进入前五，国产模型整体在多个维度继续突破。接下来随着更多国产大模型新版本发布，预计排名竞争将进一步加剧，值得后续关注。
