# AI 大模型周榜：阿里千问 3.8-Max 空降综合前五，字节即梦 5.0 生图第六

- 来源：IT之家（RSS）
- 发布时间：2026-08-03 16:08
- AIHOT 分数：55
- AIHOT 链接：https://aihot.virxact.com/items/cmsd094cn0uatroeua3j9m6hg
- 原文链接：https://www.ithome.com/0/985/081.htm

## AI 摘要

Arena 发布 2026 年第 31 周 AI 大模型排行榜，阿里 qwen3.8-max 以 1496 分空降综合榜第 5 名，成为排名最高的国产模型，仅比榜首 claude-fable-5（1509 分）低 13 分。

## 正文

IT之家 8 月 3 日消息，Arena（arena.ai）平台 AI 大模型 2026 年第 31 周排行榜发布，本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。

本周榜单迎来大量新模型更新，国产模型亮点突出：阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5，月之暗面 kimi-k3-max 位列综合榜第 13 名，字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6，多款国产模型在细分榜单取得亮眼成绩。整体来看，本周国产模型在头部梯队占位进一步提升，与海外顶级模型差距继续缩小。

综合榜

本周综合榜头部几乎被 Anthropic 新品包揽，claude-fable-5 以 1509 分蝉联榜首，第二到第四名分别为 claude-opus-4-6-thinking （ 1505 分）、 claude-opus-4-7-thinking （ 1502 分）、 claude-opus-4-6 （ 1497 分），分数差距均在 30 分以内，在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名，仅比榜首低 13 分，成为目前排名最高的国产模型，表现极为突出。

国产模型在本次综合榜已有多款进入前 25 名，梯队分布如下：

阿里 qwen3.8-max 排名第 5，ELO 1496 分，为本次新入榜模型；

月之暗面 kimi-k3-max 排名第 13，ELO 1485 分，本次新入榜；

阿里 qwen3.7-max-preview 排名第 22，ELO 1475 分，排名持平。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 claude-fable-5Anthropic1509 ±617799$10 / $501M

2🇺🇸 claude-opus-4-6-thinkingAnthropic1505 ±467203$5 / $251M

3🇺🇸 claude-opus-4-7-thinkingAnthropic1502 ±454781$5 / $251M

4🇺🇸 claude-opus-4-6Anthropic1497 ±470970$5 / $251M

5🇨🇳 qwen3.8-max阿里1496 ±103327$2 / $61M

6🇺🇸 claude-opus-4-7Anthropic1492 ±455992$5 / $251M

7🇺🇸 claude-opus-5-highAnthropic1492 ±610704$5 / $251M

8🇺🇸 claude-opus-5-maxAnthropic1490 ±95124$5 / $251M

9🇺🇸 muse-spark-1.1Meta1490 ±612086$1.25 / $4.25N/A

10🇺🇸 muse-sparkMeta1488 ±613486N/AN/A

— 以下为 Top 10 外的国产模型 —

13🇨🇳 kimi-k3-max 预发布月之暗面1485 ±103556$3 / $151.05M

22🇨🇳 qwen3.7-max-preview 预发布阿里1475 ±103695$1.48 / $4.431M

代码榜

代码榜方面，claude-fable-5 以 1553 分从第二名升至榜首，claude-opus-4-7-thinking 以 1552 分紧随其后，两款模型分差仅 1 分，在统计误差范围内并列。头部前 8 名中，阿里 qwen3.8-max 以 1530 分位列第 10 名，月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名，国产模型首次有两款同时杀入代码榜 Top 10，进步显著。

国产模型在代码榜的具体排名如下：

月之暗面 kimi-k3-max 排名第 8，ELO 1531 分，本次新入榜，预发布状态；

阿里 qwen3.8-max 排名第 10，ELO 1530 分，本次新入榜，预发布状态；

阿里 qwen3.7-max-preview 排名第 17，ELO 1525 分，排名持平；

智谱 glm-5.1 排名第 28，ELO 1518 分，较上周下降 7 位；

小米 mimo-v2.5-pro 排名第 29，ELO 1518 分，排名下降 5 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 claude-fable-5Anthropic1553 ±94823$10 / $501M

2🇺🇸 claude-opus-4-7-thinkingAnthropic1552 ±615649$5 / $251M

3🇺🇸 claude-opus-4-6-thinkingAnthropic1551 ±617433$5 / $251M

4🇺🇸 claude-opus-4-6Anthropic1548 ±619814$5 / $251M

5🇺🇸 claude-opus-4-7Anthropic1547 ±615915$5 / $251M

6🇺🇸 claude-opus-4-8-thinkingAnthropic1534 ±79830$5 / $251M

7🇺🇸 claude-opus-5-highAnthropic1532 ±122918$5 / $251M

8🇨🇳 kimi-k3-max 预发布月之暗面1531 ±20947$3 / $151.05M

9🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77606$5 / $25200K

10🇨🇳 qwen3.8-max 预发布阿里1530 ±19991$2 / $61M

— 以下为 Top 10 外的国产模型 —

17🇨🇳 qwen3.7-max-preview 预发布阿里1525 ±181113$1.48 / $4.431M

28🇨🇳 glm-5.1智谱1518 ±79822$1.4 / $4.4202.8K

29🇨🇳 mimo-v2.5-pro小米1518 ±712665$0.44 / $0.871.05M

前端开发榜

前端开发榜中，claude-opus-5-max 以 1705 分守住榜首位置，月之暗面 kimi-k3-max 以 1676 分位列第二，阿里 qwen3.8-max 以 1668 分排名第四，国产模型共有三款进入 Top 8，占据半壁江山。kimi-k3-max 仅落后榜首 29 分，在统计误差范围内与头部海外模型非常接近。

国产模型整体处于中上游，具体排名如下：

月之暗面 kimi-k3-max 排名第 2，ELO 1676 分，预发布状态；

阿里 qwen3.8-max 排名第 4，ELO 1668 分，预发布状态；

智谱 glm-5.2-max 排名第 7，ELO 1586 分；

字节跳动 seed-2.1-pro-preview 排名第 19，ELO 1527 分，预发布状态；

阿里 qwen3.7-max-20260517 排名第 23，ELO 1517 分。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 claude-opus-5-maxAnthropic1705 ±152192$5 / $251M

2🇨🇳 kimi-k3-max 预发布月之暗面1676 ±124366$3 / $151.05M

3🇺🇸 claude-opus-5-highAnthropic1669 ±113873$5 / $251M

4🇨🇳 qwen3.8-max 预发布阿里1668 ±181563$2 / $61M

5🇺🇸 claude-fable-5Anthropic1630 ±96310$10 / $501M

6🇺🇸 gpt-5.6-sol-xhigh (codex-harness)OpenAI1620 ±96000$5 / $301.05M

7🇨🇳 glm-5.2-max 预发布智谱1586 ±96361$1.4 / $4.41M

8🇨🇳 deepseek-v4-flash-high 预发布深度求索1577 ±181319$0.14 / $0.281.05M

9🇺🇸 claude-opus-4-8-thinkingAnthropic1566 ±88934$5 / $251M

10🇺🇸 claude-opus-4-7Anthropic1561 ±711755$5 / $251M

— 以下为 Top 10 外的国产模型 —

19🇨🇳 seed-2.1-pro-preview 预发布字节跳动1527 ±95513N/AN/A

23🇨🇳 qwen3.7-max-20260517阿里1517 ±87840$1.48 / $4.431M

24🇨🇳 hy3 预发布腾讯1517 ±171491$0.13 / $0.53262.1K

25🇨🇳 glm-5.1 预发布智谱1516 ±87377$1.4 / $4.4202.8K

26🇨🇳 kimi-k2.6 预发布月之暗面1510 ±89256$0.95 / $4262.1K

30🇨🇳 minimax-m3 预发布MiniMax1491 ±88155$0.6 / $2.4N/A

智能体榜

智能体榜采用百分比信号评分体系，本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一，Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位，头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席，在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ，仅为 0.33% ，可控性最强的模型是 Nemotron 3 Ultra，达到 20.73% 。

国产模型在智能体榜的排名和净提升度如下：

MiniMax minimax-m3 排名第 33 名，净提升度 2.55% ，任务确认成功率 5.67%；

深度求索 DeepSeek V4 Flash 排名第 34 名，净提升度 2.96% ，任务确认成功率 4.9%；

小米 Mimo V2.5 Pro 排名第 32 名，净提升度 2.52% ，任务确认成功率 3.81%；

阿里 Qwen3.7 Max 排名第 25 名，净提升度 0.53% ，任务确认成功率 1.95%；

月之暗面 Kimi K3 (Max) 排名第 5 名，净提升度 9.91% ，任务确认成功率 14.23%，进入智能体榜 Top 5。

排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数

1🇺🇸 Claude Fable 5 (High)Anthropic12.58 ±2.1910.2624.4212.9323807

2🇺🇸 Claude Opus 5 (Max)Anthropic11.88 ±2.8117.5625.631.817253

3🇺🇸 Claude Opus 5 (High)Anthropic11.73 ±1.6616.624.45.4911114

4🇺🇸 GPT 5.6 Sol (xHigh)OpenAI10.02 ±1.638.6121.98.9616966

5🇨🇳 Kimi K3 (Max)月之暗面9.91 ±1.1914.2317.459.6719586

6🇺🇸 Claude Opus 4.8 (Thinking)Anthropic9.43 ±1.648.7521.059.7734477

7🇺🇸 Claude Sonnet 5 (High)Anthropic8.57 ±2.07.9516.126.7424657

8🇺🇸 GPT 5.5 (xHigh)OpenAI8.49 ±0.955.8212.918.2443122

9🇺🇸 Claude Opus 4.7 (Thinking)Anthropic8.19 ±1.266.1911.29.6535471

10🇺🇸 GPT 5.5 (High)OpenAI7.89 ±0.885.6311.319.1868340

— 以下为 Top 10 外的国产模型 —

19🇺🇸 Claude Opus 4.8Anthropic3.34 ±1.948.2412.758.3932551

20🇺🇸 Claude Sonnet 4.6Anthropic3.18 ±1.20.070.882.3935966

23🇨🇳 Kimi K2.7 Code月之暗面0.44 ±1.824.733.423.7110359

25🇨🇳 Qwen3.7 Max阿里0.53 ±0.971.955.890.220914

26🇨🇳 DeepSeek V4 Pro深度求索0.78 ±0.943.615.370.3921459

27🇨🇳 hy3腾讯1.03 ±1.881.552.838.178506

29🇨🇳 Kimi K2.6月之暗面1.09 ±1.953.11.584.910436

30🇨🇳 gemini-3.6-flash谷歌1.59 ±2.680.156.22.592532

31🇨🇳 Qwen3.7 Plus阿里1.65 ±1.291.727.984.6314112

32🇨🇳 Mimo V2.5 Pro小米2.52 ±1.013.818.052.1121399

33🇨🇳 Minimax M3MiniMax2.55 ±0.935.679.014.5620996

34🇨🇳 DeepSeek V4 Flash深度求索2.96 ±0.954.98.383.9820775

41🇨🇳 Minimax M2.7MiniMax11.59 ±1.1714.6715.7414.9421221

AI 生图榜

AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位，从第 11 名升至第 6 名，ELO 分数达到 1257 分，仅落后榜首 gpt-image-2 (medium) 124 分，成功杀入 Top 6，成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名，hunyuan-image-3.0 排名第 25，seedream-4.5 排名第 28，整体表现稳定。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 gpt-image-2 (medium)OpenAI1381 ±566665N/AN/A

2🇺🇸 reve-2.1Reve1300 ±86131N/AN/A

3🇺🇸 muse-imageMeta1281 ±713261N/AN/A

4🇺🇸 reve-2.0Reve1270 ±614563N/AN/A

5🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search]谷歌1263 ±625351N/AN/A

6🇨🇳 seedream-5.0-pro 预发布字节跳动1257 ±620977N/AN/A

7🇺🇸 mai-image-2.5Microsoft AI1254 ±541589N/AN/A

8🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite)谷歌1251 ±616201N/AN/A

9🇺🇸 gemini-3-pro-image-2k (nano-banana-pro)谷歌1246 ±3135981N/AN/A

10🇺🇸 gpt-image-1.5-high-fidelityOpenAI1239 ±3139642N/AN/A

— 以下为 Top 10 外的国产模型 —

14🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布阿里1191 ±611952N/AN/A

25🇨🇳 hunyuan-image-3.0 预发布腾讯1151 ±3172741N/AN/A

28🇨🇳 seedream-4.5 预发布字节跳动1147 ±3229805N/AN/A

30🇨🇳 seedream-4-2k 预发布字节跳动1140 ±712599N/AN/A

AI 视频榜

AI 视频榜头部格局稳定，gemini-omni-flash 以 1513 分继续排名第一，字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置，阿里 happyhorse-1.0 以 1428 分排名第四，两款国产模型稳居前五，表现稳定。国产模型共有 7 款进入前 30，整体占据中上游位置。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 gemini-omni-flash谷歌1513 ±1214571N/AN/A

2🇨🇳 dreamina-seedance-2.0-720p 预发布字节跳动1479 ±1147067N/AN/A

3🇺🇸 muse-videoMeta1458 ±152160N/AN/A

4🇨🇳 happyhorse-1.0 预发布阿里1428 ±1321979N/AN/A

5🇺🇸 sora-2-proOpenAI1365 ±844543$0 / $0.3N/A

6🇺🇸 veo-3.1-audio谷歌1364 ±1413687$0 / $0.4N/A

7🇺🇸 veo-3.1-audio-1080p谷歌1363 ±1024846N/AN/A

8🇺🇸 veo-3.1-fast-audio谷歌1362 ±1139301$0 / $0.15N/A

9🇺🇸 veo-3.1-fast-audio-1080p谷歌1358 ±1025637N/AN/A

10🇺🇸 grok-imagine-video-720pSpaceXAI1349 ±8151774N/AN/A

— 以下为 Top 10 外的国产模型 —

12🇨🇳 wan2.7-t2v 预发布阿里1347 ±915246N/AN/A

15🇨🇳 wan2.6-t2v 预发布阿里1330 ±941706N/AN/A

16🇨🇳 seedance-v1.5-pro 预发布字节跳动1256 ±775653N/AN/A

18🇨🇳 wan2.5-t2v-preview 预发布阿里1252 ±1025895N/AN/A

27🇨🇳 hailuo-2.3 预发布MiniMax1202 ±772127N/AN/A

28🇨🇳 hailuo-02-pro 预发布MiniMax1198 ±139365N/AN/A

29🇨🇳 seedance-v1-pro 预发布字节跳动1190 ±1112117N/AN/A

30🇨🇳 hailuo-02-standard 预发布MiniMax1180 ±129333N/AN/A

总结来看，本周 Arena AI 大模型周榜迎来密集更新，大量新模型首次入榜，国产模型整体取得突破性进展：阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5，代码榜和前端开发榜也均有国产模型进入 Top 10；字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6；AI 视频榜始终有两款国产模型稳居前五，月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距，后续新品发布值得期待。
