# AI 大模型周榜：阿里 qwen3.8-max 冲进综合榜 Top 6，国产多模型表现亮眼

- 来源：IT之家（RSS）
- 发布时间：2026-08-10 17:02
- AIHOT 分数：65
- AIHOT 链接：https://aihot.virxact.com/items/cmsn0igsm03llrognqdzg0qjm
- 原文链接：https://www.ithome.com/0/987/938.htm

## AI 摘要

Arena 发布 2026 年第 32 周 AI 大模型盲测排名，阿里 qwen3.8-max 以 ELO 1497 分杀入综合榜第 6 名，Meta 新模型 muse-spark-1.2 (xHigh) 首秀位列第 4。

## 正文

IT之家 8 月 10 日消息，Arena（arena.ai）平台发布 2026 年第 32 周（8 月 3 日 ~8 月 9 日）AI 大模型盲测排名，本周共有多款新模型入榜，其中国产模型阿里 qwen3.8-max 表现突出，杀入综合榜第 6 名，ELO 分数达到 1497 分，整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名，成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相，国产模型在前端开发、代码、生图等领域均实现突破。

IT之家注：本榜单基于 Arena（arena.ai）平台匿名盲测投票，通过 ELO（智能体榜为百分比信号）计算排名，反映用户主观偏好而非绝对能力测试；不同分榜相互独立，不宜跨榜比较，分差在误差范围内均视为并列，新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定，Anthropic 旗下 claude-fable-5 依旧占据榜首位置，ELO 分数为 1507 分，claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名，三者分差均在 10 分以内，在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部：Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4，ELO 1498 分；阿里全新 qwen3.8-max 拿到第 6 名，ELO 1497 分，与第 5 名的 claude-opus-4-6 同分，仅因置信区间差异排名靠后，同样在统计误差范围内并列。头部整体分数密集，前 10 名分数均在 1488 分以上，竞争极为激烈。

国产模型在综合榜已有多款进入中上游，具体排名如下：

阿里 qwen3.8-max 排名第 6 名，ELO 1497 分；

月之暗面 kimi-k3-max 排名第 14 名，ELO 1485 分，排名持平；

阿里 qwen3.7-max-preview 排名第 23 名，ELO 1475 分，排名下降 2 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-fable-5Anthropic1507 ±619390$10 / $501M

2-claude-opus-4-6-thinkingAnthropic1505 ±469336$2.5 / $12.51M

3-claude-opus-4-7-thinkingAnthropic1502 ±457018$5 / $251M

4新上榜muse-spark-1.2 (xHigh)Meta1498 ±132057$1.25 / $4.25N/A

5↓ 1claude-opus-4-6Anthropic1497 ±373158$2.5 / $12.51M

6新上榜qwen3.8-maxAlibaba1497 ±94662$2 / $61M

7↓ 2claude-opus-4-7Anthropic1493 ±458135$5 / $251M

8↓ 2claude-opus-5-highAnthropic1493 ±614902$5 / $251M

9↓ 2claude-opus-5-maxAnthropic1488 ±87137$5 / $251M

10↓ 1muse-sparkMeta1488 ±613476N/AN/A

— 以下为 Top 10 外的国产模型 —

14↓ 2kimi-k3-maxMoonshot1485 ±79861N/AN/A

23↓ 2qwen3.7-max-previewAlibaba1475 ±103695$1.48 / $4.431M

代码榜

代码榜头部依旧被 Anthropic 模型垄断，claude-fable-5 蝉联第一，ELO 1553 分，claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位，ELO 分数上涨 11 分至 1542 分，闯入 Top 6，成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8，ELO 1532 分，同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15，ELO 1526 分。

国产模型在代码榜已有多款进入前 30，具体如下：

月之暗面 kimi-k3-max 排名第 6 名，ELO 1542 分，较上周上升 2 位；

阿里 qwen3.8-max 排名第 8 名，ELO 1532 分；

阿里 qwen3.7-max-preview 排名第 17 名，ELO 1526 分，排名下滑 1 位；

小米 mimo-v2.5-pro 排名第 28 名，ELO 1519 分，排名持平；

智谱 glm-5.1 排名第 30 名，ELO 1517 分，较上周下降 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-fable-5Anthropic1553 ±95234$10 / $501M

2-claude-opus-4-7-thinkingAnthropic1552 ±616303$5 / $251M

3-claude-opus-4-6-thinkingAnthropic1551 ±618015$2.5 / $12.51M

4-claude-opus-4-6Anthropic1547 ±620444$2.5 / $12.51M

5-claude-opus-4-7Anthropic1546 ±616534$5 / $251M

6↑ 2kimi-k3-maxMoonshot1542 ±122611N/AN/A

7↓ 1claude-opus-4-8-thinkingAnthropic1535 ±710509$2.5 / $12.51M

8新上榜qwen3.8-maxAlibaba1532 ±161411$2 / $61M

9↑ 1muse-spark-1.1Meta1532 ±104199$1.25 / $4.25N/A

10↓ 1claude-opus-4-5-20251101- thinking-32kAnthropic1530 ±77603$5 / $25200K

— 以下为 Top 10 外的国产模型 —

17↓ 1qwen3.7-max-previewAlibaba1526 ±181112$1.48 / $4.431M

28-mimo-v2.5-proXiaomi1519 ±713199$0.44 / $0.871.05M

30↓ 3glm-5.1Z.ai1517 ±710330$1.4 / $4.4202.8K

前端开发榜

本周前端开发榜榜首依旧是 claude-opus-5-max，ELO 1686 分，月之暗面 kimi-k3-max 稳定保持第二位，ELO 1675 分，仅下跌 1 分，仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名，ELO 1667 分，直接进入前五，表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜，排名第 8 位，ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置，整体竞争力持续提升。

国产模型具体排名如下：

月之暗面 kimi-k3-max 排名第 2 名，ELO 1675 分，排名持平；

阿里 qwen3.8-max 排名第 4 名，ELO 1667 分；

智谱 glm-5.2-max 排名第 7 名，ELO 1588 分，上升 1 位；

深度求索 deepseek-v4-flash-high 排名第 8 名，ELO 1581 分，首次入榜。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-opus-5-maxAnthropic1686 ±114029$5 / $251M

2-kimi-k3-maxMoonshot1675 ±124372$3 / $151.05M

3-claude-opus-5-highAnthropic1670 ±105145$5 / $251M

4新上榜qwen3.8-maxAlibaba1667 ±161980$2 / $61M

5↓ 1claude-fable-5Anthropic1630 ±96816$10 / $501M

6↓ 1gpt-5.6-sol-xhigh (codex-harness)OpenAI1620 ±96903$5 / $301.05M

7↓ 1glm-5.2-maxZ.ai1588 ±96924$1.4 / $4.41M

8新上榜deepseek-v4-flash-highDeepSeek1581 ±151931$0.14 / $0.281.05M

9↓ 1claude-opus-4-8-thinkingAnthropic1565 ±89549$2.5 / $12.51M

10↓ 1claude-opus-4-7Anthropic1560 ±712398$5 / $251M

— 以下为 Top 10 外的国产模型 —

21↓ 3seed-2.1-pro-previewBytedance1524 ±96069N/AN/A

24↓ 1hy3Tencent1522 ±151729$0.13 / $0.53262.1K

25↓ 3qwen3.7-max-20260517Alibaba1516 ±88044$1.48 / $4.431M

26↓ 2glm-5.1Z.ai1515 ±87853$1.4 / $4.4202.8K

27↓ 2kimi-k2.6Moonshot1510 ±89261$0.95 / $4262.1K

智能体榜

智能体榜本周头部发生更替，Anthropic Claude Opus 5 (High) 从第三名上升至第一名，净提升度达到 11.99%，此前榜首 Claude Fable 5 (High) 降至第二，净提升度 11.66%，两者净提升度差距小于双方置信区间之和，在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名，净提升度 10.08%，任务确认成功率达到 14.97%，已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21，净提升度 2.84%，任务确认成功率达到 8.53%，首秀表现符合预期。

国产模型在智能体榜已有多款进入前 30，具体如下：

月之暗面 Kimi K3 (Max) 排名第 5 名，净提升度 10.08%，任务确认成功率 14.97%，排名持平；

智谱 GLM 5.2 (Max) 排名第 12 名，净提升度 6.75%，排名持平；

深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名，净提升度 2.84%，首次入榜；

智谱 GLM 5.1 排名第 24 名，净提升度 0.35%，排名下降 2 位。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性

1↑ 2Claude Opus 5 (High)Anthropic11.99% ±1.37%16.04% ±2.79%19.46% ±5.19%10.29% ±2.51%

2↓ 1Claude Fable 5 (High)Anthropic11.66% ±2.39%11.47% ±4.46%22.56% ±8.25%10.01% ±4.93%

3↓ 1Claude Opus 5 (Max)Anthropic11.19% ±1.62%16.36% ±3.11%19.07% ±6.03%5.8% ±3.1%

4-GPT 5.6 Sol (xHigh)OpenAI10.28% ±1.72%9.06% ±3.48%22.7% ±6.42%8.42% ±3.5%

5-Kimi K3 (Max)Moonshot10.08% ±1.07%14.97% ±2.09%19.68% ±3.85%7.45% ±1.97%

6-Claude Opus 4.8 (Thinking)Anthropic9.35% ±1.7%8.81% ±2.9%21.46% ±5.38%8.5% ±3.08%

7↑ 1GPT 5.5 (xHigh)OpenAI8.45% ±0.99%5.24% ±2.08%13.56% ±3.55%8.19% ±1.8%

8↑ 1Claude Opus 4.7 (Thinking)Anthropic8.33% ±1.32%6.65% ±2.76%11.87% ±4.59%8.61% ±2.72%

9↓ 2Claude Sonnet 5 (High)Anthropic7.46% ±2.15%5.56% ±4.29%14.8% ±7.65%5.14% ±4.55%

10↑ 1Claude Opus 4.7Anthropic7.32% ±1.36%5.55% ±2.85%10.72% ±4.45%9.54% ±2.7%

— 以下为 Top 10 外的国产模型 —

12-GLM 5.2 (Max)Z.ai6.75% ±0.9%9.21% ±1.83%12.39% ±3.21%5.62% ±1.59%

21新上榜Deepseek V4 Flash (High) (20260731)DeepSeek2.84% ±1.1%8.53% ±2.54%0.46% ±3.64%0.43% ±2.19%

23-Kimi K2.7 CodeMoonshot0.69% ±1.94%4.12% ±4.08%2.36% ±6.68%1.92% ±4.37%

24↓ 2GLM 5.1Z.ai0.35% ±0.77%1.06% ±1.72%0.72% ±2.5%0.76% ±1.4%

25-Qwen3.7 MaxAlibaba0.16% ±0.88%0.24% ±2.11%5.07% ±2.72%0.21% ±1.55%

26-DeepSeek V4 ProDeepSeek0.33% ±0.86%2.74% ±2.16%3.35% ±2.78%0.3% ±1.54%

27↑ 2Kimi K2.6Moonshot0.48% ±2.16%2.28% ±4.11%2.12% ±6.8%1.66% ±4.49%

30↓ 3Hy3Tencent1.12% ±1.42%2.2% ±3.04%3.7% ±4.91%9.01% ±2.6%

AI 生图榜

本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一，ELO 1380 分，SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名，ELO 1320 分，表现出色。国产方面，阿里 qwen-image-3.0-pro 首次入榜排名第七，ELO 1258 分，字节跳动 seedream-5.0-pro 排名第八，ELO 1257 分，两款国产模型均进入前十，整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名，ELO 1151 分，表现稳定。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gpt-image-2 (medium)OpenAI1380 ±569194N/AN/A

2新上榜grok-imagine-image-2.0 (low)SpaceXAI1320 ±122722N/AN/A

3↓ 1reve-2.1Reve1302 ±87598N/AN/A

4↓ 1muse-imageMeta1283 ±714510N/AN/A

5↓ 1reve-2.0Reve1270 ±614650N/AN/A

6↓ 1gemini-3.1-flash-image (nano-banana-2) [web-search]Google1263 ±527910N/AN/A

7新上榜qwen-image-3.0-proAlibaba1258 ±103735N/AN/A

8↓ 2seedream-5.0-proBytedance1257 ±526510N/AN/A

9↓ 2mai-image-2.5Microsoft AI1256 ±544940N/AN/A

10↓ 2gemini-3.1-flash-lite-image (nano-banana-2-lite)Google1251 ±616419N/AN/A

— 以下为 Top 10 外的国产模型 —

16↓ 2qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612026N/AN/A

29↓ 4hunyuan-image-3.0Tencent1151 ±3173366N/AN/A

AI 视频榜

AI 视频榜头部格局稳定，谷歌 gemini-omni-flash 依旧占据榜首，ELO 1513 分，字节跳动 dreamina-seedance-2.0-720p 保持第二名，ELO 1479 分，差距仅 34 分，接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四，ELO 1455 分，直接闯入前五，成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五，ELO 1428 分，同样保持稳定，国产模型已经占据榜单前五中的三个席位，优势明显。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gemini-omni-flashGoogle1513 ±1214571N/AN/A

2-dreamina-seedance-2.0-720pBytedance1479 ±1147067N/AN/A

3-muse-videoMeta1458 ±152160N/AN/A

4新上榜minimax-h3MiniMax1455 ±191060N/AN/A

5↓ 1happyhorse-1.0Alibaba-ATH1428 ±1321979N/AN/A

6↓ 1sora-2-proOpenAI1365 ±844543$0 / $0.3N/A

7-veo-3.1-audioGoogle1364 ±1413687$0 / $0.4N/A

8↓ 2veo-3.1-audio-1080pGoogle1363 ±1024846N/AN/A

9↓ 1veo-3.1-fast-audioGoogle1362 ±1139301$0 / $0.15N/A

10↓ 1veo-3.1-fast-audio-1080pGoogle1358 ±1025637N/AN/A

— 以下为 Top 10 外的国产模型 —

13↓ 2wan2.7-t2vAlibaba1347 ±915246N/AN/A

16↓ 1wan2.6-t2vAlibaba1330 ±941706N/AN/A

17↓ 1seedance-v1.5-proBytedance1256 ±775653N/AN/A

19↓ 2wan2.5-t2v-previewAlibaba1252 ±1025895N/AN/A

28↓ 1hailuo-2.3MiniMax1202 ±772127N/AN/A

29↓ 1hailuo-02-proMiniMax1198 ±139365N/AN/A

30↓ 1seedance-v1-proBytedance1190 ±1112117N/AN/A

本周 Arena 周榜迎来多款重量级新模型，国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破，阿里 qwen3.8-max 首秀即杀入头部梯队，证明国产大模型综合能力已经接近国际第一梯队水平，多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜，我们也将持续关注排名变化。
