# AI 大模型周榜：Anthropic 多款新模型密集入榜，国产 kimi-k3-max 稳定头部

- 来源：IT之家（RSS）
- 发布时间：2026-08-17 16:02
- AIHOT 分数：38
- AIHOT 链接：https://aihot.virxact.com/items/cmswyu0vf088grox70x0lev0u
- 原文链接：https://www.ithome.com/0/990/681.htm

## AI 摘要

Arena 发布第 33 周 AI 大模型盲测排名，Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位，claude-fable-5 以 1506 分蝉联榜首。国产模型 kimi-k3-max 升至综合榜第 12 位，在前端开发榜保持第 2 名；qwen3.8-max 首次跻身智能体榜 Top 10。榜单基于匿名盲测投票，反映用户主观偏好而非绝对能力测试。

## 正文

IT之家 8 月 17 日消息，Arena（arena.ai）平台发布 2026 年第 33 周（8 月 10 日 ~8 月 16 日）AI 大模型盲测排名，本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位，国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位，在前端开发榜也保持第 2 位，qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置，在前端开发等细分领域已经形成对头部海外模型的紧追态势。

IT之家注：本榜单基于 Arena（arena.ai）平台匿名盲测投票，通过 ELO（智能体榜为百分比信号）计算排名，反映用户主观偏好而非绝对能力测试；不同分榜相互独立，不宜跨榜比较，分差在误差范围内均视为并列，新模型也需积累一定投票量后才会正式入榜。

综合榜

本期综合榜头部几乎被 Anthropic 新模型包揽，claude-fable-5 以 1506 分蝉联榜首，新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二，同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内，属于误差范围内的并列。

谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名，表现亮眼。国产模型方面，kimi-k3-max 上升 2 位至第 12 名，是排名最高的国产模型。

国产模型整体处于榜单中上游，具体排名如下：

月之暗面 kimi-k3-max 位列第 12 名，ELO 1489 分，较上周上升 2 位；

阿里 qwen3.8-max 位列第 8 名，ELO 1491 分，较上周下降 2 位；

阿里 qwen3.7-max-preview 位列第 26 名，ELO 1474 分，较上周下降 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-fable-5Anthropic1506 ±521533$10 / $501M

2新上榜claude-opus-4-6-highAnthropic1505 ±472516$5 / $251M

3新上榜claude-opus-4-7-highAnthropic1502 ±460331$5 / $251M

4-muse-spark-1.2 (xHigh)Meta1498 ±103280$1.25 / $4.25N/A

5-claude-opus-4-6Anthropic1497 ±376474$5 / $251M

6↑ 1claude-opus-4-7Anthropic1494 ±461419$5 / $251M

7↑ 1claude-opus-5-highAnthropic1493 ±520030$5 / $251M

8↓ 2qwen3.8-maxAlibaba1491 ±87004$2 / $61M

9新上榜gemini-3.7-flash-highGoogle1490 ±85744$0.75 / $3.571.05M

10↓ 1claude-opus-5-maxAnthropic1489 ±79679$5 / $251M

— 以下为 Top 10 外的国产模型 —

12↑ 2kimi-k3-maxMoonshot1489 ±611969N/AN/A

26↓ 3qwen3.7-max-previewAlibaba1474 ±103717$1.48 / $4.431M

代码榜

代码榜格局同样由 Anthropic 新模型主导，claude-fable-5 以 1554 分守住榜首位置，新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分别以 1552 分、 1551 分占据第二、第三名，分数差距极小，误差范围内视为并列。kimi-k3-max 稳定在第六名，ELO 分数上涨 2 分，依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名，是本周涨幅最大的头部模型。

国产模型在代码榜占据多个中上游席位，具体排名如下：

月之暗面 kimi-k3-max 排名最高，位列第 6 名，ELO 1544 分，排名不变；

阿里 qwen3.8-max 位列第 13 名，ELO 1529 分，较上周下降 5 位；

阿里 qwen3.7-max-preview 位列第 17 名，ELO 1525 分，排名不变；

小米 mimo-v2.5-pro 位列第 25 名，ELO 1520 分，较上周上升 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-fable-5Anthropic1554 ±95817$10 / $501M

2新上榜claude-opus-4-7-highAnthropic1552 ±617272$5 / $251M

3新上榜claude-opus-4-6-highAnthropic1551 ±618894$5 / $251M

4↑ 1claude-opus-4-7Anthropic1548 ±617423$5 / $251M

5↓ 1claude-opus-4-6Anthropic1547 ±621341$5 / $251M

6-kimi-k3-maxMoonshot1544 ±113176N/AN/A

7新上榜claude-opus-4-8-highAnthropic1533 ±711417$5 / $251M

8↑ 7muse-spark-1.2 (xHigh)Meta1533 ±20947$1.25 / $4.25N/A

9↑ 2claude-opus-5-highAnthropic1531 ±95433$5 / $251M

10↓ 1muse-spark-1.1Meta1531 ±95002$1.25 / $4.25N/A

— 以下为 Top 10 外的国产模型 —

13↓ 5qwen3.8-maxAlibaba1529 ±132146$2 / $61M

17-qwen3.7-max-previewAlibaba1525 ±181120$1.48 / $4.431M

25↑ 3mimo-v2.5-proXiaomi1520 ±713986$0.44 / $0.871.05M

前端开发榜

前端开发榜头部格局稳定，claude-opus-5-max 以 1692 分蝉联第一，国产 kimi-k3-max 以 1674 分保持第二名位置，仅落后 18 分，依然对榜首形成紧逼。阿里 qwen3.8-max 上升 1 位至第三名，ELO 分数 1667 分，深度求索的 deepseek-v4-pro-high-20260813 作为新模型首次入榜即拿到第 10 名，ELO 分数 1584 分，表现不俗。

国产模型在前端开发榜占据多个头部和中上游位置，具体如下：

月之暗面 kimi-k3-max 位列第 2 名，ELO 1674 分，排名不变；

阿里 qwen3.8-max 位列第 3 名，ELO 1667 分，较上周上升 1 位；

智谱 glm-5.2-max 位列第 9 名，ELO 1585 分，较上周下降 2 位；

深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名，ELO 1584 分；

深度求索 deepseek-v4-flash-high 位列第 11 名，ELO 1581 分，排名下降 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-claude-opus-5-maxAnthropic1692 ±96448$5 / $251M

2-kimi-k3-maxMoonshot1674 ±114546$3 / $151.05M

3↑ 1qwen3.8-maxAlibaba1667 ±132855$2 / $61M

4↓ 1claude-opus-5-highAnthropic1663 ±97334$5 / $251M

5新上榜grok-4.6-highSpaceXAI1631 ±171513$2 / $6500K

6↓ 1claude-fable-5Anthropic1627 ±87867$10 / $501M

7↓ 1gpt-5.6-sol-xhigh (codex-harness)OpenAI1622 ±88595$5 / $301.05M

8新上榜gemini-3.7-flash-highGoogle1587 ±132543$0.75 / $3.571.05M

9↓ 2glm-5.2-maxZ.ai1585 ±88142$1.4 / $4.41M

10新上榜deepseek-v4-pro-high-20260813DeepSeek1584 ±142180N/AN/A

— 以下为 Top 10 外的国产模型 —

11↓ 3deepseek-v4-flash-highDeepSeek1581 ±122936$0.44 / $1.321.05M

24-hy3Tencent1522 ±132284$0.13 / $0.53262.1K

25↓ 4seed-2.1-pro-previewBytedance1522 ±87121N/AN/A

27↓ 2qwen3.7-max-20260517Alibaba1517 ±88373$1.48 / $4.431M

29↓ 3glm-5.1Z.ai1510 ±78817$1.4 / $4.4202.8K

30↓ 3kimi-k2.6Moonshot1509 ±79589$0.95 / $4262.1K

AI 生图榜

AI 生图榜中，gpt-image-2 (medium) 以 1381 分继续稳坐榜首，微软新模型 mai-image-2.6-preview 首次入榜就拿到第二名，ELO 分数 1336 分，直接跻身头部梯队。国产 seedream-5.0-pro 守住第八名，ELO 分数 1258 分，qwen-image-3.0-pro 位列第九名，两者分数差距仅 1 分，在误差范围内并列。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gpt-image-2 (medium)OpenAI1381 ±570065N/AN/A

2新上榜mai-image-2.6-previewMicrosoft AI1336 ±113488N/AN/A

3↓ 1grok-imagine-image-2.0 (low)SpaceXAI1316 ±122676N/AN/A

4↓ 1reve-2.1Reve1302 ±87588N/AN/A

5↓ 1muse-imageMeta1282 ±715119N/AN/A

6↓ 1reve-2.0Reve1270 ±614641N/AN/A

7↓ 1gemini-3.1-flash-image (nano-banana-2) [web-search]Google1264 ±529102N/AN/A

8-seedream-5.0-proBytedance1258 ±528830N/AN/A

9↓ 2qwen-image-3.0-proAlibaba1257 ±94705N/AN/A

10↓ 1mai-image-2.5Microsoft AI1256 ±446329N/AN/A

— 以下为 Top 10 外的国产模型 —

17↓ 1qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612021N/AN/A

30↓ 1hunyuan-image-3.0Tencent1151 ±3173345N/AN/A

AI 视频榜

AI 视频榜头部迎来新变化，Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名，ELO 分数 1496 分，仅落后榜首 gemini-omni-flash 16 分。国产模型 dreamina-seedance-2.0-720p 保持第三名位置，ELO 分数 1478 分，minimax-h3 位列第五名，整体头部格局相对稳定。

排名较上周模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1-gemini-omni-flashGoogle1512 ±1115930N/AN/A

2新上榜flux-3-videoBlack Forest Labs1496 ±171288N/AN/A

3↓ 1dreamina-seedance-2.0-720pBytedance1478 ±948355N/AN/A

4↓ 1muse-videoMeta1457 ±152176N/AN/A

5↓ 1minimax-h3MiniMax1453 ±142192N/AN/A

6↓ 1happyhorse-1.0Alibaba-ATH1428 ±1322117N/AN/A

7↓ 1sora-2-proOpenAI1366 ±745731$0 / $0.3N/A

8↓ 1veo-3.1-audioGoogle1364 ±1413743$0 / $0.4N/A

9↓ 1veo-3.1-audio-1080pGoogle1363 ±1024981N/AN/A

10↓ 1veo-3.1-fast-audioGoogle1362 ±1039441$0 / $0.15N/A

— 以下为 Top 10 外的国产模型 —

14↓ 1wan2.7-t2vAlibaba1343 ±816757N/AN/A

17↓ 1wan2.6-t2vAlibaba1333 ±843230N/AN/A

18↓ 1seedance-v1.5-proBytedance1256 ±776001N/AN/A

20↓ 1wan2.5-t2v-previewAlibaba1249 ±927361N/AN/A

29↓ 1hailuo-2.3MiniMax1203 ±674338N/AN/A

30↓ 1hailuo-02-proMiniMax1198 ±129392N/AN/A

智能体榜

智能体榜中，Anthropic 模型继续垄断前三，Claude Opus 5 (High) 以 12.19% 的净提升度守住榜首位置。本次榜单有两款新模型进入前十，其中国产 Qwen3.8 Max 首次入榜即排名第 11 位，净提升度达到 7.61%，任务确认成功率 12.54%，工具幻觉率仅 0.11%，表现非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六，净提升度 9.78%。国产 Kimi K3 (Max) 稳定在第五名，净提升度 10.6%，任务确认成功率 15.55%，已经跻身全球智能体第一梯队。

国产模型在智能体榜已有多款进入中上游，具体如下：

月之暗面 Kimi K3 (Max) 位列第 5 名，净提升度 10.60%，任务确认成功率 15.55%，排名不变；

阿里 Qwen3.8 Max 新入榜位列第 11 名，净提升度 7.61%，任务确认成功率 12.54%；

智谱 GLM 5.2 (Max) 位列第 14 名，净提升度 6.74%，较上周下降 2 位；

深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名，净提升度 4.04%，较上周上升 2 位。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性

1-Claude Opus 5 (High)Anthropic12.19% ±1.45%15.35% ±3.03%19.26% ±5.29%11.34% ±2.79%

2-Claude Fable 5 (High)Anthropic12.01% ±2.57%10.66% ±4.9%25.14% ±9.01%8.84% ±5.23%

3-Claude Opus 5 (Max)Anthropic11.95% ±1.71%17.96% ±3.18%19.3% ±6.26%6.95% ±3.43%

4-GPT 5.6 Sol (xHigh)OpenAI10.86% ±1.8%10.12% ±3.69%23.03% ±6.72%9.23% ±3.74%

5-Kimi K3 (Max)Moonshot10.6% ±1.04%15.55% ±2.06%20.31% ±3.78%7.8% ±1.91%

6新上榜Claude Opus 4.8 (High)Anthropic9.78% ±1.78%9.45% ±3.1%22.52% ±5.71%8.44% ±3.33%

7-GPT 5.5 (xHigh)OpenAI8.9% ±1.03%4.97% ±2.18%14.61% ±3.62%9.17% ±1.92%

8新上榜Claude Opus 4.7 (High)Anthropic8.17% ±1.43%6.61% ±2.95%12.32% ±4.81%7.72% ±2.91%

9↑ 2GPT 5.5 (High)OpenAI7.73% ±0.97%4.03% ±2.04%11.62% ±3.39%8.59% ±1.79%

10-Claude Opus 4.7Anthropic7.66% ±1.45%5.45% ±3.08%11.57% ±4.71%9.95% ±2.87%

— 以下为 Top 10 外的国产模型 —

11新上榜Qwen3.8 MaxAlibaba7.61% ±1.6%12.54% ±3.32%11.64% ±5.58%5.34% ±3.09%

14↓ 2GLM 5.2 (Max)Z.ai6.74% ±0.9%8.39% ±1.91%11.6% ±3.18%6.14% ±1.58%

19↑ 2Deepseek V4 Flash (High) (20260731)DeepSeek4.04% ±0.81%8.7% ±1.93%2.46% ±2.71%3.34% ±1.57%

25↓ 2Kimi K2.7 CodeMoonshot1.08% ±2.15%4.43% ±4.55%2.74% ±7.27%1.76% ±4.86%

26↓ 2GLM 5.1Z.ai0.58% ±0.82%1.75% ±1.82%0.84% ±2.56%1.73% ±1.48%

27↓ 2Qwen3.7 MaxAlibaba0.2% ±0.87%0.34% ±2.13%4.24% ±2.67%0.03% ±1.52%

28↓ 2DeepSeek V4 ProDeepSeek0.14% ±0.88%2.16% ±2.21%2.5% ±2.82%0.59% ±1.63%

本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置，验证了其模型迭代的技术积累；国产模型方面，kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名，前端开发榜更是稳居第二，qwen3.8-max 在智能体榜首秀即进入 Top 11，整体来看国产大模型在通用能力和智能体领域都在持续推进，与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代，值得持续关注其排名表现。
