# Arena 第 30 周周榜：Kimi K3 蝉联前端开发榜全球第一，智能体榜表现突出

- 来源：IT之家（RSS）
- 发布时间：2026-07-27 16:35
- AIHOT 分数：39
- AIHOT 链接：https://aihot.virxact.com/items/cms3040ol06jzro3ffexw66o5
- 原文链接：https://www.ithome.com/0/982/095.htm

## AI 摘要

月之暗面旗下 kimi-k3 在 Arena 第 30 周榜单中以 1682 分卫冕前端开发榜全球第一，并在代码榜以 1530 分升至第 8 名，综合榜以 1485 分位列第 11。智能体榜中 kimi-k3 排名第 4，净提升度 9.71%，任务确认成功率 14.0% 为头部模型最高。Anthropic 的 claude-fable-5 以 1508 分继续领跑综合榜。

## 正文

IT之家 7 月 27 日消息，Arena（arena.ai）平台今日发布了 2026 年第 30 周的 AI 大模型排行数据，统计周期为 2026-07-20 ~ 2026-07-26。

本周国产模型表现亮眼，月之暗面旗下的 kimi-k3 蝉联前端开发榜全球第一，同时代码榜杀入 Top 10，成为本期最大亮点。

整体榜单中 Anthropic 旗下多款 Claude 新模型集中入榜，头部梯队集中在 1500 分区间，国产模型在多个细分赛道持续实现突破，不少模型进入对应榜单的头部序列，整体竞争力稳步提升。

综合榜

综合榜头部格局保持稳定，claude-fable-5 以 1508 分继续蝉联榜首，Anthropic 旗下多款 Claude 系列模型占据前 6 名位置，其中 claude-opus-4-6-thinking、claude-opus-4-7-thinking 等多款新模型完成入榜。

前 7 名模型的 ELO 分差均在 30 分以内，在误差范围内视为并列竞争状态。Meta 的 muse-spark-1.1 和 muse-spark 分别位列第 7 和第 8，谷歌的 gemini-3.1-pro-preview 上升 2 位来到第 9，前 10 名整体竞争十分胶着。

国产模型在综合榜中整体处于中上游位置，梯队相对完整：

月之暗面 kimi-k3 位列第 11 名，ELO 1485 分，较上周下降 2 位，是当前排名最高的国产模型；

阿里 qwen3.7-max-preview 位列第 20 名，ELO 1475 分，较上周下降 2 位；

智谱 glm-5.1 此前排名第 27，本周位列第 31 名；

智谱 glm-5.2 (max) 此前排名第 30，本周排名不变。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1 —🇺🇸 claude-fable-5Anthropic1508 ±615817$10 / $501M

2 —🇺🇸 claude-opus-4-6-thinkingAnthropic1505 ±464435$5 / $251M

3 —🇺🇸 claude-opus-4-7-thinkingAnthropic1502 ±451943$5 / $251M

4 —🇺🇸 claude-opus-4-6Anthropic1498 ±468145$5 / $251M

5 —🇺🇸 claude-opus-5-highAnthropic1495 ±85417$5 / $251M

6 —🇺🇸 claude-opus-4-7Anthropic1493 ±453093$5 / $251M

7 —🇺🇸 muse-spark-1.1Meta1493 ±79573$1.25 / $4.25N/A

8 —🇺🇸 muse-sparkMeta1488 ±613497N/AN/A

9 ↑2🇺🇸 gemini-3.1-pro-preview谷歌1486 ±386298$2 / $121.05M

10 ↓2🇺🇸 gemini-3-pro谷歌1486 ±441242$2 / $121.05M

— 以下为 Top 10 外的国产模型 —

11 ↓2🇨🇳 kimi-k3 预发布月之暗面1485 ±103569$3 / $151.05M

20 ↓2🇨🇳 qwen3.7-max-preview阿里1475 ±103698$1.48 / $4.431M

30 —🇨🇳 glm-5.2 (max)智谱 1469 ±619623$1.40 / $4.401M

31 ↓4🇨🇳 glm-5.1智谱 1469 ±532221$1.40 / $4.40202.8K

代码榜

代码榜头部依然由 Anthropic 旗下模型主导，claude-opus-4-7-thinking 以 1553 分守住榜首位置，前 5 名全部为 Anthropic Claude 系列模型，分差均在 5 分以内，竞争十分接近。

本期最大亮点是国产模型 kimi-k3 排名上升 2 位来到第 8 名，以 1530 分跻身代码榜 Top 10，与周边头部模型的分差也在 30 分的统计误差范围内，完全具备第一梯队的竞争力。

国产模型在代码榜中分布广泛，多个模型进入中上游序列，表现稳定：

月之暗面 kimi-k3 排名第 8 名，ELO 1530 分，较上周上升 2 位，是排名最高的国产代码模型；

阿里 qwen3.7-max-preview 排名第 15 名，ELO 1525 分，较上周下降 3 位；

智谱 glm-5.1 排名第 21 名，ELO 1520 分，较上周下降 4 位；

小米 mimo-v2.5-pro 排名第 24 名，ELO 1519 分，与上周排名相同；

月之暗面 kimi-k2.6 排名第 28 名，ELO 1515 分，较上周下降 2 位；

百度 ernie-5.1 此前排名第 27，本周来到第 31 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1 —🇺🇸 claude-opus-4-7-thinkingAnthropic1553 ±714800$5 / $251M

2 —🇺🇸 claude-fable-5Anthropic1551 ±104278$10 / $501M

3 ↑2🇺🇸 claude-opus-4-6-thinkingAnthropic1550 ±616646$5 / $251M

4 ↑1🇺🇸 claude-opus-4-7Anthropic1549 ±615069$5 / $251M

5 ↓1🇺🇸 claude-opus-4-6Anthropic1548 ±618952$5 / $251M

6 —🇺🇸 claude-opus-5-highAnthropic1540 ±171405$5 / $251M

7 ↓1🇺🇸 claude-opus-4-8-thinkingAnthropic1535 ±89039$5 / $251M

8 ↑2🇨🇳 kimi-k3 预发布月之暗面1530 ±20948$3 / $151.05M

9 ↓1🇺🇸 muse-spark-1.1Meta1530 ±122860$1.25 / $4.25N/A

10 ↑1🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77606$5 / $25200K

— 以下为 Top 10 外的国产模型 —

15 ↓3🇨🇳 qwen3.7-max-preview阿里1525 ±181113$1.48 / $4.431M

21 ↓4🇨🇳 glm-5.1智谱1520 ±79070$1.4 / $4.4202.8K

24 —🇨🇳 mimo-v2.5-pro小米1519 ±711974$0.44 / $0.871.05M

28 ↓2🇨🇳 kimi-k2.6月之暗面1515 ±710342$0.95 / $4262.1K

31 ↓4🇨🇳 ernie-5.1百度 1514±710243

前端开发榜

前端开发榜迎来历史性突破，国产模型 kimi-k3 以 1682 分卫冕榜首位置（上周 1679 分），超过了此前排名第一的 claude-opus-5-high，成为全球当前前端开发能力最强的大模型。

Anthropic 的 claude-opus-5-high 以 1673 分紧随其后位列第 2，claude-fable-5 落到第 3 名，OpenAI 的 gpt-5.6-sol-xhigh 排在第 4 名。

前 4 名之外的模型分数差距开始拉开，智谱的 glm-5.2 (max) 也进入了第 5 名，继续扩大国产模型在前端开发赛道的优势。

国产模型在前端开发榜中形成了庞大的梯队，近半数席位被国产模型占据，整体表现亮眼：

月之暗面 kimi-k3 登顶榜首，ELO 1682 分，与上周排名相同，是本期榜单最大亮点；

智谱 glm-5.2 (max) 排在第 5 名，ELO 1587 分，较上周下降 1 位；

字节跳动 seed-2.1-pro-preview 排在第 15 名，ELO 1529 分，较上周下降 1 位；

智谱 glm-5.1 排在第 18 名，ELO 1518 分，较上周下降 3 位；

腾讯 hy3 排在第 19 名，ELO 1518 分；

阿里 qwen3.7-max-20260517 排在第 20 名，ELO 1517 分；

月之暗面 kimi-k2.6 排在第 21 名，ELO 1510 分，较上周下降 3 位；

Minimax minimax-m3 排在第 24 名，ELO 1493 分；

阿里 qwen3.6-max-preview 排在第 28 名，ELO 1478 分；

小米 mimo-v2.5-pro 排在第 29 名，ELO 1474 分；

月之暗面 kimi-k2.7-code 排在第 30 名，ELO 1473 分。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1 —🇨🇳 kimi-k3 预发布月之暗面1682 ±133776$3 / $151.05M

2 —🇺🇸 claude-opus-5-highAnthropic1673 ±142392$5 / $251M

3 ↓1🇺🇸 claude-fable-5Anthropic1629 ±105721$10 / $501M

4 ↓1🇺🇸 gpt-5.6-sol-xhigh (codex-harness)OpenAI1625 ±105242$5 / $301.05M

5 ↓1🇨🇳 glm-5.2 (max)智谱1587 ±95700$1.4 / $4.41M

6 ↑1🇺🇸 claude-opus-4-8-thinkingAnthropic1568 ±88247$5 / $251M

7 ↑1🇺🇸 claude-opus-4-7Anthropic1559 ±711050$5 / $251M

8 ↑1🇺🇸 claude-opus-4-7-thinkingAnthropic1557 ±711661$5 / $251M

9 ↓3🇺🇸 grok-4.5SpaceXAI1549 ±113314$2 / $6500K

10 ↑1🇺🇸 claude-opus-4-6-thinkingAnthropic1546 ±613607$5 / $251M

— 以下为 Top 10 外的国产模型 —

15 ↓1🇨🇳 seed-2.1-pro-preview 预发布字节跳动1529 ±104916N/AN/A

18 ↓3🇨🇳 glm-5.1智谱1518 ±86737$1.4 / $4.4202.8K

19🇨🇳 hy3腾讯1518 ±171490$0.13 / $0.53262.1K

20🇨🇳 qwen3.7-max-20260517阿里1517 ±87267$1.48 / $4.431M

21 ↓3🇨🇳 kimi-k2.6月之暗面1510 ±89263$0.95 / $4262.1K

智能体榜

智能体榜头部由 Claude Fable 5 (High) 以 12.72% 的净提升度守住榜首，该模型的可控性也达到了 14.62%，位列全榜第一。

OpenAI 的 GPT 5.6 Sol (xHigh) 以 10.12% 的净提升度紧随其后排在第 2，Anthropic 的 Claude Opus 4.8 (Thinking) 排在第 3 名。

国产模型 kimi-k3 排名第 4，净提升度 9.71%，其任务确认成功率达到了 14.0%，是榜单所有头部模型中最高的表现，任务完成反馈表现突出。

国产模型在智能体榜中覆盖了从头部到中下游的大量席位，梯队十分完整：

月之暗面 kimi-k3 排名第 4 名，净提升度 9.71%，任务确认成功率 14.0%，是排名最高的国产智能体模型；

智谱 GLM 5.2 (Max) 排名第 10 名，净提升度 6.5%，任务确认成功率 8.65%；

智谱 GLM 5.1 排名第 17 名，净提升度 1.43%；

阿里 Qwen3.7 Max 排名第 19 名，净提升度 0.09%；

阿里 Qwen3.7 Plus 排名第 21 名，净提升度 0.76%，工具幻觉率仅 0.3% 为全榜最低；

月之暗面 Kimi K2.7 Code 排名第 22 名，净提升度 1.02%；

深度求索 DeepSeek V4 Pro 排名第 24 名，净提升度 1.19%；

腾讯 Hy3 排名第 25 名，净提升度 2.23%；

月之暗面 Kimi K2.6 排名第 26 名，净提升度 2.57%；

Minimax Minimax M3 排名第 27 名，净提升度 3.1%；

小米 Mimo V2.5 Pro 排名第 28 名，净提升度 3.39%。

排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数

1 —🇺🇸 Claude Fable 5 (High)Anthropic12.72% ±2.0%10.67%23.94%14.62%23549

2 —🇺🇸 GPT 5.6 Sol (xHigh)OpenAI10.12% ±1.69%7.25%23.53%9.71%15991

3 —🇺🇸 Claude Opus 4.8 (Thinking)Anthropic9.75% ±1.39%8.9%19.42%9.78%34147

4 —🇨🇳 Kimi K3月之暗面9.71% ±1.52%14.0%20.3%6.52%11490

5 —🇺🇸 Claude Sonnet 5 (High)Anthropic8.66% ±1.89%8.14%16.88%6.2%24359

6 ↓2🇺🇸 GPT 5.5 (xHigh)OpenAI8.41% ±0.87%6.65%11.08%8.18%40667

7 ↑1🇺🇸 Claude Opus 4.7 (Thinking)Anthropic7.94% ±1.24%5.67%11.55%8.62%35151

8 ↑1🇺🇸 Claude Opus 4.7Anthropic7.67% ±1.25%4.97%12.48%8.95%35672

9 ↓1🇺🇸 GPT 5.5 (High)OpenAI7.61% ±0.81%6.2%9.8%8.77%65859

10 ↑1🇨🇳 GLM 5.2 (Max)智谱6.5% ±1.0%8.65%12.94%4.71%38221

— 以下为 Top 10 外的国产模型 —

17 —🇨🇳 GLM 5.1智谱1.43% ±0.78%1.12%0.99%0.15%57532

19 —🇨🇳 Qwen3.7 Max阿里0.09% ±1.07%1.84%5.73%0.02%15992

AI 生图 & AI 视频榜

AI 生图榜头部格局稳定，OpenAI 的 gpt-image-2 (medium) 以 1385 分继续稳居第一，字节跳动 seedream-5.0-pro 作为排名最高的国产模型，排在第 11 名，ELO 1231 分，整体表现处于中上游位置。

AI 视频榜方面，谷歌 gemini-omni-flash 守住榜首，字节跳动 dreamina-seedance-2.0-720p 排在第 2 名，阿里 happyhorse-1.0 排在第 4 名，国产视频模型直接占据了前 4 名中的两个席位，后续字节跳动、阿里、MiniMax 的多款模型也分布在榜单中下游，形成了完整的国产视频模型梯队，竞争力处于全球第一梯队。

整体来看，本周 Arena 榜单最大的突破来自国产模型在前端开发赛道登顶，kimi-k3 同时在代码榜和智能体榜进入头部序列，体现出国产模型在工程开发、智能体实际应用场景的快速进步。Anthropic 大量新模型集中入榜后，头部竞争的胶着程度进一步提升，后续几周的分数和排名变化值得持续关注。

下周随着更多国产新模型完成数据积累更新，有望在更多细分榜单中看到新的突破。
