# AI 大模型周榜：代码榜榜首易主，claude-opus-4-7-thinking 登顶

- 来源：IT之家（RSS）
- 发布时间：2026-07-14 09:44
- AIHOT 分数：48
- AIHOT 链接：https://aihot.virxact.com/items/cmrk1insc02m6biw208mayzee
- 原文链接：https://www.ithome.com/0/976/076.htm

## AI 摘要

Arena 平台发布 7 月 6 日至 12 日 AI 大模型周榜。代码榜榜首易主，claude-opus-4-7-thinking 以 ELO 1553 分升至第一，原榜首 claude-fable-5 跌至第五。综合榜 claude-fable-5 以 1505 分蝉联，前五名均为 Anthropic 模型。国产模型中，qwen3.7-max-preview 综合榜排名第 17（1475 分），代码榜排名第 12（1526 分），均为国产最高。数学榜 claude-fable-5 登顶，高难度指令榜 claude-opus-4-6-thinking 升至第一。

## 正文

IT之家 7 月 13 日消息，Arena（arena.ai）平台发布了最新一期 AI 大模型周榜，本期覆盖 2026 年 7 月 6 日 ~2026 年 7 月 12 日。

本周核心变化为代码榜榜首易主，claude-opus-4-7-thinking 从第二升至第一，原榜首 claude-fable-5 跌落至第五；综合榜榜首仍由 claude-fable-5 蝉联，头部均为 Anthropic 模型占据。国产模型整体处于中上游梯队，排名相对稳定。

综合榜

本周综合榜格局基本稳定，claude-fable-5 继续占据榜首位置，ELO 分数 1505 ，较上周下降 4 分；第二至第五名依次为 claude-opus-4-6-thinking 、 claude-opus-4-7-thinking 、 claude-opus-4-6 、 claude-opus-4-7 ，前五名均来自 Anthropic，分数差距均在 30 分以内，在统计误差范围内视为并列。头部模型中仅有 muse-spark-1.1 从第五下降一位至第六，排名变动较小。

国产模型仅有三款进入前 30 ，整体排名保持稳定：

qwen3.7-max-preview 排名最高，位列第 17 名，ELO 1475 分，排名无变化；

glm-5.1 位列第 25 名，ELO 1472 分，排名下滑 3 名；

ernie-5.1 位列第 30 名，ELO 1468 分，排名持平。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1🇺🇸 claude-fable-5Anthropic1505 ±87252$10 / $501M

2🇺🇸 claude-opus-4-6-thinkingAnthropic1504 ±458968$5 / $251M

3🇺🇸 claude-opus-4-7-thinkingAnthropic1503 ±446183$5 / $251M

4🇺🇸 claude-opus-4-6Anthropic1498 ±462650$5 / $251M

5🇺🇸 claude-opus-4-7Anthropic1494 ±447222$5 / $251M

6 ↓1🇺🇸 muse-spark-1.1Meta1490 ±103750$1.25 / $4.25N/A

7 ↑1🇺🇸 muse-sparkMeta1488 ±613573N/AN/A

8🇺🇸 gpt-5.6-sol-xhighOpenAI1486 ±141740$5 / $301.05M

9 ↓1🇺🇸 gemini-3-pro谷歌1486 ±441308$2 / $121.05M

10 ↓3🇺🇸 gemini-3.1-pro-preview谷歌1485 ±478561$2 / $121.05M

— 以下为 Top 10 外的国产模型 —

17🇨🇳 qwen3.7-max-preview阿里1475 ±103719$1.25 / $3.751M

25 ↓3cn glm-5.1智谱 1472±526549$1.40 / $4.40202.8K

30🇨🇳 ernie-5.1百度1468 ±536321N/AN/A

代码榜

本周代码榜发生榜首变动，原第二名 claude-opus-4-7-thinking 上升一位登顶榜首，ELO 分数为 1553 ；原榜首 claude-fable-5 大幅下滑 4 位至第五名，ELO 分数从 1563 降至 1546 ，跌幅达 17 分。

第二名至第四名依次为 claude-opus-4-6-thinking 、 claude-opus-4-7 、 claude-opus-4-6 ，头部前 5 名依旧均被 Anthropic 旗下模型包揽，分数差距在 10 分以内，视为并列水平。

grok-4.5 排名上升 5 位至第 14 名，是榜单中涨幅最大的模型之一。

国产模型共有五款上榜，具体排名分数如下：

qwen3.7-max-preview 排名最高，位列第 12 名，ELO 1526 分，较上周下降 2 位；

glm-5.1 位列第 18 名，ELO 1521 分；

mimo-v2.5-pro 位列第 23 名，ELO 1518 分，较上周下降 6 位；

kimi-k2.6 位列第 25 名，ELO 1514 分，较上周上升 3 位；

ernie-5.1 位列第 26 名，ELO 1514 分，较上周上升 3 位；

glm-5.2 (max) 位列第 27 名，ELO 1513 分，较上周下降 6 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文

1 ↑1🇺🇸 claude-opus-4-7-thinkingAnthropic1553 ±713130$5 / $251M

2 ↑1🇺🇸 claude-opus-4-6-thinkingAnthropic1550 ±615192$5 / $251M

3 ↑1🇺🇸 claude-opus-4-7Anthropic1550 ±713419$5 / $251M

4 ↑1🇺🇸 claude-opus-4-6Anthropic1547 ±617275$5 / $251M

5 ↓4🇺🇸 claude-fable-5Anthropic1546 ±142036$10 / $501M

6 ↑1🇺🇸 claude-opus-4-8-thinkingAnthropic1537 ±87366$5 / $251M

7 ↓1🇺🇸 claude-opus-4-8Anthropic1533 ±87507$5 / $251M

8 ↑1🇺🇸 muse-spark-1.1Meta1530 ±181122$1.25 / $4.25N/A

9 ↓1🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77620$5 / $25200K

10🇺🇸 gpt-5.6-sol-xhighOpenAI1528 ±29449$5 / $301.05M

— 以下为 Top 10 外的国产模型 —

12🇨🇳 qwen3.7-max-preview阿里1526 ±181125$1.25 / $3.751M

18🇨🇳 glm-5.1智谱 1521±87397$1.40 / $4.40202.8K

23🇨🇳 mimo-v2.5-pro小米1518 ±710474$0.44 / $0.871.05M

25🇨🇳 kimi-k2.6月之暗面1514 ±79903$0.95 / $4262.1K

26🇨🇳 ernie-5.1百度1514 ±710049N/AN/A

27cn glm-5.2 (max)智谱 1513±103727$1.40 / $4.401M

数学榜

本周 claude-fable-5 从第二名上升至榜首，ELO 分数大幅提升 31 分至 1548 ，原榜首 claude-opus-4-6-thinking 下降一位至第二名，分数保持 1518 不变。

国产模型中 ernie-5.1 排名上升 2 位至第 14 名，qwen3.7-max-preview 下降一位至第 11 名，整体分数差距在误差范围内。

高难度指令榜

本周榜单头部发生换位，claude-opus-4-6-thinking 从第二升至第一，claude-fable-5 从第一降至第二，二者分数均为 1532 ，在误差范围内并列。排名变动幅度均在 3 位以内，整体格局稳定。

国产模型 qwen3.7-max-preview 排名第 19 位，分数微涨 1 分；glm-5.1 排名第 21；glm-5.2 (max) 排名第 30 位，分数无变化。

多轮对话榜

本周 claude-fable-5 从榜首跌至第四，排名下降 3 位，claude-opus-4-7 上升 1 位登顶榜首，头部格局小幅变动。muse-spark-1.1 从第 13 位大幅升至第 8 位，涨幅最为明显。国产模型 qwen3.7-max-preview 排名第 22 位，分数微涨 1 分。

本周榜单整体来看，Anthropic 旗下模型仍占据绝大多数头部位置，在综合、代码等多个榜单中包揽前几名，美国厂商整体优势依旧明显。国产模型整体稳定在中上游区间，qwen3.7-max-preview 在多个榜单中保持领先位置，kimi-k2.6 、 ernie-5.1 在代码榜实现排名上升。下周可关注新入围模型表现以及国产模型是否能进一步冲击头部位置。
