IT之家(RSS)
65AI 编辑部评分,满分 100

AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼

2026-08-10 17:02· 24分钟前
AI 导读

Arena 发布 2026 年第 32 周 AI 大模型盲测排名,阿里 qwen3.8-max 以 ELO 1497 分杀入综合榜第 6 名,Meta 新模型 muse-spark-1.2 (xHigh) 首秀位列第 4。

IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。

国产模型在综合榜已有多款进入中上游,具体排名如下:

  • 阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;

  • 月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;

  • 阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-fable-5Anthropic1507 ±619390$10 / $501M
2-claude-opus-4-6-thinkingAnthropic1505 ±469336$2.5 / $12.51M
3-claude-opus-4-7-thinkingAnthropic1502 ±457018$5 / $251M
4新上榜muse-spark-1.2 (xHigh)Meta1498 ±132057$1.25 / $4.25N/A
5↓ 1claude-opus-4-6Anthropic1497 ±373158$2.5 / $12.51M
6新上榜qwen3.8-maxAlibaba1497 ±94662$2 / $61M
7↓ 2claude-opus-4-7Anthropic1493 ±458135$5 / $251M
8↓ 2claude-opus-5-highAnthropic1493 ±614902$5 / $251M
9↓ 2claude-opus-5-maxAnthropic1488 ±87137$5 / $251M
10↓ 1muse-sparkMeta1488 ±613476N/AN/A
— 以下为 Top 10 外的国产模型 —
14↓ 2kimi-k3-maxMoonshot1485 ±79861N/AN/A
23↓ 2qwen3.7-max-previewAlibaba1475 ±103695$1.48 / $4.431M

代码榜

代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。

国产模型在代码榜已有多款进入前 30,具体如下:

  • 月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;

  • 阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;

  • 阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;

  • 小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;

  • 智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-fable-5Anthropic1553 ±95234$10 / $501M
2-claude-opus-4-7-thinkingAnthropic1552 ±616303$5 / $251M
3-claude-opus-4-6-thinkingAnthropic1551 ±618015$2.5 / $12.51M
4-claude-opus-4-6Anthropic1547 ±620444$2.5 / $12.51M
5-claude-opus-4-7Anthropic1546 ±616534$5 / $251M
6↑ 2kimi-k3-maxMoonshot1542 ±122611N/AN/A
7↓ 1claude-opus-4-8-thinkingAnthropic1535 ±710509$2.5 / $12.51M
8新上榜qwen3.8-maxAlibaba1532 ±161411$2 / $61M
9↑ 1muse-spark-1.1Meta1532 ±104199$1.25 / $4.25N/A
10↓ 1claude-opus-4-5-20251101-
thinking-32k
Anthropic1530 ±77603$5 / $25200K
— 以下为 Top 10 外的国产模型 —
17↓ 1qwen3.7-max-previewAlibaba1526 ±181112$1.48 / $4.431M
28-mimo-v2.5-proXiaomi1519 ±713199$0.44 / $0.871.05M
30↓ 3glm-5.1Z.ai1517 ±710330$1.4 / $4.4202.8K

前端开发榜

本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。

国产模型具体排名如下:

  • 月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;

  • 阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;

  • 智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;

  • 深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-opus-5-maxAnthropic1686 ±114029$5 / $251M
2-kimi-k3-maxMoonshot1675 ±124372$3 / $151.05M
3-claude-opus-5-highAnthropic1670 ±105145$5 / $251M
4新上榜qwen3.8-maxAlibaba1667 ±161980$2 / $61M
5↓ 1claude-fable-5Anthropic1630 ±96816$10 / $501M
6↓ 1gpt-5.6-sol-xhigh
(codex-harness)
OpenAI1620 ±96903$5 / $301.05M
7↓ 1glm-5.2-maxZ.ai1588 ±96924$1.4 / $4.41M
8新上榜deepseek-v4-flash-highDeepSeek1581 ±151931$0.14 / $0.281.05M
9↓ 1claude-opus-4-8-thinkingAnthropic1565 ±89549$2.5 / $12.51M
10↓ 1claude-opus-4-7Anthropic1560 ±712398$5 / $251M
— 以下为 Top 10 外的国产模型 —
21↓ 3seed-2.1-pro-previewBytedance1524 ±96069N/AN/A
24↓ 1hy3Tencent1522 ±151729$0.13 / $0.53262.1K
25↓ 3qwen3.7-max-20260517Alibaba1516 ±88044$1.48 / $4.431M
26↓ 2glm-5.1Z.ai1515 ±87853$1.4 / $4.4202.8K
27↓ 2kimi-k2.6Moonshot1510 ±89261$0.95 / $4262.1K

智能体榜

智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。

国产模型在智能体榜已有多款进入前 30,具体如下:

  • 月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;

  • 智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;

  • 深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;

  • 智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性
1↑ 2Claude Opus 5 (High)Anthropic11.99% ±1.37%16.04% ±2.79%19.46% ±5.19%10.29% ±2.51%
2↓ 1Claude Fable 5 (High)Anthropic11.66% ±2.39%11.47% ±4.46%22.56% ±8.25%10.01% ±4.93%
3↓ 1Claude Opus 5 (Max)Anthropic11.19% ±1.62%16.36% ±3.11%19.07% ±6.03%5.8% ±3.1%
4-GPT 5.6 Sol (xHigh)OpenAI10.28% ±1.72%9.06% ±3.48%22.7% ±6.42%8.42% ±3.5%
5-Kimi K3 (Max)Moonshot10.08% ±1.07%14.97% ±2.09%19.68% ±3.85%7.45% ±1.97%
6-Claude Opus 4.8 (Thinking)Anthropic9.35% ±1.7%8.81% ±2.9%21.46% ±5.38%8.5% ±3.08%
7↑ 1GPT 5.5 (xHigh)OpenAI8.45% ±0.99%5.24% ±2.08%13.56% ±3.55%8.19% ±1.8%
8↑ 1Claude Opus 4.7 (Thinking)Anthropic8.33% ±1.32%6.65% ±2.76%11.87% ±4.59%8.61% ±2.72%
9↓ 2Claude Sonnet 5 (High)Anthropic7.46% ±2.15%5.56% ±4.29%14.8% ±7.65%5.14% ±4.55%
10↑ 1Claude Opus 4.7Anthropic7.32% ±1.36%5.55% ±2.85%10.72% ±4.45%9.54% ±2.7%
— 以下为 Top 10 外的国产模型 —
12-GLM 5.2 (Max)Z.ai6.75% ±0.9%9.21% ±1.83%12.39% ±3.21%5.62% ±1.59%
21新上榜Deepseek V4 Flash (High)
(20260731)
DeepSeek2.84% ±1.1%8.53% ±2.54%0.46% ±3.64%0.43% ±2.19%
23-Kimi K2.7 CodeMoonshot0.69% ±1.94%4.12% ±4.08%2.36% ±6.68%1.92% ±4.37%
24↓ 2GLM 5.1Z.ai0.35% ±0.77%1.06% ±1.72%0.72% ±2.5%0.76% ±1.4%
25-Qwen3.7 MaxAlibaba0.16% ±0.88%0.24% ±2.11%5.07% ±2.72%0.21% ±1.55%
26-DeepSeek V4 ProDeepSeek0.33% ±0.86%2.74% ±2.16%3.35% ±2.78%0.3% ±1.54%
27↑ 2Kimi K2.6Moonshot0.48% ±2.16%2.28% ±4.11%2.12% ±6.8%1.66% ±4.49%
30↓ 3Hy3Tencent1.12% ±1.42%2.2% ±3.04%3.7% ±4.91%9.01% ±2.6%

AI 生图榜

本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-gpt-image-2 (medium)OpenAI1380 ±569194N/AN/A
2新上榜grok-imagine-image-2.0 (low)SpaceXAI1320 ±122722N/AN/A
3↓ 1reve-2.1Reve1302 ±87598N/AN/A
4↓ 1muse-imageMeta1283 ±714510N/AN/A
5↓ 1reve-2.0Reve1270 ±614650N/AN/A
6↓ 1gemini-3.1-flash-image
(nano-banana-2) [web-search]
Google1263 ±527910N/AN/A
7新上榜qwen-image-3.0-proAlibaba1258 ±103735N/AN/A
8↓ 2seedream-5.0-proBytedance1257 ±526510N/AN/A
9↓ 2mai-image-2.5Microsoft AI1256 ±544940N/AN/A
10↓ 2gemini-3.1-flash-lite-image
(nano-banana-2-lite)
Google1251 ±616419N/AN/A
— 以下为 Top 10 外的国产模型 —
16↓ 2qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612026N/AN/A
29↓ 4hunyuan-image-3.0Tencent1151 ±3173366N/AN/A

AI 视频榜

AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-gemini-omni-flashGoogle1513 ±1214571N/AN/A
2-dreamina-seedance-2.0-720pBytedance1479 ±1147067N/AN/A
3-muse-videoMeta1458 ±152160N/AN/A
4新上榜minimax-h3MiniMax1455 ±191060N/AN/A
5↓ 1happyhorse-1.0Alibaba-ATH1428 ±1321979N/AN/A
6↓ 1sora-2-proOpenAI1365 ±844543$0 / $0.3N/A
7-veo-3.1-audioGoogle1364 ±1413687$0 / $0.4N/A
8↓ 2veo-3.1-audio-1080pGoogle1363 ±1024846N/AN/A
9↓ 1veo-3.1-fast-audioGoogle1362 ±1139301$0 / $0.15N/A
10↓ 1veo-3.1-fast-audio-1080pGoogle1358 ±1025637N/AN/A
— 以下为 Top 10 外的国产模型 —
13↓ 2wan2.7-t2vAlibaba1347 ±915246N/AN/A
16↓ 1wan2.6-t2vAlibaba1330 ±941706N/AN/A
17↓ 1seedance-v1.5-proBytedance1256 ±775653N/AN/A
19↓ 2wan2.5-t2v-previewAlibaba1252 ±1025895N/AN/A
28↓ 1hailuo-2.3MiniMax1202 ±772127N/AN/A
29↓ 1hailuo-02-proMiniMax1198 ±139365N/AN/A
30↓ 1seedance-v1-proBytedance1190 ±1112117N/AN/A

本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。

来源:IT之家(RSS) · ithome.com

AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼

IT之家(RSS)·2026-08-10 17:02·24分钟前
AI 导读

Arena 发布 2026 年第 32 周 AI 大模型盲测排名,阿里 qwen3.8-max 以 ELO 1497 分杀入综合榜第 6 名,Meta 新模型 muse-spark-1.2 (xHigh) 首秀位列第 4。

IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。

国产模型在综合榜已有多款进入中上游,具体排名如下:

  • 阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;

  • 月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;

  • 阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-fable-5Anthropic1507 ±619390$10 / $501M
2-claude-opus-4-6-thinkingAnthropic1505 ±469336$2.5 / $12.51M
3-claude-opus-4-7-thinkingAnthropic1502 ±457018$5 / $251M
4新上榜muse-spark-1.2 (xHigh)Meta1498 ±132057$1.25 / $4.25N/A
5↓ 1claude-opus-4-6Anthropic1497 ±373158$2.5 / $12.51M
6新上榜qwen3.8-maxAlibaba1497 ±94662$2 / $61M
7↓ 2claude-opus-4-7Anthropic1493 ±458135$5 / $251M
8↓ 2claude-opus-5-highAnthropic1493 ±614902$5 / $251M
9↓ 2claude-opus-5-maxAnthropic1488 ±87137$5 / $251M
10↓ 1muse-sparkMeta1488 ±613476N/AN/A
— 以下为 Top 10 外的国产模型 —
14↓ 2kimi-k3-maxMoonshot1485 ±79861N/AN/A
23↓ 2qwen3.7-max-previewAlibaba1475 ±103695$1.48 / $4.431M

代码榜

代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。

国产模型在代码榜已有多款进入前 30,具体如下:

  • 月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;

  • 阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;

  • 阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;

  • 小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;

  • 智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-fable-5Anthropic1553 ±95234$10 / $501M
2-claude-opus-4-7-thinkingAnthropic1552 ±616303$5 / $251M
3-claude-opus-4-6-thinkingAnthropic1551 ±618015$2.5 / $12.51M
4-claude-opus-4-6Anthropic1547 ±620444$2.5 / $12.51M
5-claude-opus-4-7Anthropic1546 ±616534$5 / $251M
6↑ 2kimi-k3-maxMoonshot1542 ±122611N/AN/A
7↓ 1claude-opus-4-8-thinkingAnthropic1535 ±710509$2.5 / $12.51M
8新上榜qwen3.8-maxAlibaba1532 ±161411$2 / $61M
9↑ 1muse-spark-1.1Meta1532 ±104199$1.25 / $4.25N/A
10↓ 1claude-opus-4-5-20251101-
thinking-32k
Anthropic1530 ±77603$5 / $25200K
— 以下为 Top 10 外的国产模型 —
17↓ 1qwen3.7-max-previewAlibaba1526 ±181112$1.48 / $4.431M
28-mimo-v2.5-proXiaomi1519 ±713199$0.44 / $0.871.05M
30↓ 3glm-5.1Z.ai1517 ±710330$1.4 / $4.4202.8K

前端开发榜

本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。

国产模型具体排名如下:

  • 月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;

  • 阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;

  • 智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;

  • 深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-claude-opus-5-maxAnthropic1686 ±114029$5 / $251M
2-kimi-k3-maxMoonshot1675 ±124372$3 / $151.05M
3-claude-opus-5-highAnthropic1670 ±105145$5 / $251M
4新上榜qwen3.8-maxAlibaba1667 ±161980$2 / $61M
5↓ 1claude-fable-5Anthropic1630 ±96816$10 / $501M
6↓ 1gpt-5.6-sol-xhigh
(codex-harness)
OpenAI1620 ±96903$5 / $301.05M
7↓ 1glm-5.2-maxZ.ai1588 ±96924$1.4 / $4.41M
8新上榜deepseek-v4-flash-highDeepSeek1581 ±151931$0.14 / $0.281.05M
9↓ 1claude-opus-4-8-thinkingAnthropic1565 ±89549$2.5 / $12.51M
10↓ 1claude-opus-4-7Anthropic1560 ±712398$5 / $251M
— 以下为 Top 10 外的国产模型 —
21↓ 3seed-2.1-pro-previewBytedance1524 ±96069N/AN/A
24↓ 1hy3Tencent1522 ±151729$0.13 / $0.53262.1K
25↓ 3qwen3.7-max-20260517Alibaba1516 ±88044$1.48 / $4.431M
26↓ 2glm-5.1Z.ai1515 ±87853$1.4 / $4.4202.8K
27↓ 2kimi-k2.6Moonshot1510 ±89261$0.95 / $4262.1K

智能体榜

智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。

国产模型在智能体榜已有多款进入前 30,具体如下:

  • 月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;

  • 智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;

  • 深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;

  • 智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性
1↑ 2Claude Opus 5 (High)Anthropic11.99% ±1.37%16.04% ±2.79%19.46% ±5.19%10.29% ±2.51%
2↓ 1Claude Fable 5 (High)Anthropic11.66% ±2.39%11.47% ±4.46%22.56% ±8.25%10.01% ±4.93%
3↓ 1Claude Opus 5 (Max)Anthropic11.19% ±1.62%16.36% ±3.11%19.07% ±6.03%5.8% ±3.1%
4-GPT 5.6 Sol (xHigh)OpenAI10.28% ±1.72%9.06% ±3.48%22.7% ±6.42%8.42% ±3.5%
5-Kimi K3 (Max)Moonshot10.08% ±1.07%14.97% ±2.09%19.68% ±3.85%7.45% ±1.97%
6-Claude Opus 4.8 (Thinking)Anthropic9.35% ±1.7%8.81% ±2.9%21.46% ±5.38%8.5% ±3.08%
7↑ 1GPT 5.5 (xHigh)OpenAI8.45% ±0.99%5.24% ±2.08%13.56% ±3.55%8.19% ±1.8%
8↑ 1Claude Opus 4.7 (Thinking)Anthropic8.33% ±1.32%6.65% ±2.76%11.87% ±4.59%8.61% ±2.72%
9↓ 2Claude Sonnet 5 (High)Anthropic7.46% ±2.15%5.56% ±4.29%14.8% ±7.65%5.14% ±4.55%
10↑ 1Claude Opus 4.7Anthropic7.32% ±1.36%5.55% ±2.85%10.72% ±4.45%9.54% ±2.7%
— 以下为 Top 10 外的国产模型 —
12-GLM 5.2 (Max)Z.ai6.75% ±0.9%9.21% ±1.83%12.39% ±3.21%5.62% ±1.59%
21新上榜Deepseek V4 Flash (High)
(20260731)
DeepSeek2.84% ±1.1%8.53% ±2.54%0.46% ±3.64%0.43% ±2.19%
23-Kimi K2.7 CodeMoonshot0.69% ±1.94%4.12% ±4.08%2.36% ±6.68%1.92% ±4.37%
24↓ 2GLM 5.1Z.ai0.35% ±0.77%1.06% ±1.72%0.72% ±2.5%0.76% ±1.4%
25-Qwen3.7 MaxAlibaba0.16% ±0.88%0.24% ±2.11%5.07% ±2.72%0.21% ±1.55%
26-DeepSeek V4 ProDeepSeek0.33% ±0.86%2.74% ±2.16%3.35% ±2.78%0.3% ±1.54%
27↑ 2Kimi K2.6Moonshot0.48% ±2.16%2.28% ±4.11%2.12% ±6.8%1.66% ±4.49%
30↓ 3Hy3Tencent1.12% ±1.42%2.2% ±3.04%3.7% ±4.91%9.01% ±2.6%

AI 生图榜

本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-gpt-image-2 (medium)OpenAI1380 ±569194N/AN/A
2新上榜grok-imagine-image-2.0 (low)SpaceXAI1320 ±122722N/AN/A
3↓ 1reve-2.1Reve1302 ±87598N/AN/A
4↓ 1muse-imageMeta1283 ±714510N/AN/A
5↓ 1reve-2.0Reve1270 ±614650N/AN/A
6↓ 1gemini-3.1-flash-image
(nano-banana-2) [web-search]
Google1263 ±527910N/AN/A
7新上榜qwen-image-3.0-proAlibaba1258 ±103735N/AN/A
8↓ 2seedream-5.0-proBytedance1257 ±526510N/AN/A
9↓ 2mai-image-2.5Microsoft AI1256 ±544940N/AN/A
10↓ 2gemini-3.1-flash-lite-image
(nano-banana-2-lite)
Google1251 ±616419N/AN/A
— 以下为 Top 10 外的国产模型 —
16↓ 2qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612026N/AN/A
29↓ 4hunyuan-image-3.0Tencent1151 ±3173366N/AN/A

AI 视频榜

AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出
上下文
1-gemini-omni-flashGoogle1513 ±1214571N/AN/A
2-dreamina-seedance-2.0-720pBytedance1479 ±1147067N/AN/A
3-muse-videoMeta1458 ±152160N/AN/A
4新上榜minimax-h3MiniMax1455 ±191060N/AN/A
5↓ 1happyhorse-1.0Alibaba-ATH1428 ±1321979N/AN/A
6↓ 1sora-2-proOpenAI1365 ±844543$0 / $0.3N/A
7-veo-3.1-audioGoogle1364 ±1413687$0 / $0.4N/A
8↓ 2veo-3.1-audio-1080pGoogle1363 ±1024846N/AN/A
9↓ 1veo-3.1-fast-audioGoogle1362 ±1139301$0 / $0.15N/A
10↓ 1veo-3.1-fast-audio-1080pGoogle1358 ±1025637N/AN/A
— 以下为 Top 10 外的国产模型 —
13↓ 2wan2.7-t2vAlibaba1347 ±915246N/AN/A
16↓ 1wan2.6-t2vAlibaba1330 ±941706N/AN/A
17↓ 1seedance-v1.5-proBytedance1256 ±775653N/AN/A
19↓ 2wan2.5-t2v-previewAlibaba1252 ±1025895N/AN/A
28↓ 1hailuo-2.3MiniMax1202 ±772127N/AN/A
29↓ 1hailuo-02-proMiniMax1198 ±139365N/AN/A
30↓ 1seedance-v1-proBytedance1190 ±1112117N/AN/A

本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。

来源:IT之家(RSS)· ithome.com