# 国产大模型年中上新收官，Kimi K3与GLM-5.3并列60分领跑

- 来源：阑夕 (@foxshuo)
- 发布时间：2026-08-20 19:04
- AIHOT 分数：48
- AIHOT 链接：https://aihot.virxact.com/items/cmt1gdldv02u6rokx3ohov29p
- 原文链接：https://x.com/foxshuo/status/2090394600448094326

## AI 摘要

国产大模型年中上新收官，Kimi K3与GLM-5.3以60分并列T1阵营，紧咬GPT-5.6和Claude Opus 5。GLM-5.3仅靠后训练迭代，不动基座架构。T2档为58分Qwen3.8 Max、53分DeepSeek-V4-Pro；Qwen全系今年在Hugging Face被下载超20亿次。

## 正文

随着智谱的GLM-5.3终于也在AA竞技场开榜，年中这一轮国产模型的上新，基本算是告一段落了。

若以AA竞技场的分数为参照标准，且全部按提交的满功率版本来算，目前各家厂牌的期中考试成绩如下：

Kimi K3和GLM-5.3并列60分，是中国唯二能够挤进T1阵营里的模型，死死咬住了GPT-5.6和Claude Opus 5。

当然Kimi K3是已经发布超过1个月的「老」模型了，可见含金量之足，月之暗面应该是今年惊喜最大的AI公司了，路线修正得太及时了。

按照智谱创始人唐杰的说法，GLM-5.3是故意在控制变量，只通过后训练来做迭代，不动基座、架构和参数，看看能有多少提升，也很满意新模型的表现。

T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B，也是兼顾性能与经济性的高竞争区间，凡尔登绞肉机的市场。

阿里的Qwen3.8这一代其实口碑不错，非但Max版本重回开源，27B版本更是被评价为「Opus at home」，在Hugging Face，Qwen全系列模型今年被下载了20亿次以上，比第2名到第5名加起来还多。

DeepSeek-V4-Pro到底出了什么问题，现在没人知道，虽说有搭配专武（Harness极简模式）的找补，但我觉得葬AI说得没毛病，一言不合就堆定语，是车圈陋习，咱大模型行业不要学。

再说T3分段，这里已经接近上桌吃饭的底线了，能看到45分的MiniMax-M3、43分的MiMo-V2.5-Pro、42分的Hy3，主打一个量大管饱的供应，够用就行，要啥自行车呢。

MiniMax今年算是垫给了智谱，M3押注的原生多模路线，在商业价值上还是比不过纯Coding，最后还是靠视频模型找回了场子，字节比智谱好打你们敢信？

在DeepSeek-V4-Flash发布之前，小米的MiMo系列模型其实在OpenRouter上当了小半年的性价比之王，很适合用来跑自动化工具链之类的低价值高频次任务，也已经在财报里帮雷总做市值管理了。

腾讯的Hy3是姚顺雨的第一个作品，打响了翻盘的第一步，而且真做到了中美两开花，内有扶WokrBuddy上位的功劳，外有开打OpenRouter价格战的成绩，均衡双修。

再往下数，T4的分段就很接近不可言说的深海了，蚂蚁的Ling 3.0 Flash是38分，美团的LongCat 2.0是34分，阶跃的Step 3.7 Flash是31分，已经不太适用通用场景了，只能用在特定的细分领域。

比如它们都突出一个「快」字，主攻高速模型的品类，聪不聪明你别管，就问有没有秒回吧，在不追求解题效果的工业化任务里是有价值的。

什么，你问22分的百度文心ERNIE 5.0是不是位于马里亚纳海沟？自从拉了这坨大的之后，百度就没有再把新发布的ERNIR5.1上传AA竞技场了，不参战就是没胜负，精髓。
