杂务说明:我目前在外旅行,所以这篇帖子无法录制配音。编者注——我在邮件发出后,补充了关于中国数据行业的第 5 点。
今天,Z.ai 发布了他们的 GLM-5.3 模型,目前仅在编程套餐中提供,即将上线其 API,并将在两周后上线 Hugging Face(开放权重)。这个模型看起来非常出色,分数提升幅度相当惊人。在许多基准测试中,该模型已经超越了月之暗面的 Kimi K3,在某些基准上甚至超过了 Claude Fable 5 或 GPT-5.6-Sol。

以下是更完整的对比:

这使得该模型基本处于智能体编程基准的前沿,而参数量仅约 750B——只有 Kimi K3 的三分之一!Z.ai 的博客文章相当直白,开头就是一句大胆的话:
我们为 GLM-5.3 所做的全部工作,就是扩展后训练。
GLM-5.3 与 GLM-5.2 使用相同的基础模型,但后训练大幅扩展。如果做一个粗略的概括,Z.ai 似乎在後训练方面有优势,而 Kimi 更像是预训练的杰作。这次发布之后,有很多讨论在问:中国怎么能跟得这么紧?这么小的模型怎么能媲美美国领先的公开模型?这些结果是真的吗?
最简单的解释是,Z.ai 非常擅长他们做的事情——值得记住的是,他们研究这条模型路线的时间比业内几乎任何人都长。以下是 GLM 模型的简要历史。
智谱AI成立——2019年
GLM(通用语言模型)——2021年3月——由清华大学数据挖掘/知识工程组 THUDM 发布。权重
GLM-130B——2022年8月——规模化版本。GLM-130B 至 GLM-4 的技术报告——权重
ChatGLM——2023年3月14日——首个聊天版本。权重
ChatGLM2——2023年6月25日——权重
ChatGLM3——2023年10月27日——权重
GLM-4——2024年1月16日——更名为 GLM;随后于6月发布开放权重的 GLM-4-9B。权重
GLM-5——2026年2月11日——最新主要代际。权重
GLM 5.2 于今年 6 月 22 日发布,当时引起了不小的轰动——发布数周后,我经常听到我认识的 AI 研究人员说,他们仍在使用这个模型,因为它的速度快(有些人在内部集群上部署该模型,以获得比公开服务更快的速度)和简洁(作为一个没有回滚等机制的模型,在开发前沿 AI 系统时尤其好用)。GLM-5.2 整体上确实配得上这股热度。
我自己也一直在经历某种类似的否认心态,心想“他们到底是怎么做到这一点的?这些模型肯定没有看起来那么好。”令人有些不适的是,美国公司拥有如此压倒性的资源领先优势,却似乎无法在能力上拉开差距。常见的解释是知识蒸馏,我对此写过很多,但我认为这不是主要因素。关于这一点,最近有一篇论文展示了从前沿模型中提取推理轨迹的简单方法——这正是中国实验室绝对可以大规模使用的东西。我不明白为什么美国实验室没有更快地修补这种行为;相反,他们跑去向政府寻求政策帮助。这在我看来说不通。
Z.ai 的博客文章直截了当,与以强化学习为主导的训练体系相吻合。他们说他们使用了“更多的环境、更多样化的任务,以及在这些任务上投入了更多的训练算力。”你不可能简单“蒸馏”出强化学习环境、大规模运行这些环境的基础设施,或者将它们有效混合的算法。
那么,如果不是蒸馏,中国实验室是怎么做到的呢?他们是在刷榜吗?一个被广泛接受的“刷榜”定义是让模型专注于测试集,从而使真实世界表现与纸面分数产生显著差异。决定因素更多是宏观层面的,而非技术层面的(是的,技术细节当然重要,但不同实验室之间的技术细节更难区分):
Z.ai 的发布周期很可能以天计算,而非像 OpenAI 或 Anthropic 那样以月计算。OpenAI 和 Anthropic 拥有远比 Z.ai 和月之暗面更优秀的内部模型,这几乎是板上钉钉的事。尽管如此,这些美国公司往往需要数月时间才能将模型公之于众,这在前沿模型的采用决策上极大地利好中国实验室。简而言之——中国实验室把美国实验室用于发布前测试的时间全部用来在基准测试上继续攀爬(SpaceXAI 在这方面很可能与中国实验室的做法更为接近)。由于进展速度如此之快,这很可能是决定中国实验室能否留在前沿的最大因素。迄今为止,这对美国实验室来说在经济上尚可接受,因为它们的模型需求依然旺盛。
随着构建大语言模型的实验室内部模型自我改进循环不断加速,如果这些反馈循环中的任何一个需要用户数据,这种更快的发布周期可能会极大地利好中国实验室,让它们的产品在下一个性能大幅超越的模型问世之前拥有更长的生命周期,从而削弱对其模型的需求。
这些显然就是业内许多人担忧的竞赛动态。在如此多的实验室都在领先能力范围内构建前沿模型的情况下,很难看到这种局面在短期内有所缓和。
没错,Z.ai 可能比 OpenAI 或 Anthropic 更看重公开基准测试。这些基准测试,例如在 Artificial Analysis Intelligence Index 或类似聚合平台上取得高分,会直接影响它们的股价。它们在很多方面都需要这样做,才能持续融资并维持团队士气,因为作为挑战美国巨头的草根逆袭者,这是一个绝佳的故事。微妙的基准优化(benchmaxxing)并不一定源于绝望或类似的压力。这在数量惊人的实验室中已是行业标准。许多公司的数据采集策略就是在自己落后的基准测试上购买数据。
Z.ai 并没有为了刷榜而把 GLM-5.3 搞到“烤焦”的程度(至少不是故意的,而且他们会去核查这一点)。眼下每一家实验室都在处理扩展强化学习时遇到的棘手问题。Anthropic 的 Opus 5 和 Sonnet 5 模型尽管基准测试分数高得惊人,但口碑却相当两极分化。整个行业都处于同一条船上,所以有些模型权重用起来就是比另一些顺手,但他们在发布博客里公布的基准分数是实打实的。
GLM-5.3 很可能比 Claude Fable 或 GPT Sol 更偏向窄众模型。GPT-5.2 发布时,除了智能体编程之外,评价也是褒贬不一。与此同时,OpenAI 和 Anthropic 支撑着规模极其庞大的企业,这些企业对模型有数不清的用例。这就是作为处于采用曲线更早期阶段的公司的好处——你可以瞄准最有价值的用例。在后训练阶段,稍微少在意一些东西,会让最终模型的组装容易得多。我这话稍微有点夸张,因为据报道 Z.ai 凭借强劲的本地化部署业务,年经常性收入(ARR)已经达到 10 亿美元。
同样,旗舰版 GLM 模型也一直不具备视觉能力。纯文本模式确实有助于 Z.ai 拿到更有竞争力的分数,但这也是一个竞争更激烈的领域。另一端的例子则是像 Inkling-Small 这样的模型,它被设计成全模态(omnimodal)模型。
(补充)强化学习数据产业正在中国起飞。我们关注的许多消息源和传闻渠道都在不断提到,中国的数据产业正在起飞——很大程度上是由美国数据公司向中国模型实验室销售所推动的。这可能表现为中国实验室购买许多美国前沿实验室所使用的同类强化学习环境,并更早地发布下游经过强化学习训练的模型。我们对这个市场的规模和影响力仍然存在很大的误差范围,但它无疑正变得日益重要。
Z.ai 是一家技术极为精湛的大语言模型机构——其算力利用效率很可能远超 OpenAI 和 Anthropic。这一点值得反复强调。这帮人非常擅长自己所做的事情。该公司与清华大学关系极为密切,而清华汇聚了许多中国最顶尖的计算机科学家。这个庞大且充满干劲的人才库,对他们的成功而言,与对任何西方同行一样,都是核心要素。
总体来看,他们用 GLM 系列模型所执行的似乎是一个非常完善的策略。恭喜发布!我很期待权重公开,这样我就能做更深入的测试了(我倾向于使用 Fireworks 或 Baseten 这类美国开源权重推理服务)。
这是向着强大网络能力在经济领域不可避免的普及所迈出的又一步。Z.ai 已经承认了这一点,并表示:
GLM-5.3 是我们迄今为止在网络安全任务上能力最强的模型。它在漏洞发现、漏洞利用分析以及复杂的多步骤安全任务方面带来了显著提升。这些能力可以帮助防御方更早识别弱点、验证风险并加速修复。
这些能力同时也带来了明确的双重用途风险。因此,我们采取分阶段发布的策略。选定的安全合作伙伴将首先在受控环境中评估 GLM-5.3。随后将提供更广泛的访问权限和 API 服务。一旦必要的安全评估和发布准备工作完成,我们将发布 GLM-5.3 的完整模型权重。
他们接着承认,他们正在通过请求分类器和思维链监控(在模型对齐之上)来监控其平台上的推理过程。关键在于细节,而目前尚不清楚每家 AI 实验室在这方面的执行水平如何。能力的扩散取决于最低的共同标准。
归根结底,当真正的开放权重模型来临时,这类安全措施几乎无关紧要。如果不是 GLM-5.3,那也会是另一个模型。具备这些能力的模型规模正在随时间缩小,变得更容易修改和部署(可能没有安全防护)。智谱(Z.ai)做了一些正确的事情,包括推动更多漏洞发现和主动管理,但任何单一公司都远无法独自应对这一问题。
我们需要由政府或行业联盟主导的产业级指导,立即为这一转变在所有软件领域做好准备。