Nathan Lambert:Interconnects(RSS)
同事件
67AI 编辑部评分,满分 100

GLM-5.2:开放智能体的阶跃变化

2026-06-22 22:52· 55天前· Nathan Lambert
AI 导读

Z.ai 于 6 月 13 日向 GLM Coding Plan 成员发布 GLM-5.2,6 月 16 日开源 MIT 许可权重。该模型在 Arena 智能体排行榜上成为唯一与 OpenAI 和 Anthropic 最新模型匹敌的开放模型,匹配 Opus 4.8 无思考模式;在 Design Arena 中甚至超越 Claude Fable。作者认为这是自 DeepSeek R1 以来最受关注的开放模型发布,GLM-5.2 是首个在编码工具中作为通用智能体表现合格的开放权重模型。从 Claude Opus 4.5 发布(2025 年 11 月 24 日)到 GLM-5.2 发布(2026 年 6 月 16 日)间隔约 6.8 个月。

正文 · AI 翻译

一个我一直在密切关注的能力阈值。

内森·兰伯特

2026年6月22日

文章语音播报

-9:27

杂务说明:继上周我发布“博客状态”更新,提到付费功能略有增加后,现在是个好时机提醒大家,我提供团体订阅服务,订阅席位越多折扣越大。此外,我今天还发表了一篇关于终端智能体开放RL配方的新论文,详情请点击此处阅读。

大约一周多前,当AI界仍因那令人震惊的出口限制——实际上等同于封禁Claude Fable 5——而动荡不安时,智谱(Z.ai)发布了他们的最新模型GLM-5.2。该模型于6月13日(周六)异常地向GLM编程计划成员开放。这是一种不寻常的发布做法,通常当AI模型在周末发布时,背后都有奇怪的原因(最著名的例子是Llama 4)。¹ 在这种情况下,智谱似乎是想利用“Anthropic反开放科学”这一时代情绪(因其对AI研究人员的无声限制)来抢占先机。在过去一两年里,中国的开源权重实验室一直在抓住每一个类似的机会进行这种轻松的市场营销。

GLM-5.2,按照业界常见的命名惯例,看起来像是继广受欢迎的GLM-5.1模型之后的一次增量更新。目前,月之暗面(Moonshot AI,Kimi模型的创造者)和智谱(Z.ai,GLM模型的创造者)已经巩固了在AI研究人员中最受喜爱的开源权重模型这一声誉市场的顶端地位。随后发生的事情,揭示了追踪AI模型时的一个常见教训:往往小版本号的模型也能跨越有意义的用户体验阈值。基准测试和训练上的微小改变,就能开启一系列全新的应用场景。

随后,围绕 GLM-5.2 的 hype 如暗流般缓慢积聚。官方采用 MIT 许可的模型权重和发布博客在最初推出三天后,即 6 月 16 日上线。人们可以罗列许多技术细节,例如强劲的基准测试分数、智谱 AI 使用的广受欢迎的 RL 框架(SLIME)、始终建议在最大思考强度下使用该模型等等,但最初的发布博客通常不是关注的重点。你可以等待并观察生态系统的反应,来判断它是否名副其实。毕竟,如今的基准测试已半死不活。

6 月 16 日之后,涌现出一系列社区基准测试,显示 GLM-5.2 的结果超出预期。Arena 的智能体排行榜显示,它是唯一能与 OpenAI 和 Anthropic 最新模型(值得注意的是,在无思考模式下,Opus 4.8 的表现与 GLM-5.2 的最大模式相当)一较高下的开放模型。这只是 GLM-5.2 在众多评估中碾压 Gemini 的案例之一,但这已是另一个话题了。在社区(尤其是实际设计师群体)中评价褒贬不一的 Design Arena 甚至显示,GLM-5.2 击败了 Claude Fable 本身——那个最近被禁的 hype 制造机!

我尊重的 AI 评论界和研究员圈子中,几乎每个人在亲自使用后都对这款模型赞不绝口。社区讨论如此聚焦于一个开放模型发布的情况,此前只出现过一次——DeepSeek R1。这个比较并非我轻率做出,当我将 Kimi K2 的发布比作“DeepSeek 时刻”时,GLM-5.2 已经远远超越了那个时刻。Kimi K2 令人印象深刻之处在于,开放模型性能的巨大飞跃似乎可以来自中国的任何地方。而 GLM-5.2 所迈出的这一步,更像是 AI 进步的一扇单向门。

Anthropic 在 Claude Code 支撑下创纪录的收入增长率,很大程度上得益于它是目前最优秀的模型,也是唯一能真正胜任这项任务的模型。GLM-5.2 是众多即将推出的开源权重模型中首个提供可靠替代方案的产品。这种情形与 DeepSeek R1 当年的表现如出一辙——当时它证明了资源远不如对手的开源权重实验室,同样能够复现 OpenAI 凭借 o1 引领的链式推理模型。随着 AI 系统日益复杂、构建成本急剧攀升(涉及工具、集成框架以及大规模模型权重),GLM-5.2 这一时刻的出现并非理所当然。

关键在于,GLM-5.2 是第一款在编码框架中作为通用智能体使用时感觉恰到好处的开源权重模型。我个人早就该尝试一些近期发布的同类模型,比如 Kimi K2.7 或 GLM-5.1,但这次的热度实在让我无法忽视。我让它通过 Fireworks 的 API 在 Claude Code 中帮我制作后训练课程的内容(设置过程非常简单)。过程中遇到一些小问题,比如 Claude Code 框架或我的仓库文档试图向模型发送图片,这会导致 Fireworks API 在该会话中失效——不得不手动清除上下文。总体而言,模型的能力立刻让人感觉对路,我还在琢磨该使用哪个框架和推理提供商。

更多热议内容,你可以看看 Z.ai 创始人告诉 Elon “开源权重 Fable 能力将在 2027 年第一季度之前实现”,Vercel 的 CEO 表示“@zai_org 的 GLM-5.2 在编码方面的表现让我由衷赞叹,甚至感到震惊。这改变了游戏规则”,此外还有来自我深表敬重的业内人士以及一些新面孔的众多评论。

那么,这是一款优秀的模型,它把我们带到了什么境地?

当前有多种趋势在同时发挥作用。首先,让我们从开源与闭源模型的能力差距这一基础问题入手。我曾撰文指出,如果开源模型在 Claude Code 中达到 Opus 4.5 的水平,我预计从 2026 年初左右开始会出现“使用量激增”。现在,这一时刻已经到来。随着 Claude Opus 4.5 于 2025 年 11 月 24 日发布,到 GLM-5.2 于 2026 年 6 月 16 日发布,两者之间的时间差为 204 天——大约 6.8 个月。这正好落入了许多人声称的美国闭源实验室与中国开源对手之间 6 到 9 个月的性能差距区间。

写下这些时,我感到惊讶。随着美国实验室在过去大约一年里如此迅速地提升算力,我曾预期性能差距会随时间拉大。在这一发展轨迹中,一个非常重要的节点将是 Claude Fable 5 的发布——与 Claude Opus 系列模型相比,它更依赖于规模扩展,因此也依赖于最先进的 GPU。不过,这并非一个令人满意的答案。要持续解析这一发展轨迹,需要比我在这篇指向性文章中所能容纳的更多细节。

这最直接的意义在于,那些追求 token 最大化的组织将面临更为严峻的定价压力,从而将 Anthropic 的收入推向新高。有人预测 Anthropic 无法实现其预测的年度经常性收入(ARR)数字,但我认为这并未充分考虑到这些模型的真实需求以及不可避免的增长。这个模型的存在对开源模型经济来说是一个巨大的利好。所有像 Fireworks、Together、Thinky(通过 Tinker)、Prime Intellect 以及其他销售开源模型推理或微调服务的厂商,都刚刚迎来了另一个转折点。

这些影响要扩散到更广泛的经济领域(以及应用场景)还需要很长时间。工作流程正变得越来越复杂,人们开始使用不同的模型来分别进行规划、主要编码和子智能体调度。我预计这股热潮还会继续升温,而且,就在我写这篇文章的周日晚上,我已经能预见到,周一的媒体和市场反应可能会像 DeepSeek R1 发布时那样轰动。在 Anthropic 的旗舰模型(进而也是美国的旗舰模型)仍被禁用的背景下,这种扩散无异于一把刺向经济命脉的利刃。GLM-5.2 正被给予时间,去蚕食前沿实验室的经济腹地,而后者本应全力推进那些只有绝对前沿模型才能支撑的、更高利润、更高收入的领域。

这种经济层面的担忧,与人工智能领域反复被讲述的故事如出一辙,因此尚不清楚它何时才会真正引起重视。

在我看来,与人工智能发展轨迹更核心相关的讨论,是关于开放模型的监管与控制。我认为,廉价智能的广泛传播是一件经济上的好事,我们的默认立场应该是为开放模型喝彩。但这款模型的发布日期,将使其在人工智能权力格局的认知版图中,永远与 Claude Fable——进而与 Claude Mythos——联系在一起。我们正处于这样一个节点:美国政府认为 Mythos 级别的模型能力发布出去不够安全,而中国的模型制造商却在向所有人开放的能力上高歌猛进。

这些趋势线之间未必存在因果关系,因为我们不知道 GLM-5.2 与其前代产品相比在网络安全方面的具体表现,但能力水平肯定是相关的。如果情况没有任何改变,这就指向了一种可能性:美国政府可能会判定某个特定中国开放权重模型对公众不安全。当然,这里还存在许多其他潜在情景,但显而易见的是,我们在梳理这些情景、准备我们的基础设施以及向社会传达信息方面,还有很多工作要做。

要让决策者理解如何管理日益强大的开放模型,并为他们描绘出这样一幅世界图景,光靠我一个人是远远不够的。我们还有数年的 AI 进步之路要走,英伟达的下一代芯片已在生产中,算法也在不断推陈出新。对开放模型倡导者来说,这条路似乎很窄,但我们必须想办法让它们变得可行,这样性能的巨大飞跃才不会只属于封闭模型。

我完全理解,想象一个可公开访问的“神话级”模型会让人感到恐惧,但如果现在开放模型被禁止,而两三年后只有一两家公司手中的封闭模型性能提升了 10 倍甚至 100 倍,我认为我们将面临更大的问题。

1

中国实验室发布模型的速度之快,一直让我印象深刻。我从多个实验室了解到,模型训练完成后,将权重公开上传到 HuggingFace 的时间可以用小时而非天来衡量。这至少已经有所放缓,因为他们现在需要准备为更广泛的推理市场提供服务。

2

还有一个需要更多讨论的问题:即使是封闭模型,例如 Mythos 预览版,也经常落入未经授权的用户手中或被越狱。因此,在访问权限上,开放与封闭的二分法并非完全非黑即白。

关于本文的讨论

暂无帖子

准备了解更多?

来源:Nathan Lambert:Interconnects(RSS) · interconnects.ai

事件后续 · 1查看事件全部 →

GLM-5.2:开放智能体的阶跃变化

Nathan Lambert:Interconnects(RSS)·2026-06-22 22:52·55天前·Nathan Lambert
AI 导读

Z.ai 于 6 月 13 日向 GLM Coding Plan 成员发布 GLM-5.2,6 月 16 日开源 MIT 许可权重。该模型在 Arena 智能体排行榜上成为唯一与 OpenAI 和 Anthropic 最新模型匹敌的开放模型,匹配 Opus 4.8 无思考模式;在 Design Arena 中甚至超越 Claude Fable。作者认为这是自 DeepSeek R1 以来最受关注的开放模型发布,GLM-5.2 是首个在编码工具中作为通用智能体表现合格的开放权重模型。从 Claude Opus 4.5 发布(2025 年 11 月 24 日)到 GLM-5.2 发布(2026 年 6 月 16 日)间隔约 6.8 个月。

正文 · AI 翻译

一个我一直在密切关注的能力阈值。

内森·兰伯特

2026年6月22日

文章语音播报

-9:27

杂务说明:继上周我发布“博客状态”更新,提到付费功能略有增加后,现在是个好时机提醒大家,我提供团体订阅服务,订阅席位越多折扣越大。此外,我今天还发表了一篇关于终端智能体开放RL配方的新论文,详情请点击此处阅读。

大约一周多前,当AI界仍因那令人震惊的出口限制——实际上等同于封禁Claude Fable 5——而动荡不安时,智谱(Z.ai)发布了他们的最新模型GLM-5.2。该模型于6月13日(周六)异常地向GLM编程计划成员开放。这是一种不寻常的发布做法,通常当AI模型在周末发布时,背后都有奇怪的原因(最著名的例子是Llama 4)。¹ 在这种情况下,智谱似乎是想利用“Anthropic反开放科学”这一时代情绪(因其对AI研究人员的无声限制)来抢占先机。在过去一两年里,中国的开源权重实验室一直在抓住每一个类似的机会进行这种轻松的市场营销。

GLM-5.2,按照业界常见的命名惯例,看起来像是继广受欢迎的GLM-5.1模型之后的一次增量更新。目前,月之暗面(Moonshot AI,Kimi模型的创造者)和智谱(Z.ai,GLM模型的创造者)已经巩固了在AI研究人员中最受喜爱的开源权重模型这一声誉市场的顶端地位。随后发生的事情,揭示了追踪AI模型时的一个常见教训:往往小版本号的模型也能跨越有意义的用户体验阈值。基准测试和训练上的微小改变,就能开启一系列全新的应用场景。

随后,围绕 GLM-5.2 的 hype 如暗流般缓慢积聚。官方采用 MIT 许可的模型权重和发布博客在最初推出三天后,即 6 月 16 日上线。人们可以罗列许多技术细节,例如强劲的基准测试分数、智谱 AI 使用的广受欢迎的 RL 框架(SLIME)、始终建议在最大思考强度下使用该模型等等,但最初的发布博客通常不是关注的重点。你可以等待并观察生态系统的反应,来判断它是否名副其实。毕竟,如今的基准测试已半死不活。

6 月 16 日之后,涌现出一系列社区基准测试,显示 GLM-5.2 的结果超出预期。Arena 的智能体排行榜显示,它是唯一能与 OpenAI 和 Anthropic 最新模型(值得注意的是,在无思考模式下,Opus 4.8 的表现与 GLM-5.2 的最大模式相当)一较高下的开放模型。这只是 GLM-5.2 在众多评估中碾压 Gemini 的案例之一,但这已是另一个话题了。在社区(尤其是实际设计师群体)中评价褒贬不一的 Design Arena 甚至显示,GLM-5.2 击败了 Claude Fable 本身——那个最近被禁的 hype 制造机!

我尊重的 AI 评论界和研究员圈子中,几乎每个人在亲自使用后都对这款模型赞不绝口。社区讨论如此聚焦于一个开放模型发布的情况,此前只出现过一次——DeepSeek R1。这个比较并非我轻率做出,当我将 Kimi K2 的发布比作“DeepSeek 时刻”时,GLM-5.2 已经远远超越了那个时刻。Kimi K2 令人印象深刻之处在于,开放模型性能的巨大飞跃似乎可以来自中国的任何地方。而 GLM-5.2 所迈出的这一步,更像是 AI 进步的一扇单向门。

Anthropic 在 Claude Code 支撑下创纪录的收入增长率,很大程度上得益于它是目前最优秀的模型,也是唯一能真正胜任这项任务的模型。GLM-5.2 是众多即将推出的开源权重模型中首个提供可靠替代方案的产品。这种情形与 DeepSeek R1 当年的表现如出一辙——当时它证明了资源远不如对手的开源权重实验室,同样能够复现 OpenAI 凭借 o1 引领的链式推理模型。随着 AI 系统日益复杂、构建成本急剧攀升(涉及工具、集成框架以及大规模模型权重),GLM-5.2 这一时刻的出现并非理所当然。

关键在于,GLM-5.2 是第一款在编码框架中作为通用智能体使用时感觉恰到好处的开源权重模型。我个人早就该尝试一些近期发布的同类模型,比如 Kimi K2.7 或 GLM-5.1,但这次的热度实在让我无法忽视。我让它通过 Fireworks 的 API 在 Claude Code 中帮我制作后训练课程的内容(设置过程非常简单)。过程中遇到一些小问题,比如 Claude Code 框架或我的仓库文档试图向模型发送图片,这会导致 Fireworks API 在该会话中失效——不得不手动清除上下文。总体而言,模型的能力立刻让人感觉对路,我还在琢磨该使用哪个框架和推理提供商。

更多热议内容,你可以看看 Z.ai 创始人告诉 Elon “开源权重 Fable 能力将在 2027 年第一季度之前实现”,Vercel 的 CEO 表示“@zai_org 的 GLM-5.2 在编码方面的表现让我由衷赞叹,甚至感到震惊。这改变了游戏规则”,此外还有来自我深表敬重的业内人士以及一些新面孔的众多评论。

那么,这是一款优秀的模型,它把我们带到了什么境地?

当前有多种趋势在同时发挥作用。首先,让我们从开源与闭源模型的能力差距这一基础问题入手。我曾撰文指出,如果开源模型在 Claude Code 中达到 Opus 4.5 的水平,我预计从 2026 年初左右开始会出现“使用量激增”。现在,这一时刻已经到来。随着 Claude Opus 4.5 于 2025 年 11 月 24 日发布,到 GLM-5.2 于 2026 年 6 月 16 日发布,两者之间的时间差为 204 天——大约 6.8 个月。这正好落入了许多人声称的美国闭源实验室与中国开源对手之间 6 到 9 个月的性能差距区间。

写下这些时,我感到惊讶。随着美国实验室在过去大约一年里如此迅速地提升算力,我曾预期性能差距会随时间拉大。在这一发展轨迹中,一个非常重要的节点将是 Claude Fable 5 的发布——与 Claude Opus 系列模型相比,它更依赖于规模扩展,因此也依赖于最先进的 GPU。不过,这并非一个令人满意的答案。要持续解析这一发展轨迹,需要比我在这篇指向性文章中所能容纳的更多细节。

这最直接的意义在于,那些追求 token 最大化的组织将面临更为严峻的定价压力,从而将 Anthropic 的收入推向新高。有人预测 Anthropic 无法实现其预测的年度经常性收入(ARR)数字,但我认为这并未充分考虑到这些模型的真实需求以及不可避免的增长。这个模型的存在对开源模型经济来说是一个巨大的利好。所有像 Fireworks、Together、Thinky(通过 Tinker)、Prime Intellect 以及其他销售开源模型推理或微调服务的厂商,都刚刚迎来了另一个转折点。

这些影响要扩散到更广泛的经济领域(以及应用场景)还需要很长时间。工作流程正变得越来越复杂,人们开始使用不同的模型来分别进行规划、主要编码和子智能体调度。我预计这股热潮还会继续升温,而且,就在我写这篇文章的周日晚上,我已经能预见到,周一的媒体和市场反应可能会像 DeepSeek R1 发布时那样轰动。在 Anthropic 的旗舰模型(进而也是美国的旗舰模型)仍被禁用的背景下,这种扩散无异于一把刺向经济命脉的利刃。GLM-5.2 正被给予时间,去蚕食前沿实验室的经济腹地,而后者本应全力推进那些只有绝对前沿模型才能支撑的、更高利润、更高收入的领域。

这种经济层面的担忧,与人工智能领域反复被讲述的故事如出一辙,因此尚不清楚它何时才会真正引起重视。

在我看来,与人工智能发展轨迹更核心相关的讨论,是关于开放模型的监管与控制。我认为,廉价智能的广泛传播是一件经济上的好事,我们的默认立场应该是为开放模型喝彩。但这款模型的发布日期,将使其在人工智能权力格局的认知版图中,永远与 Claude Fable——进而与 Claude Mythos——联系在一起。我们正处于这样一个节点:美国政府认为 Mythos 级别的模型能力发布出去不够安全,而中国的模型制造商却在向所有人开放的能力上高歌猛进。

这些趋势线之间未必存在因果关系,因为我们不知道 GLM-5.2 与其前代产品相比在网络安全方面的具体表现,但能力水平肯定是相关的。如果情况没有任何改变,这就指向了一种可能性:美国政府可能会判定某个特定中国开放权重模型对公众不安全。当然,这里还存在许多其他潜在情景,但显而易见的是,我们在梳理这些情景、准备我们的基础设施以及向社会传达信息方面,还有很多工作要做。

要让决策者理解如何管理日益强大的开放模型,并为他们描绘出这样一幅世界图景,光靠我一个人是远远不够的。我们还有数年的 AI 进步之路要走,英伟达的下一代芯片已在生产中,算法也在不断推陈出新。对开放模型倡导者来说,这条路似乎很窄,但我们必须想办法让它们变得可行,这样性能的巨大飞跃才不会只属于封闭模型。

我完全理解,想象一个可公开访问的“神话级”模型会让人感到恐惧,但如果现在开放模型被禁止,而两三年后只有一两家公司手中的封闭模型性能提升了 10 倍甚至 100 倍,我认为我们将面临更大的问题。

1

中国实验室发布模型的速度之快,一直让我印象深刻。我从多个实验室了解到,模型训练完成后,将权重公开上传到 HuggingFace 的时间可以用小时而非天来衡量。这至少已经有所放缓,因为他们现在需要准备为更广泛的推理市场提供服务。

2

还有一个需要更多讨论的问题:即使是封闭模型,例如 Mythos 预览版,也经常落入未经授权的用户手中或被越狱。因此,在访问权限上,开放与封闭的二分法并非完全非黑即白。

关于本文的讨论

暂无帖子

准备了解更多?

来源:Nathan Lambert:Interconnects(RSS)· interconnects.ai

事件后续 · 1查看事件全部 →