STORY · 事件已收束

GLM-5.3在CyberGym测试中得分84.5%

6 个精选信源 · 6 篇报道持续 1最新动态 21天前
最新进展

GLM-5.3 在 ExploitBench 上仅得 54.4%,落后于 Mythos 5 的 78.0%。

DIGEST

事件全貌

AI 综述 · 更新于 19天前

智谱发布 GLM-5.3,沿用 GLM-5.2 的 743B 基座模型,通过扩展后训练提升能力。编程能力较前代提升 50%,在 Terminal Bench 3.0 得分从 4.6 升至 28.3,取得开源第一并接近 Claude Fable 5。

在网络安全方面,GLM-5.3 在 CyberGym 测试中得分 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),在白盒代码审查等安全任务中表现持平 Mythos 5。模型经安全数据训练,在 269 个项目中找到 2,436 个漏洞,部分漏洞存在长达 40 年。

模型已通过 Z.ai API、GLM Coding Plan 和 ZCode 提供,权重将在安全审查完成后于两周内开源。最新报道补充,GLM-5.3 在 ExploitBench 上仅得 54.4%,落后于 Mythos 5 的 78.0%。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

6 条公开报道 · 官方一手 3 条 · 最新在前
  1. GLM-5.3:中国实验室如何跟上前沿步伐
    Nathan Lambert:Interconnects(RSS)官方一手

    Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。

  2. 智谱 GLM-5.3 在漏洞发现等网络防御测试中超越 Anthropic Mythos 5
    X:Rohan Paul (@rohanpaul_ai)

    智谱发布 GLM-5.3,基于 743B 基座模型后训练,在漏洞发现等网络防御测试中超越 Anthropic Mythos 5。其 Terminal Bench 3.0 从 4.6 升至 28.3,DeepSWE 达 66.9;CyberGym 得分 84.5%,但 ExploitBench 仅 54.4%,落后于 Mythos 5 的 78.0%。

  3. 智谱发布 GLM-5.3,称其为最强开源权重编程模型
    The Decoder:AI News(RSS)

    智谱发布 GLM-5.3,与上一代 GLM-5.2 共享相同基座,全部提升来自扩展的后训练,并称其为最强开源权重编程模型,智能体任务进步最大。该模型经安全数据训练,在 269 个项目中找到 2,436 个漏洞,部分漏洞存在长达 40 年。GLM-5.3 现可通过 GLM Coding Plan 使用,权重将在安全审查完成后于两周内开源。

  4. Z.ai 发布 GLM-5.3:不重训基座模型,复杂编程与长程任务能力显著提升
    MarkTechPost(RSS)

    Z.ai 发布 GLM-5.3,沿用 GLM-5.2 的 743B 基座模型,全部提升来自扩展的后训练。Terminal-Bench 3.0 得分从 4.6 升至 28.3,CyberGym 达 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。模型已通过 Z.ai API、GLM Coding Plan 和 ZCode 提供,权重预计在发布约两周后公开。

  5. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
    智谱:研究(网页内嵌数据)官方一手精选

    智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一。模型在白盒代码审查等安全任务中表现持平Mythos 5,并在CyberGym测试中得分84.5%。GLM-5.3即日起上线ZCode、AutoClaw等工具,API很快上线,完整模型权重将在两周内开源。

  6. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
    公众号:智谱(GLM)官方一手精选

    智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。